Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Регрессия с искаженными данными
Попытка рассчитать количество посещений из демографии и обслуживания. Данные очень искажены. Гистограммы: qq графики (слева - лог): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityи serviceявляются факторными переменными. Я получаю низкое значение p *** для всех переменных, но я также получаю низкий r-квадрат 0,05. Что я должен делать? Будет ли работать …

1
Мера «отклонения» для Пуассона с нулевым надуванием или отрицательного бинома с нулевым надуванием?
Масштабное отклонение, определяемое как D = 2 * (логарифмическая вероятность насыщенной модели минус логарифмическая вероятность подобранной модели), часто используется как мера соответствия модели в модели GLM. Объясненное отклонение в процентах, определенное как [D (нулевая модель) - D (подходящая модель)] / D (нулевая модель), также иногда используется в качестве аналога GLM …

1
Какова политика развертывания в статье АльфаГо?
Бумага здесь . Политика развертывания ... - это линейная политика softmax, основанная на быстрых, постепенно вычисляемых локальных функциях на основе шаблонов ... Я не понимаю, что такое политика развертывания и как она связана с политикой сети выбора хода. Любое более простое объяснение?

3
Оптимизация стохастических компьютерных моделей
Это сложная тема для меня, потому что поиск слов «оптимизация» и «стохастик» в поиске почти автоматически приводит к поиску стохастической оптимизации. Но что я действительно хочу знать, так это то, какие методы существуют для оптимизации компьютерных моделей, когда выходные данные компьютерной модели являются стохастическими, то есть недетерминированными? Например, если вы …

3
Еще один центральный вопрос о предельной теореме
Пусть - последовательность независимых случайных величин Бернулли с Установите Покажите, что сходится по распределению к стандартной нормальной переменной при стремлении к бесконечности.{Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\}P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}.Sn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2}SnBnSnBn\frac{S_n}{B_n}ZZZnnn Я пытаюсь использовать CLT Ляпунова, поэтому нам нужно показать, что существует такой , что δ>0δ>0\delta>0limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. Поэтому установите δ=1δ=1\delta=1∑k=1nE∣∣Xk−k−1∣∣3=∑k=1n(1k−3k2+4k3−2k4)∑k=1nE|Xk−k−1|3=∑k=1n(1k−3k2+4k3−2k4) \sum_{k=1}^{n}E\left|X_k-k^{-1}\right|^{3}=\sum_{k=1}^{n} \left(\frac{1}{k}-\frac{3}{k^2}+\frac{4}{k^3}-\frac{2}{k^4}\right) и B3n=(∑k=1n1k−1k2)(∑k=1n1k−1k2)−−−−−−−−−−−−⎷Bn3=(∑k=1n1k−1k2)(∑k=1n1k−1k2) B_n^3=\left( …

1
Q-обучение с нейронной сетью как функция приближения
Я пытаюсь использовать нейронную сеть, чтобы приблизить Q-значение в Q-Learning, как в вопросах о Q-Learning с использованием нейронных сетей . Как было предложено в первом ответе, я использую линейную функцию активации для выходного слоя, в то время как я все еще использую функцию активации сигмоида в скрытых слоях (2, хотя …

1
Насколько отличается регрессия вектора поддержки по сравнению с SVM?
Я знаю основы SVM и SVR, но до сих пор не понимаю, как проблема нахождения гиперплоскости, которая максимизирует запас, вписывается в SVR. Во-вторых, я прочитал кое-что о используемом в качестве предела терпимости в SVR. Что это означает?εϵ\epsilon В-третьих, есть ли разница между параметрами решающей функции, используемыми в SVM и SVR?

3
Как модель скип-граммы Word2Vec генерирует выходные векторы?
У меня проблемы с пониманием скип-грамматической модели алгоритма Word2Vec. В непрерывном пакете слов легко увидеть, как контекстные слова могут «вписаться» в нейронную сеть, поскольку вы в основном усредняете их после умножения каждого из представлений кодирования с одним горячим кодированием на входную матрицу W. Однако в случае скип-граммы вы получаете вектор …

2
Почему Байесовский классификатор идеальный классификатор?
Считается идеальным случаем, когда структура вероятности, лежащая в основе категорий, известна полностью. Почему с помощью байесовского классификатора мы достигаем наилучшей производительности, которая может быть достигнута? Что является формальным доказательством / объяснением этого? Как мы всегда используем байесовский классификатор в качестве эталона для сравнения производительности всех других классификаторов.

2
Деревья решений и регрессия - Могут ли прогнозируемые значения выходить за пределы диапазона данных обучения?
Когда речь идет о деревьях решений, может ли прогнозируемое значение лежать вне диапазона обучающих данных? Например, если диапазон набора обучающих данных целевой переменной составляет 0-100, когда я генерирую свою модель и применяю ее к чему-то другому, могут ли мои значения быть -5? или 150? Учитывая, что я понимаю регрессию дерева …

3
Какую функцию потерь следует использовать для получения двоичного классификатора с высокой точностью или высокой степенью отзыва?
Я пытаюсь сделать детектор объектов, которые встречаются очень редко (в изображениях), планируя использовать двоичный классификатор CNN, применяемый в скользящем окне с измененным размером. Я построил сбалансированные положительно-отрицательные обучающие и тестовые наборы (кстати, правильно ли это делать в таком случае?), И классификатор отлично справляется с тестовым набором с точки зрения точности. …

1
Как проверить, не является ли кросс-ковариационная матрица ненулевой?
Предпосылки моего исследования : В выборках Гиббса , где мы образец (переменные интересы) и из и соответственно, где и являются - мерными случайными векторами. Мы знаем, что процесс обычно делится на два этапа:XXXYYYP(X|Y)P(X|Y)P(X|Y)P(Y|X)P(Y|X)P(Y|X)XXXYYYkkk Период выгорания, где мы отбрасываем все образцы. Обозначим образцы как и .X1∼XtX1∼XtX_1\sim X_tY1∼YtY1∼YtY_1\sim Y_t Период после прожигания, …

1
Алгоритм: бинарный поиск при неопределенных значениях
Мне нужен алгоритм для бинарного поиска, когда тест на каждом шаге может дать неправильный результат. Справочная информация: мне нужно расположить студентов на наиболее подходящем из 12 уровней сложности. Текущий подход - грубая сила, и он задает 60 вопросов с 4 вариантами ответов с несколькими вариантами ответов, увеличивая сложность, останавливаясь после …
11 algorithms 

2
Самый надежный пароль
У меня есть приложение, защищенное четырехзначным PIN-кодом, и пользователь получил пять попыток войти в систему, прежде чем учетная запись заблокирована. Теперь один из моих клиентов хочет «усилить» безопасность и отстаивать другое решение: шесть-значный PIN- НЕТ "одной цифры рядом друг с другом": например, 11 3945 или 39 55 94 НЕТ «трехзначных …

3
Почему термин смещения в SVM оценивается отдельно, а не в дополнительном измерении в векторе признаков?
Оптимальная гиперплоскость в SVM определяется как: w⋅x+b=0,w⋅x+b=0,\mathbf w \cdot \mathbf x+b=0, где представляет порог. Если у нас есть некоторое отображение которое отображает входное пространство на некоторое пространство , мы можем определить SVM в пространстве , где оптимальной гиперплоскостью будет:bbbϕϕ\mathbf \phiZZZZZZ w⋅ϕ(x)+b=0.w⋅ϕ(x)+b=0.\mathbf w \cdot \mathbf \phi(\mathbf x)+b=0. Однако мы всегда можем …
11 svm  threshold 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.