Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Многомерные биологические временные ряды: VAR и сезонность
У меня есть многомерный набор данных временных рядов, включающий взаимодействующие биологические и экологические переменные (плюс, возможно, некоторые экзогенные переменные). Помимо сезонности, в данных нет четкой долгосрочной тенденции. Моя цель - увидеть, какие переменные связаны друг с другом. Прогнозирование на самом деле не искали. Будучи новичком в анализе временных рядов, я …

1
Качественно что такое Cross Entropy
Этот вопрос дает количественное определение кросс-энтропии с точки зрения ее формулы. Я ищу более условное определение, википедия говорит: В теории информации кросс-энтропия между двумя распределениями вероятностей измеряет среднее число битов, необходимое для идентификации события из набора возможностей, если схема кодирования используется на основе заданного распределения вероятности q, а не «истинного» …

1
Почему я не могу сопоставить вывод glmer (family = binomial) с ручной реализацией алгоритма Гаусса-Ньютона?
Я хотел бы сравнить выходные данные lmer (действительно glmer) с примером игрушечного бинома. Я прочитал виньетки и, кажется, понимаю, что происходит. Но, видимо, я не. Застряв, я исправил «правду» в терминах случайных эффектов и пошел оценивать только фиксированные эффекты. Я включаю этот код ниже. Чтобы увидеть, что это законно, вы …

1
Распределение Коши и центральная предельная теорема
Для удержания CLT нам нужно распределение, которое мы хотим приблизить, чтобы иметь среднее и конечную дисперсию . Верно ли говорить, что для случая распределения Коши, среднее значение и дисперсия которого не определены, центральная предельная теорема не может обеспечить хорошее приближение даже асимптотически?σ 2μμ\muσ2σ2\sigma^2

1
Лучший способ визуально представить отношения из множественной линейной модели
У меня есть линейная модель с примерно 6 предикторами, и я собираюсь представить оценки, значения F, значения p и т. Д. Однако мне было интересно, какой будет лучший визуальный график для представления отдельного влияния одного предиктора на переменная ответа? Разброс точек? Условный участок? Эффект сюжета? и т.д? Как бы я …

2
Почему распределение rand () ^ 2 отличается от rand () * rand ()?
В Libre Office Calc rand()доступна функция, которая выбирает случайное значение от 0 до 1 из равномерного распределения. Я немного заржавел в своей вероятности, поэтому, когда я увидел следующее поведение, я был озадачен: A = 200x1 столбец rand()^2 B = 200x1 столбец rand()*rand() mean(A) знак равно 1/3 mean(B) знак равно 1/4 …

1
Гессиан логистической функции
Мне трудно вывести гессиан целевой функции l(θ)l(θ)l(\theta) в логистической регрессии, где l(θ)l(θ)l(\theta) равно: l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) - логистическая функция. ГессианXTDXXTDXX^T D X . Я пытался вывести его путем расчета∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 l(\theta)}{\partial \theta_i \partial \theta_j} , но тогда это не было очевидно для …
15 logistic 

3
Регуляризация и масштабирование функций в онлайн-обучении?
Допустим, у меня есть классификатор логистической регрессии. В обычном пакетном обучении я бы использовал термин регуляризатор, чтобы предотвратить переоснащение и сохранить вес небольшим. Я также нормализую и масштабирую свои функции. В режиме онлайн обучения я получаю непрерывный поток данных. Я делаю обновление градиентного спуска с каждым примером и затем отбрасываю …

2
Путать с вариациями MCMC Метрополис-Гастингс: Случайное прохождение, Неслучайное прохождение, Независимое, Метрополис
За последние несколько недель я пытался понять MCMC и алгоритм (ы) Метрополис-Гастингс. Каждый раз, когда я думаю, что понимаю это, я понимаю, что я неправ. Большинство примеров кода, которые я нахожу онлайн, реализуют то, что не согласуется с описанием. то есть: они говорят, что они реализуют Метрополис-Гастингс, но на самом …

4
Статистика Юнга-Бокса для остатков ARIMA в R: запутанные результаты испытаний
У меня есть временной ряд, который я пытаюсь прогнозировать, для которого я использовал сезонную модель ARIMA (0,0,0) (0,1,0) [12] (= fit2). Это отличается от того, что R предложил с auto.arima (R-вычисленный ARIMA (0,1,1) (0,1,0) [12] был бы более подходящим, я назвал его fit1). Тем не менее, в последние 12 месяцев …

5
Является ли логистическая регрессия непараметрическим тестом?
Я недавно получил следующий вопрос по электронной почте. Я выложу ответ ниже, но мне было интересно услышать, что думают другие. Вы бы назвали логистическую регрессию непараметрическим тестом? Насколько я понимаю, простой маркировки теста непараметрическим, потому что его данные обычно не распределяются, недостаточно. Это больше связано с отсутствием предположений. Логистическая регрессия …

2
Как сделать регрессию с кодированием эффекта вместо фиктивного кодирования в R?
В настоящее время я работаю над регрессионной моделью, в которой у меня есть только категориальные / факторные переменные в качестве независимых переменных. Моя зависимая переменная является логит-преобразованным коэффициентом. Довольно просто запустить нормальную регрессию в R, так как R автоматически знает, как кодировать манекены, как только они имеют тип «фактор». Однако …


1
Как интерпретировать ковариационную матрицу из подбора кривой?
Я не слишком хорош в статистике, поэтому извиняюсь, если это упрощенный вопрос. Я подгоняю кривую к некоторым данным, и иногда мои данные лучше всего соответствуют отрицательной экспоненте в виде , а иногда подгонка ближе к a ∗ e ( - b ∗ x 2 ) + с . Однако иногда …

3
Как выбрать метрику ошибки при оценке классификатора?
Я видел разные метрики ошибок, используемые в соревнованиях Kaggle: RMS, среднее значение, AUC и другие. Каково общее правило выбора метрики ошибки, т. Е. Как узнать, какую метрику ошибки использовать для данной проблемы? Есть ли рекомендации?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.