Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Уместно ли рассматривать n-точечные данные шкалы Лайкерта как n испытаний из биномиального процесса?
Мне никогда не нравилось, как люди обычно анализируют данные из шкал Лайкерта, как если бы ошибка была непрерывной и гауссовой, когда существуют разумные ожидания, что эти предположения нарушаются, по крайней мере, в крайних точках шкал. Что вы думаете о следующей альтернативе: Если ответ принимает значение по точечной шкале, разверните эти …

6
Как найти сводную статистику для всех уникальных комбинаций факторов в data.frame в R? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Я хочу рассчитать сводку переменной в data.frame для каждой уникальной комбинации факторов в data.frame. Должен ли я использовать plyr …

6
Насколько проблематично контролировать несуществующие ковариаты в наблюдательном (т.е. нерандомизированном) исследовании?
Миллер и Чепмен (2001) утверждают, что абсолютно неуместно контролировать несуществующие ковариаты, которые связаны как с независимыми, так и с зависимыми переменными в наблюдательном (нерандомизированном) исследовании, хотя это обычно делается в социальных науках. Насколько проблематично это сделать? Как лучше всего справиться с этой проблемой? Если вы регулярно контролируете несуществующие ковариаты в …

6
Как следует подходить к проблеме проекта Эйлера 213 («Блошиный цирк»)?
Я хотел бы решить Project Euler 213, но не знаю, с чего начать, потому что я непрофессионал в области статистики, обратите внимание, что требуется точный ответ, чтобы метод Монте-Карло не работал. Не могли бы вы порекомендовать мне некоторые темы статистики? Пожалуйста, не размещайте решение здесь. Блошиный цирк Сетка квадратов 30 …

4
Как я могу (численно) приблизительные значения для бета-распределения с большой альфа и бета
Существует ли численно устойчивый способ расчета значений бета-распределения для большого целого числа альфа, бета (например, альфа, бета> 1000000)? На самом деле, мне нужен только 99% доверительный интервал для режима, если это как-то облегчает проблему. Добавить : Извините, мой вопрос был не так четко сформулирован, как я думал. Я хочу сделать …

5
Рекомендации по планированию обучения
В среднем (срединном?) Разговоре о статистике вы часто будете обсуждать тот или иной метод анализа того или иного типа данных. По моему опыту, тщательным дизайном исследования с особым вниманием в отношении статистического анализа часто пренебрегают (работая в биологии / экологии, это, кажется, преобладающее явление). Статистики часто оказываются в тупике из-за …

4
Несколько тестов хи-квадрат
У меня есть перекрестные данные в таблице 2 x 2 x 6. Давайте назовем размеры response, Aи B. Я подгоняю логистическую регрессию к данным с помощью модели response ~ A * B. Анализ отклонения этой модели говорит о том, что оба термина и их взаимодействие являются значительными. Однако, глядя на …

2
Как понять сверточную сеть глубокого убеждения для классификации аудио?
В « Сверточных сетях глубокого убеждения для масштабируемого обучения без надзора иерархических представлений » Ли и соавт. др. ( PDF ) Предложены сверточные ДБН. Также метод оценивается для классификации изображений. Это звучит логично, поскольку существуют естественные локальные особенности изображения, такие как небольшие углы и края и т. Д. В статье …

1
Каковы хорошие рамки для выбора метода?
Я искал теоретические основы для выбора метода (примечание: не выбор модели) и нашел очень мало систематической, математически мотивированной работы. Под «выбором метода» я подразумеваю основу для различения подходящего (или лучшего, оптимального) метода по отношению к проблеме или типу проблемы. То, что я обнаружил, является существенным, хотя и частичным, работа над …

4
ANOVA с независимыми наблюдениями
Извините за подробный фон этого вопроса: Время от времени в исследованиях поведения животных экспериментатор интересуется количеством времени, которое субъект проводит в различных, заранее определенных зонах в испытательном аппарате. Я часто видел данные такого рода, проанализированные с использованием ANOVA; однако я никогда не был полностью убежден в достоверности таких анализов, учитывая, …
11 anova 

1
Как я могу адаптировать ANOVA для двоичных данных?
У меня есть четыре конкурирующих модели, которые я использую, чтобы предсказать бинарную переменную результата (скажем, статус занятости после окончания, 1 = занятый, 0 = не занятый) для n предметов. Естественным показателем производительности модели является коэффициент попадания, который представляет собой процент правильных прогнозов для каждой из моделей. Мне кажется, что я …

10
Причины помимо прогноза построения моделей?
Джошуа Эпштейн написал статью под названием «Почему модель?» доступно по адресу http://www.santafe.edu/media/workingpapers/08-09-040.pdf, в котором приводятся 16 причин: Объясните (очень отличается от предсказания) Руководство сбора данных Подсветить динамику ядра Предложить динамические аналогии Откройте для себя новые вопросы Поощрять научную привычку ума Связать (заключить в скобки) результаты в вероятных диапазонах Осветить основные …
11 modeling 

3
Существует ли стандартная методика отладки программ MCMC?
Отладка программ MCMC общеизвестно сложна. Трудность возникает из-за нескольких проблем, некоторые из которых: (а) Циклическая природа алгоритма Мы итеративно рисуем параметры, зависящие от всех остальных параметров. Таким образом, если реализация не работает должным образом, трудно выделить ошибку, поскольку проблема может быть где-то в итеративном сэмплере. (б) Правильный ответ не обязательно …
11 mcmc 

2
Имеет ли направление причинность между инструментом и переменной материей?
Стандартная схема инструментальной переменной с точки зрения причинности ( ->): Z -> X -> Y Где Z - инструмент, X - эндогенная переменная, а Y - ответ. Возможно ли, что следующие отношения: Z <- X ->Y Z <-> X ->Y также действительны? Хотя корреляция между инструментом и переменной удовлетворена, как …

4
Пророк из Facebook отличается от линейной регрессии?
Итак, что я прочитал о пророке Facebook, так это то, что он в основном разбивает временные ряды на тренды и сезонность. Например, аддитивная модель будет записана как: Y( т ) = г( t ) + s ( t ) + h ( t ) + eTY(T)знак равног(T)+s(T)+час(T)+еT y(t) = g(t) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.