Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Пример распределения, где большой размер выборки необходим для центральной предельной теоремы
Некоторые книги утверждают , образец размер размер 30 или выше , необходимо для центральной предельной теоремы , чтобы дать хорошее приближение для X¯X¯\bar{X} . Я знаю, что этого недостаточно для всех дистрибутивов. Я хотел бы увидеть некоторые примеры распределений, где даже при большом размере выборки (возможно, 100 или 1000 или …

1
Как обрабатываются значения NA в glm в R
У меня есть таблица данных T1, которая содержит почти тысячу переменных (V1) и около 200 миллионов точек данных. Данные редки, и большинство записей - NA. Каждый пункт данных имеет уникальный идентификатор и пару дат, чтобы отличить его от другого. У меня есть другая таблица T2, которая содержит отдельный набор переменных …

5
Каков наилучший способ визуализации отношений между дискретными и непрерывными переменными?
Каков наилучший способ показать отношения между: непрерывная и дискретная переменная, две дискретные переменные? До сих пор я использовал точечные диаграммы, чтобы посмотреть на связь между непрерывными переменными. Однако в случае дискретных переменных точки данных накапливаются через определенные промежутки времени. Таким образом, линия наилучшего соответствия может быть предвзятой.

3
В чем практическая разница между правилами ассоциации и деревьями решений в интеллектуальном анализе данных?
Есть ли действительно простое описание практических различий между этими двумя методами? Похоже, что оба они используются для обучения под наблюдением (хотя правила ассоциации могут также обрабатывать без присмотра). Оба могут быть использованы для прогнозирования Самое близкое к «хорошему» описанию я нашел из учебника Statsoft . Они говорят, что Правила Ассоциации …


5
Как отображать панели ошибок для перекрестных (парных) экспериментов
Следующий сценарий стал наиболее часто задаваемыми вопросами в трио исследователя (I), рецензента / редактора (R, не связанного с CRAN) и меня (M) как создателя сюжета. Мы можем предположить, что (R) является типичным медицинским рецензентом большого босса, который знает только, что на каждом графике должна быть строка ошибок, в противном случае …

1
Как найти значения, не указанные в (интерполировать) статистических таблицах?
Часто люди используют программы для получения p-значений, но иногда - по какой-либо причине - может потребоваться получить критическое значение из набора таблиц. Учитывая статистическую таблицу с ограниченным числом уровней значимости и ограниченным числом степеней свободы, как получить приблизительные критические значения при других уровнях значимости или степенях свободы (например, с ttt …

1
Существует ли статистический тест для сравнения двух выборок размера 1 и 3?
Для экологического проекта моя лабораторная группа добавила уксус в 4 резервуара, содержащих равные объемы прудовой воды, 1 контрольный образец без элодеи (водное растение) и 3 обработки с одинаковым количеством элодеи в каждом. Целью добавления уксуса было снижение рН. Гипотеза заключалась в том, что резервуары с элодеей быстрее вернутся к своему …

2
Наиболее эффективное использование цвета на тепловых / контурных картах
При представлении результатов частотно-временной ЭЭГ частотно-временные карты довольно часто используются. Цветовая схема, которую часто выбирают (и которая мне нравится и которую я использую), - это цветовая схема «jet» (см., Например, частотно-временную ЭЭГ при поиске изображений в Google ). Мне интересно, есть ли лучшие цветовые схемы для представления этих графиков и …

2
Какая диагностика может подтвердить использование определенного семейства GLM?
Это кажется таким элементарным, но я всегда застреваю на этом этапе ... Большинство данных, с которыми я имею дело, являются ненормальными, и большинство анализов основано на структуре GLM. Для моего текущего анализа у меня есть переменная ответа, которая является "скоростью ходьбы" (метры в минуту). Мне легко определить, что я не …

1
Может ли lmer () использовать сплайны в качестве случайных эффектов?
Скажем, мы работаем над моделью случайных эффектов некоторых данных подсчета во времени, и мы хотим контролировать некоторые тенденции. Обычно вы делаете что-то вроде: lmer(counts ~ dependent_variable + (1+t+I(t^2)|ID), family="poisson") включить квадратную форму для t. Можно ли использовать более сложные методы сглаживания, такие как сглаживание по УХОДУ или сплайны, для моделирования …

3
Интерпретация трех форм «смешанной модели»
Есть различие, которое сбивает меня с толку смешанными моделями, и мне интересно, смогу ли я получить некоторую ясность в этом. Предположим, у вас смешанная модель данных подсчета. Есть переменная с фиксированным эффектом (A) и другая переменная времени (T), сгруппированные, скажем, в переменную «Site». Как я понимаю: glmer(counts ~ A + …

2
Если принцип правдоподобия вступает в противоречие с вероятностной вероятностью, тогда отбрасываем ли мы один из них?
В комментарии, недавно размещенном здесь, один комментатор указал на блог Ларри Вассермана, который указывает (без каких-либо источников), что частые выводы противоречат принципу вероятности. Принцип правдоподобия просто говорит о том, что эксперименты, дающие сходные функции правдоподобия, должны давать аналогичные выводы. Две части к этому вопросу: Какие части, вкус или школа частых …

5
Способы уменьшения объемных данных для визуализации
Я работаю над двумерным физическим моделированием и собираю данные во времени в нескольких точках. Эти дискретные точки расположены вдоль вертикальных линий с несколькими линиями в осевом направлении. Это делает набор данных эффективно 4D. Например, давайте предположим, что у меня есть точки сбора в (X, Y) координатах: (0,0), (1,0), (2,0) (0,1), …

3
Причина нормализации в евклидовых мерах расстояния в иерархической кластеризации
Очевидно, что в иерархической кластеризации, в которой мерой расстояния является евклидово расстояние, данные должны быть сначала нормализованы или стандартизированы, чтобы предотвратить кластеризацию с помощью ковариации с наибольшей дисперсией. Почему это? Разве этот факт не желателен?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.