Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Как сгруппировать / стандартизировать переменные в R?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Функции, с которыми я знаком, включают масштабирование из базы R, масштабирование из ARM. Возможно, лучшим способом было бы использовать какой-либо вариант применения, …

7
Наборы данных для примеров визуализации данных, обучения и исследований
Я ищу существующие наборы данных, которые мы можем использовать для тестирования нескольких методов данных, которые мы исследуем. Я знаю несколько ресурсов, подобных тем, которые включены в R (попробуйте plot(Orange)или посмотрите здесь ). Но я бы хотел сделать шаг вперед: Каковы лучшие наборы данных для тестирования инструмента визуализации? Какие наборы данных …

1
Как интерпретировать p-значения 0 или 1?
Я запустил ANOVA, обнаружив, например, взаимодействие между полом и классом, по которому я хочу узнать, в каких классах мальчики и девочки отличаются, но во многих случаях я нахожу (скорректированные) значения p 0 и 1. Как / почему это возможно? Не кажется правильным ... as.factor(gender) 1 16 16.2 2.6377 0.104396 as.factor(grade) …
9 r 

3
Могут ли случайные эффекты применяться только к категориальным переменным?
Эти вопросы могут показаться глупыми, но ... верно ли, что случайные эффекты могут применяться только к категориальным переменным (таким как индивидуальный идентификатор, идентификатор популяции, ...), например, скажем, является категориальной переменной:xixix_i β x iyiyiy_i ~βxiβxi\beta_{x_i} N o r m ( μ , δ 2 )βxiβxi\beta_{x_i} ~Norm(μ,δ2)Norm(μ,δ2)Norm(\mu, \delta^2) но из принципа случайный …

3
Как я могу смоделировать микроданные переписи для небольших районов, используя 1% выборку микроданных в большом масштабе, и агрегировать статистику в масштабе небольших районов?
Я хотел бы выполнить многомерный анализ на индивидуальном уровне на небольших уровнях географической агрегации (районы сбора данных переписи населения Австралии). Очевидно, что перепись недоступна на этих небольших уровнях агрегирования по причинам конфиденциальности, поэтому я изучаю другие альтернативы. Почти все переменные, представляющие интерес, являются категориальными. У меня есть два набора данных …

2
Понимание предположений ANOVA для повторных измерений для правильной интерпретации результатов SPSS
Я исследую, могут ли различные условия вознаграждения влиять на выполнение задачи. У меня есть данные из небольшого исследования с двумя группами, каждая с n = 20. Я собрал данные о задании, которое включало выполнение в 3 разных «наградовых» условиях. Задача включала выполнение в каждом из 3 условий дважды, но в …

1
Вопрос о допущении независимости для ANOVA, t-критерия и непараметрических критериев
Я новичок в статистике, и у меня есть некоторая путаница в предположении независимости статистических тестов. Я искал в Интернете, и некоторая информация говорит о том, что для t-теста наблюдения в двух группах должны быть независимыми (то есть измерения в выборке 1 и измерения в выборке 2 должны быть разными). Некоторая …

2
Проверка значимости трех или более корреляций с использованием преобразования Фишера
Исходя из моих предыдущих постов, насколько я понимаю, если у меня есть три коэффициента корреляции, мне придется тестировать их попарно, чтобы увидеть, есть ли между ними существенная разница. Это означает, что мне нужно будет использовать преобразование Фишера, чтобы определить z-значение r, а затем значение p z (что, к счастью, рекомендуют …

1
Следует ли смоделировать разницу между контролем и лечением явно или неявно?
Учитывая следующую экспериментальную установку: Многократные образцы взяты от предмета, и каждый образец обработан многократными способами (включая контрольную обработку). Что в основном интересно, так это разница между контролем и каждым лечением. Я могу думать о двух простых моделях для этих данных. Для образца , обработка j , обработка 0 - контроль, …

2
У этого дистрибутива есть имя? Или что такое стохастический процесс, который может его генерировать?
Дискретное распределение с функцией массы р ( х ; к ) = к( х + к ) ( х + к - 1 ),х = 1 , 2 , …p(x;k)=k(x+k)(x+k−1),x=1,2,…p(x;k) = \frac{k}{(x+k)(x+k-1)},\quad x = 1,2,\ldots возникает на странице 9 этой статьи . Для это распределение Юла-Саймона с ρ = 1 …

1
Вывод в линейной модели с условной гетероскедастичностью
Предположим, я наблюдаю векторы независимых переменных и и зависимую переменную . Я хотел бы соответствовать модели вида: где - некоторая положительнозначная дважды дифференцируемая функция, - неизвестный параметр масштабирования, а - гауссовская случайная переменная с нулевой средней (предполагается, что она не зависит от и ). По сути, это настройка теста гетероскедастичности …

2
Как вы рассчитываете стандартные ошибки для преобразования MLE?
Мне нужно сделать вывод о положительном параметре . Чтобы подчеркнуть положительность, я репараметризовал . Используя процедуру MLE, я вычислил точечную оценку и нашел для . Свойство инвариантности MLE напрямую дает мне точечную оценку для p , но я не уверен, как вычислить se для p . Заранее благодарен за любое …

2
Взвешенная логистическая регрессия
Я смотрю на несколько вопросов логистической регрессии. («обычный» и «условный»). В идеале я хотел бы взвесить каждый из входных наблюдений, чтобы glm больше фокусировался на правильном прогнозировании более взвешенных наблюдений за счет возможной неправильной классификации менее взвешенных наблюдений. Конечно, это было сделано раньше. Может ли кто-нибудь указать мне на некоторую …
9 logistic 

2
Распределение стандартного отклонения
Этот вопрос касался нормального распределения, но мне интересно, что известно о распределении стандартного отклонения выборки размера n, взятой из произвольного распределения. В частности, каково стандартное отклонение стандартного отклонения? Для нормального распределения sd sd - это . Это приблизительно верно для произвольного распределения как ?σ2n√σ2n\sigma \over{\sqrt{2n}}n→∞n→∞n \rightarrow \infty

2
Должно ли расстояние быть «метрикой», чтобы иерархическая кластеризация действовала на нем?
Допустим, мы определяем расстояние, которое не является метрикой , между N элементами. На основании этого расстояния мы затем используем агломерационную иерархическую кластеризацию . Можем ли мы использовать каждый из известных алгоритмов (одиночная / максимальная / средняя связь и т. Д.), Чтобы получить значимые результаты? Или, другими словами, в чем проблема …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.