Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Тестирование предположения нормальности для повторных измерений anova? (в R)
Таким образом, предполагая, что есть смысл проверить допущение нормальности для ановы (см. 1 и 2 ) Как это можно проверить в R? Я ожидал бы сделать что-то вроде: ## From Venables and Ripley (2002) p.165. utils::data(npk, package="MASS") npk.aovE <- aov(yield ~ N*P*K + Error(block), npk) residuals(npk.aovE) qqnorm(residuals(npk.aov)) Что не работает, …

4
MANOVA и корреляции между зависимыми переменными: насколько сильный слишком сильный?
Зависимые переменные в MANOVA не должны быть «слишком сильно коррелированными». Но насколько сильна корреляция, слишком сильна? Было бы интересно узнать мнение людей по этому вопросу. Например, вы бы продолжили с MANOVA в следующих ситуациях? Y1 и Y2 коррелируют с иг = 0,3рзнак равно0,3r=0.3р &lt; 0,005п&lt;0,005p<0.005 Y1 и Y2 коррелируют с …

3
Сравнение регрессионных моделей по данным подсчета
Недавно я подобрал 4 модели множественной регрессии для одного и того же предиктора / данных ответа. Две модели мне подходят с пуассоновской регрессией. model.pois &lt;- glm(Response ~ P1 + P2 +...+ P5, family=poisson(), ...) model.pois.inter &lt;- glm(Response ~ (P1 + P2 +...+ P5)^2, family=poisson(), ...) Две модели мне подходят с …

6
Есть ли сайт, на котором можно опубликовать свой опрос, чтобы я мог получить выборку представителя населения?
Это только для моего старшего школьного проекта, поэтому он не должен быть идеальным. Я делаю проект по глобальному потеплению, и я хочу опросить людей на предмет их мнений. Я знаю, что если я воспользуюсь удобной выборкой моих одноклассников, у меня будет много предубеждений. Мне было интересно, есть ли в Интернете …
11 survey  internet 

14
Как много информации вы можете извлечь из имени?
Имя: имя, отчество, фамилия. Мне интересно, сколько информации вы можете извлечь из имени, используя общедоступные наборы данных. Я знаю, что вы можете получить следующее с любой низкой вероятностью (в зависимости от входных данных), используя данные переписи США: 1) Пол. 2) Гонка. Например, Facebook использовал именно это, чтобы с достаточной степенью …

4
Подгонка по лассо по координатному спуску: реализации с открытым исходным кодом? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто в прошлом году . Какие реализации с открытым исходным кодом - на любом языке - существуют там, которые могут вычислять лассо-пути регуляризации для …

3
Оценка параметров динамической линейной модели
Я хочу реализовать (в R) следующую очень простую динамическую линейную модель, для которой у меня есть 2 неизвестных изменяющихся во времени параметра (дисперсия ошибки наблюдения и дисперсия ошибки состояния ). ε 2 тε1Tϵt1\epsilon^1_tε2Tϵt2\epsilon^2_t YTθт + 1знак равнознак равноθT+ ϵ1TθT+ ϵ2TYt=θt+ϵt1θt+1=θt+ϵt2 \begin{matrix} Y_t & = & \theta_t + \epsilon^1_t\\ \theta_{t+1} & …
11 r  mcmc  dlm  particle-filter 

3
Размер эффекта для эффекта взаимодействия в дизайне контроля до лечения
Если вы решите проанализировать схему контроля до лечения с помощью непрерывной зависимой переменной, используя смешанный ANOVA, существуют различные способы количественного определения эффекта нахождения в группе лечения. Эффект взаимодействия является одним из основных вариантов. В целом, мне особенно нравятся меры типа Коэна d (т. ). Мне не нравятся меры, объясняемые дисперсией, …


2
Почему в тесте Макнемара используется хи-квадрат, а не нормальное распределение?
Я только что заметил, как в неточном тесте Макнемара используется асимптотическое распределение хи-квадрат. Но поскольку точный тест (для таблицы двух случаев) основан на биномиальном распределении, почему не принято предлагать нормальное приближение к биномиальному распределению? Спасибо.

4
Можно ли достоверно уменьшить количество предметов в опубликованной шкале Лайкерта?
[правки сделаны в ответ на отзыв- спасибо :-)] Doh! Больше правок! Сожалею! Привет- Я делаю довольно грубый и готовый сбор данных с опросом, направленным медицинскому персоналу с использованием опубликованной шкалы о моральном духе и других подобных вопросах. Единственное, что масштаб довольно длинный со всеми остальными в опросе, и я хотел …

3
Анализ вмешательства с многомерными временными рядами
Я хотел бы провести интервенционный анализ, чтобы количественно оценить результаты политического решения о продаже алкоголя с течением времени. Однако я довольно новичок в анализе временных рядов, поэтому у меня есть несколько вопросов для начинающих. Изучение литературы показывает, что другие исследователи использовали ARIMA для моделирования продаж алкоголя во временных рядах, с …


6
Статистический аргумент, почему 10000 голов с 20 000 бросков указывают на неверные данные
Допустим, мы неоднократно подбрасываем справедливую монету, и мы знаем, что количество голов и хвостов должно быть примерно одинаковым. Когда мы видим результат, например, 10 голов и 10 хвостов на общую сумму 20 бросков, мы верим в результаты и склонны считать, что монета справедлива. Хорошо, когда вы видите результат, например, 10000 …

2
Вероятность того, что кому-то понравится изображение
У меня следующая проблема: - У нас есть набор из N человек - У нас есть набор из K изображений - Каждый человек оценивает определенное количество изображений. Человеку может нравиться или не нравиться изображение (это единственные две возможности). - Проблема в том, как рассчитать вероятность того, что кому-то нравится определенный …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.