Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Формула формулы инерции в скиките учиться
Я хотел бы закодировать кластеризацию kmeans в python, используя pandas и scikit learn. Чтобы выбрать хороший k, я хотел бы закодировать статистику разрыва из Tibshirani и др. 2001 ( pdf ). Я хотел бы знать, могу ли я использовать результат inertia_ от scikit и адаптировать формулу статистики разрыва без необходимости …

2
Корреляция между категориями между категориальными номинальными переменными
У меня есть набор данных с двумя категориальными номинальными переменными (обе с 5 категориями). Я хотел бы знать, если (и как) я могу определить потенциальные корреляции между категориями из этих двух переменных. Другими словами, показывают ли, например, результаты категории в переменной 1 сильную корреляцию с определенной категорией j в переменной …

1
R: Anova и линейная регрессия
Я новичок в статистике и пытаюсь понять разницу между ANOVA и линейной регрессией. Я использую R, чтобы исследовать это. Я читал различные статьи о том, почему ANOVA и регрессия различны, но все еще одинаковы, и как их можно визуализировать и т. Д. Я думаю, что я там довольно, но один …
9 r  regression  anova 

1
Ожидаемое значение статистики минимального заказа из обычной выборки
ОБНОВЛЕНИЕ 25 января 2014: ошибка теперь исправлена. Пожалуйста, игнорируйте рассчитанные значения ожидаемого значения в загруженном изображении - они неверны - я не удаляю изображение, потому что оно сгенерировало ответ на этот вопрос. ОБНОВЛЕНИЕ 10 января 2014: ошибка была найдена - математическая опечатка в одном из использованных источников. Готовимся к исправлению …

2
Ожидание отношения сумм случайных величин IID (лист Кембриджского университета)
Я готовлюсь к собеседованию, которое требует приличного знания основных вероятностей (по крайней мере, чтобы пройти само собеседование). Я работаю над листом из моих студенческих дней в качестве ревизии. В основном это было довольно просто, но я полностью озадачен вопросом 12. http://www.trin.cam.ac.uk/dpk10/IA/exsheet2.pdf Любая помощь будет оценена. Изменить: вопрос: Предположим , что …

4
Лассо в порядке отставания?
Предположим, у меня есть продольные данные вида (у меня есть несколько наблюдений, это просто форма одного). Я заинтересован в ограничениях . Неограниченная эквивалентна взятию с .Σ Σ Y j = α j + j - 1 ∑ ℓ = 1 ϕ ℓ j Y j j - ℓ + ε …

2
Дисперсия среднего значения выборки начальной загрузки
Пусть быть отчетливым наблюдением (без связей). Пусть X * 1 , . , , , Х * п обозначает образец самозагрузки (образец из эмпирической CDF) и пусть ˉ Х * п = 1Икс1, . , , , XNX1,...,XnX_{1},...,X_{n}Икс*1, . , , , X*NX1∗,...,Xn∗X_{1}^{*},...,X_{n}^{*} . НайтиE( ˉ X ∗ n )иVar( …


3
Оценка силы теста нормальности (в R)
Я хочу оценить точность тестов нормальности для разных размеров выборки в R (я понимаю, что тесты нормальности могут вводить в заблуждение ). Например, чтобы посмотреть на тест Шапиро-Уилка, я провожу следующую симуляцию (а также нанесение на график результатов) и ожидаю, что с увеличением размера выборки вероятность отклонения нуля уменьшается: n …

1
Структура данных и вызов функции для данных повторяющихся событий с переменными во времени
Я пытаюсь оценить влияние 2 препаратов ( drug1, drug2) на вероятность падения пациента ( event). Пациенты могут падать более одного раза и могут быть введены или сняты с лекарств в любой момент. Мой вопрос заключается в том, как данные должны быть структурированы с учетом периода времени (дней), в частности, должно …
9 r  survival  cox-model 

2
Три открытые философские проблемы в статистике
Я недавно закончила читать The Lady Tasting Tea , забавную книгу об истории статистики. В конце книги автор, Дэвид Салсбург , предлагает три открытые философские проблемы в области статистики, решения которых, как он утверждает, будут иметь большее значение для применения статистической теории в науке. Я никогда не слышал об этих …

3
Понимание байесовских прогнозирующих распределений
Я прохожу курс «Введение в Байес» и испытываю некоторые затруднения с пониманием предиктивного распределения. Я понимаю, почему они полезны, и я знаком с определением, но есть некоторые вещи, которые я не совсем понимаю. 1) Как получить правильное предсказательное распределение для вектора новых наблюдений Предположим, что мы построили модель выборки p(yi|θ)p(yi|θ)p(y_i …

1
Скрытая марковская модель для прогнозирования событий
Вопрос : Является ли установка ниже разумной реализации скрытой марковской модели? У меня есть набор данных 108,000наблюдений (взятых в течение 100 дней) и приблизительно 2000событий на протяжении всего периода наблюдения. Данные выглядят как на рисунке ниже, где наблюдаемая переменная может принимать 3 дискретных значения а красные столбцы выделяют время события, …

3
Логистическая регрессия: максимизация истинных положительных результатов - ложных положительных результатов
У меня есть модель логистической регрессии (подходит через glmnet в R с упорядоченной упругой сетью), и я хотел бы максимизировать разницу между истинными положительными и ложными положительными сторонами. Для этого на ум пришла следующая процедура: Подходит стандартная модель логистической регрессии Используя порог прогноза как 0,5, определите все положительные прогнозы Назначьте …

4
Моделирование футбольных матчей
В Dixon, Coles ( 1997 ) они использовали оценку максимального правдоподобия для двух модифицированных независимых моделей Пуассона в (4.3) для моделирования результатов в футболе. Я пытаюсь использовать R для того, чтобы «воспроизвести» альфа и бета, а также параметры домашнего эффекта (стр. 274, Таблица 4) без использования каких-либо пакетов (использование обычных …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.