Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Существует ли объективная оценка расстояния Хеллингера между двумя распределениями?
В ситуации, когда наблюдается распределение X1,…,XnX1,…,XnX_1,\ldots,X_n распределенное по распределению с плотностью fff , мне интересно, существует ли объективная оценка (на основе XiXiX_i ) расстояния Хеллингера до другого распределения с плотностью f0f0f_0 , а именно H(f,f0)={1−∫Xf(x)f0(x)−−−−−−−−√dx}1/2.H(f,f0)={1−∫Xf(x)f0(x)dx}1/2. \mathfrak{H}(f,f_0) = \left\{ 1 - \int_\mathcal{X} \sqrt{f(x)f_0(x)} \text{d}x \right\}^{1/2}\,.

1
Связь между дисперсией и попарными расстояниями в переменной
Пожалуйста, докажите, что если у нас есть две переменные (одинаковый размер выборки) и а дисперсия в больше, чем в , то сумма квадратов разностей (то есть квадратов евклидовых расстояний) между точками данных в также больше, чем что в .XXXYYYXXXYYYXXXYYY

3
Объединение моделей машинного обучения
Я немного новичок в изучении данных / машинного обучения / и т.д. и читали о нескольких способах объединения нескольких моделей и прогонов одной и той же модели для улучшения прогнозов. У меня сложилось впечатление, что после прочтения пары статей (которые часто интересны и хороши в теории и греческом языке, но …

2
Методы повторного отбора карета
Я использую библиотеку caretв R для тестирования различных процедур моделирования. trainControlОбъект позволяет указать метод повторной дискретизации. Эти методы описаны в документации разделе 2.3 , и включают в себя: boot, boot632, cv, LOOCV, LGOCV, repeatedcvи oob. Хотя некоторые из них легко вывести, не все эти методы четко определены. Какие процедуры соответствуют …
20 r  resampling  caret 

5
Что такое блок в экспериментальном дизайне?
У меня есть два вопроса о понятии блока в экспериментальном дизайне: (1) В чем разница между блоком и фактором? (2) Я пытался прочитать некоторые книги, но что-то неясно: кажется, что авторы всегда предполагают, что нет никакого взаимодействия между «блочным фактором» и другими факторами. Верно ли это, и если да, то …

2
Каково теоретико-обоснованное обоснование байесовских интервалов вероятности?
(Чтобы понять, почему я написал это, проверьте комментарии ниже моего ответа на этот вопрос .) Ошибки типа III и теория статистических решений Правильный ответ на неправильный вопрос иногда называют ошибкой типа III. Теория статистических решений - это формализация принятия решений в условиях неопределенности; это обеспечивает концептуальную структуру, которая может помочь …

4
Какой смысл сравнивать p-значения друг с другом?
У меня есть две группы населения (мужчины и женщины), каждая из которых содержит образцов. Для каждого образца у меня есть два свойства A & B (средний балл за первый год и оценка SAT). Я использовал t-тест отдельно для A & B: обе обнаружили значительные различия между двумя группами; А с …

4
Сводка результатов «Большой p, маленький n»
Кто-нибудь может указать мне на обзорную статью о «Большой , Малый » результаты? Меня интересует, как эта проблема проявляется в различных исследовательских контекстах, например, регрессии, классификации, тесте Хотеллинга и т . Д.ппpNNn



2
В чем разница между биномиальной регрессией и логистической регрессией?
Я всегда считал логистическую регрессию просто частным случаем биномиальной регрессии, где функция связи - это логистическая функция (вместо, скажем, пробитовой функции). Однако после прочтения ответов на другой вопрос, который у меня возник, звучит так, как будто я запутался, и есть разница между логистической регрессией и биномиальной регрессией с логистической связью. …

6
Когда исключить термин из регрессионной модели?
Может кто-нибудь посоветовать, если имеет смысл следующее: Я имею дело с обычной линейной моделью с 4 предикторами. Я в раздумье, отбросить ли наименее значимый термин. Это значение чуть более 0,05. Я высказался за то, чтобы привести его в соответствие с этим: умножение оценки этого термина на (например) межквартильный диапазон выборочных …

8
Идеи для «лабораторного ноутбука»?
Так что это странная подгонка, хотя на самом деле я думаю, что это странная подгонка для любого сайта, поэтому я решил попробовать это здесь, среди моих собратьев по обработке данных. Я пришел к эпидемиологии и биостатистике из биологии, и у меня все еще есть определенные привычки в этой области. Один …

2
Допускается сравнение моделей смешанных эффектов (в первую очередь случайные эффекты)
Я смотрел на моделирование смешанных эффектов с использованием пакета lme4 в R. Я в основном использую lmerкоманду, поэтому я задам свой вопрос через код, который использует этот синтаксис. Я предполагаю, что общий простой вопрос может состоять в том, можно ли сравнивать любые две модели, построенные с lmerиспользованием отношений правдоподобия на …

3
Проверка значимости пиков в спектральной плотности
Иногда мы используем график спектральной плотности для анализа периодичности во временных рядах. Обычно мы анализируем сюжет путем визуального осмотра, а затем пытаемся сделать вывод о периодичности. Но разработали ли статистики какие-либо тесты для проверки того, являются ли какие-либо пики на графике статистически отличными от белого шума? Разработали ли R-специалисты какой-либо …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.