Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Идея и интуиция, стоящие за квазимаксимальной вероятностной оценкой (QMLE)
Вопрос (ы): В чем заключается идея и интуиция, лежащие в основе квазимаксимальной вероятностной оценки (QMLE; также известная как псевдо максимальная правдоподобная оценка, PMLE)? Что заставляет оценщик работать, когда фактическое распределение ошибок не соответствует предполагаемому распределению ошибок? Сайт в Википедии для QMLE - это хорошо (кратко, интуитивно понятно), но я мог …

5
Распределение соотношения между двумя независимыми равномерными случайными величинами
Предположим, что XXX и YYY стандартно равномерно распределены в [0,1][0,1][0, 1] , и они независимы, что такое PDF Z=Y/XZ=Y/XZ = Y / X ? Ответ из некоторого учебника по теории вероятностей: fZ(z)=⎧⎩⎨1/2,1/(2z2),0,if 0≤z≤1if z>1otherwise.fZ(z)={1/2,if 0≤z≤11/(2z2),if z>10,otherwise. f_Z(z) = \begin{cases} 1/2, & \text{if } 0 \le z \le 1 \\ 1/(2z^2), …

2
Почему ранг ковариационной матрицы не более
Как указано в этом вопросе, максимальный ранг ковариационной матрицы равен n−1n−1n-1 где nnn - размер выборки, поэтому, если размер ковариационной матрицы равен размеру выборки, он будет единственным. Я не могу понять, почему мы вычитаем 111 из максимального ранга nnn ковариационной матрицы.

1
В случайном лесу больше% IncMSE лучше или хуже?
После того как я построил (R) модель случайного леса в R, вызов rf$importanceпредоставляет мне две меры для каждой переменной-предиктора, %IncMSEи IncNodePurity. Является ли интерпретация того, что предикторные переменные с меньшими %IncMSEзначениями важнее, чем предикторные переменные с большими %IncMSEзначениями? Как насчет IncNodePurity?

2
Почему именно используется наблюдаемая информация Фишера?
В стандартной настройке максимального правдоподобия (iid sample из некоторого распределения с плотностью f y ( y | θ 0 )) и в случае правильно заданной модели информация Фишера задается какY1,…,YnY1,…,YnY_{1}, \ldots, Y_{n}fy(y|θ0fy(y|θ0f_{y}(y|\theta_{0} I(θ)=−Eθ0[∂2θ2lnfy(θ)]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] где ожидание берется относительно истинной плотности, которая генерировала данные. Я прочитал, что наблюдаемая …

1
Неравномерное распределение p-значений при моделировании биномиальных тестов при нулевой гипотезе
Я слышал, что при нулевой гипотезе распределение p-значений должно быть равномерным. Тем не менее, моделирование биномиального теста в MATLAB дает очень отличающиеся от равномерного распределения средние значения, превышающие 0,5 (в данном случае 0,518): coin = [0 1]; success_vec = nan(20000,1); for i = 1:20000 success = 0; for j = …

1
Jenks Natural Breaks в Python: как найти оптимальное количество перерывов?
Я нашел эту реализацию Python в Дженкс Natural Breaks алгоритма , и я мог бы сделать его запустить на моем компьютере Windows 7. Это довольно быстро, и он находит разрывы за короткое время, учитывая размер моих геоданных. Прежде чем использовать этот алгоритм кластеризации для моих данных, я использовал sklearn.clustering.KMeans (здесь) …


1
Сообщение о дисперсии повторной перекрестной проверки в k-кратном размере
Я использовал повторную перекрестную проверку в k-кратном размере и сообщал о среднем значении (метрики оценки, например, чувствительности, специфичности), вычисленном как общее среднее значение для сгибов различных серий перекрестной проверки. Тем не менее, я не уверен, как я должен сообщать о дисперсии. Я нашел много вопросов здесь, обсуждающих повторную перекрестную проверку, …

2
Как интерпретировать коэффициент корреляции Мэтьюса (MCC)?
Ответ на вопрос Отношение между коэффициентами корреляции фи, Мэтьюса и Пирсона? показывает, что все три метода коэффициентов являются эквивалентами. Я не из статистики, поэтому это должен быть простой вопрос. В статье Мэтьюса (www.sciencedirect.com/science/article/pii/0005279575901099) описывается следующее: "A correlation of: C = 1 indicates perfect agreement, C = 0 is expected for …

1
Какова правильная мера связи переменной с компонентом PCA (на биплоте / графике загрузки)?
Я использую, FactoMineRчтобы свести мой набор данных измерений к скрытым переменным. Карта переменная выше ясно для меня , чтобы интерпретировать, но я смущен , когда речь идет о связях между переменными и компонента 1. Посмотрев на переменной карте, ddpи covочень близко к компоненту в карте, и ddpAbsнемного дальше прочь. Но …

2
Вопрос о стандартизации в гребне регрессии
Эй, ребята, я нашел одну или две статьи, в которых используется регрессия гребня (для данных о баскетболе). Мне всегда говорили стандартизировать мои переменные, если я запускал регрессию гребня, но мне просто сказали сделать это, потому что гребень был масштабным вариантом (регрессия гребня не была действительно частью нашего курса, поэтому наш …


1
Что не так с этой иллюстрацией апостериорного распределения?
У меня есть следующее изображение, которое, как мне сказали, является иллюстрацией того, как апостериорное распределение вероятностей представляет собой комбинацию предыдущих и вероятностных распределений. Мне сказали, что с изображением что-то не так, а именно, что апостериорное распределение не может иметь форму, которую оно имеет, учитывая форму функции правдоподобия. Но я изо …

2
Полиномиальные контрасты для регрессии
Я не могу понять использование полиномиальных контрастов в регрессионном подборе. В частности, я имею в виду кодировку, используемую Rдля выражения интервальной переменной (порядковой переменной с одинаково разнесенными уровнями), описанную на этой странице . В примере на этой странице , если я правильно понял, R соответствует модели для интервальной переменной, возвращая …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.