Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Моделирование, когда зависимая переменная имеет «отсечение»
Заранее извиняюсь, если какая-либо терминология, которую я использую, неверна. Я бы приветствовал любое исправление. Если то, что я называю «отсечкой», носит другое имя, дайте мне знать, и я смогу обновить вопрос. Интересующая меня ситуация такова: у вас есть независимые переменные и одна зависимая переменная . Я оставлю это расплывчатым, но …

3
Байесовский против MLE, проблема переоснащения
В книге Бишопа по PRML он говорит, что переоснащение - это проблема с оценкой максимального правдоподобия (MLE), и байесовский может ее избежать. Но я думаю, что переоснащение - это проблема скорее выбора модели, а не метода, используемого для оценки параметров. То есть, предположим, что у меня есть набор данных , …

1
Почему F-тест в гауссовых линейных моделях является наиболее мощным?
Y=μ+σGY=μ+σGY=\mu+\sigma Gμμ\muWWWGGGRnRn\mathbb{R}^nFFFH0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu \in U\}U⊂WU⊂WU \subset Wf=ϕ(2logsupμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=ϕ(2log⁡supμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=\phi\left( 2\log \frac{\sup_{\mu \in W, \sigma>0} L(\mu, \sigma | y)}{\sup_{\mu \in U, \sigma>0} L(\mu, \sigma | y)} \right). Как мы можем знать, что эта статистика обеспечивает самый мощный тест для (возможно, после отбрасывания необычных частных случаев)? Это не вытекает из теоремы Неймана-Пирсона, потому что эта …

2
Рассчитать доверительный интервал для среднего бета-распределения
Рассмотрим бета-распределение для данного набора рейтингов в [0,1]. После расчета среднего значения: μ=αα+βμ=αα+β \mu = \frac{\alpha}{\alpha+\beta} Есть ли способ обеспечить доверительный интервал вокруг этого среднего значения?

2
Почему в тесте независимости используется распределение хи-квадрат?
В тесте на соответствие критерия используется следующая статистика : В тесте предоставление этого условия выполнены, как используются - распределение для вычисления р-значение, учитывая правда можно было бы наблюдать такое значение в репрезентативной выборке одного и того же размера.χ2χ2\chi^2χ20=∑i=1n(Oi−Ei)2Eiχ02=∑i=1n(Oi−Ei)2Ei \chi_0^2=\sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i} χ2χ2\chi^2H0H0H_0 Однако для того, чтобы статистика следовала за -распределением (с степенями …

2
-test В.С. -test для сравнения шансов подхватить простуду в 2 -х группах
Я только что прочитал в довольно уважаемом (популярном) научном журнале (немецкий PM, 02/2013, с.36) об интересном эксперименте (к сожалению, без источника). Это привлекло мое внимание, потому что интуитивно я сомневался в значимости результата, но предоставленной информации было достаточно для воспроизведения статистического тестирования. Исследователи задавались вопросом, увеличивает ли вероятность простуды в …

5
Рекурсивный (онлайн) регуляризованный алгоритм наименьших квадратов
Может ли кто-нибудь указать мне направление онлайнового (рекурсивного) алгоритма регуляризации Тихонова (регуляризованных наименьших квадратов)? В автономном режиме я вычисляю β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY используя мой исходный набор данных, где λλλ находится с помощью n-кратной перекрестной проверки. Новое значение yyy можно предсказать для данного xxx используя y=xTβ^y=xTβ^y=x^T\hat\beta . В режиме онлайн я постоянно рисую …

4
Проверка гипотезы на разницу в медиане между более чем двумя образцами
Вопрос Результаты тестов трех групп людей сохраняются в виде отдельных векторов в R. set.seed(1) group1 <- rnorm(100, mean = 75, sd = 10) group2 <- rnorm(100, mean = 85, sd = 10) group3 <- rnorm(100, mean = 95, sd = 10) Я хочу знать, есть ли значительная разница в медиане …

1
Соотношение вероятностей и соотношение PDF-файлов
Я использую Байес для решения проблемы кластеризации. После выполнения некоторых вычислений у меня возникает необходимость получить соотношение двух вероятностей: п( А ) / П( Б )P(A)/P(B)P(A)/P(B) чтобы иметь возможность получить . Эти вероятности получены путем интегрирования двух разных 2D многомерных KDE, как объяснено в этом ответе :п( H| Г)P(H|D)P(H|D) P …

3
Интуитивно понятная причина, по которой информация Бинома о Фишере обратно пропорциональна
Меня смущает / поражает, что бином имеет дисперсию, пропорциональную . Эквивалентно, информация Фишера пропорциональна . Что является причиной этого? Почему информация о Фишере минимизируется при ? То есть, почему вывод наиболее сложен при ?p(1−p)p(1−p)p(1-p)1p(1−p)1p(1−p)\frac{1}{p(1-p)}p=0.5p=0.5p=0.5p=0.5p=0.5p=0.5 Контекст: Я работаю над калькулятором размера выборки, и формула для , необходимого размера выборки, представляет собой …

10
Общие слова, которые имеют определенные статистические значения
Я не статистик, но моя исследовательская работа связана со статистикой (анализ данных, чтение литературы и т. Д.). Мне снова напомнили из комментария по одному из моих вопросов, размещенных здесь, что есть некоторые общие слова, которые имеют особенно специфические значения или коннотации для тех, кто хорошо практикуется в области статистики. Будет …

2
Всегда ли MLE означает, что мы знаем основной PDF наших данных, а EM означает, что мы не знаем?
У меня есть несколько простых концептуальных вопросов, которые я хотел бы прояснить в отношении MLE (Максимальная оценка правдоподобия) и какую связь он имеет, если таковые имеются, с EM (Максимальное ожидание). Насколько я понимаю, если кто-то говорит «Мы использовали MLE», означает ли это автоматически, что у него есть явная модель PDF …

2
Интуиция за функцией плотности t-распределений
Я изучаю t-распределение Стьюдента, и я начал задаваться вопросом, как можно получить функцию плотности t-распределений (из Википедии, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): е( t ) = Γ ( v + 12)v π--√Γ ( v2)( 1 + т2v)- V + 12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} где - степени свободы, а Γ - гамма-функция. Какова интуиция …

5
Термин частота / обратная частота документа (TF / IDF): взвешивание
У меня есть набор данных, который представляет 1000 документов и все слова, которые появляются в нем. Таким образом, строки представляют документы, а столбцы представляют слова. Так, например, значение в ячейке обозначает время, когда слово встречается в документе(i,j)(i,j)(i,j)jjj . Теперь я должен найти «веса» слов, используя метод tf / idf, но …

2
Как я могу объединить загруженные p-значения через множественные вмененные наборы данных?
Я обеспокоен проблемой, состоящей в том, что я хотел бы запустить p-значение для оценки из данных с множественным вменением (MI), но мне неясно, как объединить p-значения в наборах MI.θθ\theta Для наборов данных MI стандартный подход для получения полной дисперсии оценок использует правила Рубина. Смотрите здесь для обзора объединения наборов данных …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.