Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Что подразумевается под «Пусть данные говорят сами за себя»?
Читая следующую статью , я натолкнулся на следующее утверждение: Как уже упоминалось, он часто представлен без какой-либо ссылки на вероятностные модели, в соответствии с идеей Benzecri [1973] «позволить данным говорить самим за себя». (Цитата из JP Benzécri. L'analyse des données. Том II: L'analyse des соответствия. Dunod, 1973.) Из того, как …
10 eda  quotation 

2
Какова вероятность того, что задано ?
Предположим, что XXX и YYY двумерные нормальные со средним μ=(μ1,μ2)μ=(μ1,μ2)\mu=(\mu_1,\mu_2) и ковариацией Σ=[σ11σ12σ12σ22]Σ=[σ11σ12σ12σ22]\Sigma = \begin{bmatrix} \sigma_{11} & \sigma_{12} \\ \sigma_{12} & \sigma_{22} \\ \end{bmatrix} . Какова вероятность Pr(X&lt;Y|min(X,Y))Pr(X&lt;Y|min(X,Y))\Pr\left(X<Y|\min\left(X,Y\right)\right) ?

1
О существовании УМВУЭ и выборе оценки в популяции
Пусть представляет собой случайную выборку взяты из население , где .(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n)N(θ,θ2)N(θ,θ2)\mathcal N(\theta,\theta^2)θ∈Rθ∈R\theta\in\mathbb R Я ищу UMVUE of .θθ\theta Совместная плотность составляет(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n) fθ(x1,x2,⋯,xn)=∏i=1n1θ2π−−√exp[−12θ2(xi−θ)2]=1(θ2π−−√)nexp[−12θ2∑i=1n(xi−θ)2]=1(θ2π−−√)nexp[1θ∑i=1nxi−12θ2∑i=1nx2i−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈Rfθ(x1,x2,⋯,xn)=∏i=1n1θ2πexp⁡[−12θ2(xi−θ)2]=1(θ2π)nexp⁡[−12θ2∑i=1n(xi−θ)2]=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈R\begin{align} f_{\theta}(x_1,x_2,\cdots,x_n)&=\prod_{i=1}^n\frac{1}{\theta\sqrt{2\pi}}\exp\left[-\frac{1}{2\theta^2}(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[-\frac{1}{2\theta^2}\sum_{i=1}^n(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right] \\&=g(\theta,T(\mathbf x))h(\mathbf x)\qquad\forall\,(x_1,\cdots,x_n)\in\mathbb R^n\,,\forall\,\theta\in\mathbb R \end{align} , где и .h(x)=1g(θ,T(x))=1(θ2π√)nexp[1θ∑ni=1xi−12θ2∑ni=1x2i−n2]g(θ,T(x))=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]g(\theta, T(\mathbf x))=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right]h(x)=1h(x)=1h(\mathbf x)=1 Здесь зависит от и от до и не зависит от …

3
MAP является решением
Я столкнулся с этими слайдами (слайд № 16 и № 17) на одном из онлайн-курсов. Преподаватель пытался объяснить, как максимальная апостериорная оценка (MAP) на самом деле является решением L(θ)=I[θ≠θ∗]L(θ)=I[θ≠θ∗]L(\theta) = \mathcal{I}[\theta \ne \theta^{*}] , где - истинный параметр.θ∗θ∗\theta^{*} Может кто-нибудь объяснить, пожалуйста, как это следует? Изменить: Добавлены слайды, если ссылка …

1
Отрицательные вероятности: объяснения дилетанта
Я был очень заинтригован ответом здесь. Я хотел бы получить более понятное объяснение того, что могут означать отрицательные вероятности и их применения, возможно, с примерами. Например, что бы это значило для события с вероятностью -10%, согласно этим расширенным мерам вероятности?

2
UMVUE при выборке из популяции
Пусть - случайная выборка из плотности(X1,X2,…,Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n)fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 Я пытаюсь найти UMVUE .θ1+θθ1+θ\frac{\theta}{1+\theta} Совместная плотность является(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n) fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp[(θ−1)∑i=1nlnxi+nlnθ+ln(10&lt;x1,…,xn&lt;1)],θ&gt;0fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp⁡[(θ−1)∑i=1nln⁡xi+nln⁡θ+ln⁡(10&lt;x1,…,xn&lt;1)],θ&gt;0\begin{align} f_{\theta}(x_1,\cdots,x_n)&=\theta^n\left(\prod_{i=1}^n x_i\right)^{\theta-1}\mathbf1_{00 \end{align} Поскольку совокупность pdf относится к семипараметрическому экспоненциальному семейству, это показывает, что полной достаточной статистикой для являетсяfθfθf_{\theta}θθ\thetaT(X1,…,Xn)=∑i=1nlnXiT(X1,…,Xn)=∑i=1nln⁡XiT(X_1,\ldots,X_n)=\sum_{i=1}^n\ln X_i Так как , на первый взгляд даст мне UMVUE от Теорема Лемана-Шеффе. Не уверен, …

3
Интуиция за формулой для дисперсии суммы двух переменных
Я знаю из предыдущих исследований, что Var(A+B)=Var(A)+Var(B)+2Cov(A,B)Вaр(A+В)знак равноВaр(A)+Вaр(В)+2Соv(A,В)Var(A+B) = Var(A) + Var(B) + 2 Cov (A,B) Однако я не понимаю, почему это так. Я вижу, что эффект будет «увеличивать» дисперсию, когда А и В сильно коваризуются. Имеет смысл, что, когда вы создаете композит из двух сильно коррелированных переменных, вы будете …

2
Распределение и дисперсия числа треугольников в случайном графе
Рассмотрим случайный граф Эрдоса-Реньи G=(V(n),E(p))G=(V(n),E(p))G=(V(n),E(p)) . Множество nnn вершин VVV помечено V={1,2,…,n}V={1,2,…,n}V = \{1,2,\ldots,n\} . Множество ребер EEE строится случайным процессом. Пусть ppp - вероятность 0&lt;p&lt;10&lt;p&lt;10<p<1 , тогда каждая неупорядоченная пара вершин {i,j}{i,j}\{i,j\} ( i≠ji≠ji \neq j ) встречается как ребро в EEE с вероятностью ppp независимо от других пар. …

3
«Прагматичные» испытания: кто они?
В твиттере судебный исполнитель Стюарт Николлс критиковал недавно опубликованное исследование, сказав: В дополнение к очень интересной статье Даль-Ре они отмечают несколько примеров, которые ставят под сомнение использование термина прагматический. Можно ли в действительности назвать «прагматическим» рандомизированное исследование с 3-мя участками, двойным слепым, плацебо-контролируемым, с параллельным отягощением и дозой с повышением …

2
Обоснование для модели с фиксированными и случайными эффектами в метаанализе
Я читал несколько публикаций, пытаясь оправдать использование модели с фиксированными эффектами с заявлениями в духе «модель с фиксированными эффектами была выбрана потому, что гетерогенность была низкой». Тем не менее, я обеспокоен тем, что это может быть неуместный подход к анализу данных. Существуют ли причины или публикации, в которых обсуждается, может …

2
Точная выборка из неправильных смесей
Предположим, я хочу сделать выборку из непрерывного распределения . Если у меня есть выражение в видерp(x)p(x)p(x)ppp p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) где и f_i - это распределения, из которых можно легко брать выборки, тогда я могу легко сгенерировать выборки из p :ai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1 рfifif_ippp Выборка метки …

4
Почему тесты гипотез на переделанных наборах данных слишком часто отклоняют нуль?
tl; dr: Начиная с набора данных, сгенерированного под нулевым значением, я повторно проанализировал случаи с заменой и провел проверку гипотезы для каждого повторно выбранного набора данных. Эти проверки гипотез отклоняют ноль более 5% времени. В приведенном ниже очень простом моделировании я генерирую наборы данных с X∼N(0,1)⨿Y∼N(0,1)X∼N(0,1)⨿Y∼N(0,1)X \sim N(0,1) \amalg Y …

3
Является ли предположение о линейности в линейной регрессии просто определением
Я пересматриваю линейную регрессию. Учебник Грина гласит: Теперь, конечно, будут другие предположения о модели линейной регрессии, такие как . Это предположение в сочетании с предположением о линейности (которое в действительности определяет ) создает структуру модели.ϵЕ( ϵ | X) = 0E(ϵ|X)=0E(\epsilon|X)=0εϵ\epsilon Однако само по себе предположение о линейности не создает никакой …

5
Как измерить дисперсию в данных частоты слов?
Как я могу определить количество дисперсии в векторе количества слов? Я ищу статистику, которая будет высокой для документа A, потому что она содержит много разных слов, которые встречаются редко, и низкой для документа B, потому что она содержит одно слово (или несколько слов), которые встречаются часто. В более общем смысле, …

1
LASSO отношения между
Мое понимание регрессии LASSO заключается в том, что коэффициенты регрессии выбираются для решения проблемы минимизации: minβ∥y−Xβ∥22 s.t.∥β∥1≤tminβ‖y−Xβ‖22 s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t На практике это делается с использованием множителя Лагранжа, что позволяет решить проблему minβ∥y−Xβ∥22+λ∥β∥1minβ‖y−Xβ‖22+λ‖β‖1\min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 Какая связь между …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.