Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Что делать с корреляцией случайных эффектов, равной 1 или -1?
Нередко случается, когда имеет дело со сложными максимальными смешанными моделями (оценка всех возможных случайных эффектов для данных и модели), это идеальная (+1 или -1) или почти идеальная корреляция между некоторыми случайными эффектами. В целях обсуждения давайте рассмотрим следующую модель и краткое изложение модели Model: Y ~ X*Cond + (X*Cond|subj) # …


2
Отображение является стандартным Коши, когда является стандартным Коши
Если , найдите распределение .X∼C(0,1)X∼C(0,1)X\sim\mathcal C(0,1)Y=2X1−X2Y=2X1−X2Y=\frac{2X}{1-X^2} Мы имеемFY(y)=Pr(Y≤y)FY(y)=Pr(Y≤y)F_Y(y)=\mathrm{Pr}(Y\le y) =Pr(2X1−X2≤y)=Pr(2X1−X2≤y)\qquad\qquad\qquad=\mathrm{Pr}\left(\frac{2X}{1-X^2}\le y\right) =⎧⎩⎨⎪⎪⎪⎪⎪⎪Pr(X∈(−∞,−1−1+y2√y])+Pr(X∈(−1,−1+1+y2√y]),ify&gt;0Pr(X∈(−1,−1+1+y2√y])+Pr(X∈(1,−1−1+y2√y]),ify&lt;0={Pr(X∈(−∞,−1−1+y2y])+Pr(X∈(−1,−1+1+y2y]),ify&gt;0Pr(X∈(−1,−1+1+y2y])+Pr(X∈(1,−1−1+y2y]),ify&lt;0\qquad\qquad=\begin{cases} \mathrm{Pr}\left(X\in\left(-\infty,\frac{-1-\sqrt{1+y^2}}{y}\right]\right)+\mathrm{Pr}\left(X\in\left(-1,\frac{-1+\sqrt{1+y^2}}{y}\right]\right),\text{if}\quad y>0\\ \mathrm{Pr}\left(X\in\left(-1,\frac{-1+\sqrt{1+y^2}}{y}\right]\right)+\mathrm{Pr}\left(X\in\left(1,\frac{-1-\sqrt{1+y^2}}{y}\right]\right),\text{if}\quad y<0 \end{cases} Интересно, правильное различие в приведенном выше случае или нет. С другой стороны, следующий метод кажется более простым: Мы можем написать используя тождествоY=tan(2tan−1X)Y=tan⁡(2tan−1⁡X)Y=\tan(2\tan^{-1}X)2tanz1−tan2z=tan2z2tan⁡z1−tan2⁡z=tan⁡2z\frac{2\tan z}{1-\tan^2z}=\tan 2z ТеперьX∼C(0,1)⟹tan−1X∼R(−π2,π2)X∼C(0,1)⟹tan−1⁡X∼R(−π2,π2)X\sim\mathcal C(0,1)\implies\tan^{-1}X\sim\mathcal R\left(-\frac{\pi}{2},\frac{\pi}{2}\right) ⟹2tan−1X∼R(−π,π)⟹2tan−1⁡X∼R(−π,π)\qquad\qquad\qquad\quad\implies 2\tan^{-1}X\sim\mathcal R(-\pi,\pi) ⟹tan(2tan−1X)∼C(0,1)⟹tan⁡(2tan−1⁡X)∼C(0,1)\qquad\qquad\qquad\quad\implies\tan\left(2\tan^{-1}X\right)\sim\mathcal C(0,1) , …

3
Что выше, или
Таким образом, у меня был тест вероятности, и я не мог действительно ответить на этот вопрос. Он просто спросил что-то вроде этого: «Учитывая, что является случайной величиной, 0 , используйте правильное неравенство, чтобы доказать, что выше или равно, E (X ^ 2) ^ 3 или E (X ^ 3) ^ …

2
Ожидание квадратного корня суммы независимых квадратов равномерных случайных величин
Пусть - независимые и одинаково распределенные стандартные однородные случайные величины.X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1) Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] Ожидание легко:YnYnY_n E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} Теперь для скучной части. Чтобы применить LOTUS, мне понадобится PDF-файл …

2
Является ли свойство инвариантности оценки ML бессмысленным с точки зрения Байеса?
Каселла и Бергер утверждают свойство инвариантности оценки ML следующим образом: Тем не менее, мне кажется, что они определяют «вероятность» совершенно случайным и бессмысленным образом:ηη\eta Если я применяю основные правила теории вероятностей к простому случаю, когда , я получаю следующее: L ( η | x ) = p ( x | …

2
Усиленное обучение в нестационарной среде [закрыто]
Закрыто . Этот вопрос должен быть более сфокусированным . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он был сосредоточен только на одной проблеме, отредактировав этот пост . Закрыто 11 дней назад . В1: Существуют ли распространенные или общепринятые методы работы с нестационарной средой …


1
Дисперсионный член в разностной декомпозиции линейной регрессии
В «Элементах статистического обучения» выражение для разложения смещения дисперсии линейной модели дается как где - фактическая целевая функция, - дисперсия случайной ошибки в модели и - линейная оценка функции .F ( х 0 ) σ 2 ε у = F ( х ) + εЕr r ( x0) = σ2ε+ …

1
Имеет ли
Имеет ли подразумевает независимость X и Y ?Cov(f(X),Y)=0∀f(.)Cov(f(X),Y)=0∀f(.)\mathbb{Cov} \left(f(X),Y\right) = 0 \; \forall \; f(.)XXXYYY Я знаком только со следующим определением независимости между и Y .XXXYYY fx,y(x,y)=fx(x)fy(y)fx,y(x,y)=fx(x)fy(y) f_{x,y}(x,y) = f_x(x)f_y(y)

1
Обнаружены высокоразмерные, коррелированные данные и основные особенности / ковариаты; тестирование нескольких гипотез?
У меня есть набор данных с около 5000 часто коррелированных признаков / ковариат и двоичным ответом. Данные были переданы мне, я не собирал их. Я использую Лассо и повышение градиента для построения моделей. Я использую повторную вложенную перекрестную проверку. Я сообщаю о самых больших (абсолютных) 40 коэффициентах Лассо и 40 …

4
Можно ли разложить подогнанные остатки на отклонения и отклонения после подгонки линейной модели?
Я хотел бы классифицировать точки данных как нуждающиеся в более сложной модели или не требующие более сложной модели. Мое текущее мышление состоит в том, чтобы подогнать все данные к простой линейной модели и наблюдать размер остатков, чтобы сделать эту классификацию. Затем я немного прочитал о влиянии смещения и дисперсии на …

1
Почему байесовский вероятный интервал в этой полиномиальной регрессии смещен, тогда как доверительный интервал правильный?
Рассмотрим график ниже, на котором я смоделировал данные следующим образом. Мы смотрим на двоичный результат для которого истинная вероятность быть 1 указана черной линией. Функциональная связь между ковариатой и является полиномом 3-го порядка с логистической связью (поэтому она является нелинейной в двустороннем порядке).yobsyobsy_{obs}xxxp(yobs=1|x)p(yobs=1|x)p(y_{obs}=1 | x) Зеленая линия - это логистическая …

2
Если я хочу с вероятностью 95%, что менее 1% объектов неисправны, сколько образцов мне нужно?
Мне нужно убедиться, что моя карта сайта XML содержит менее мусора (неработающие ссылки). Список URL исчисляется сотнями тысяч, и даже если бы можно было проверить их все 1 на 1, я бы предпочел этого не делать по многим причинам:1 %1%1\% 1 - Saved bandwidth 2 - Faster traffic for real …

1
Помогите интерпретировать данные подсчета GLMM, используя lme4 glmer и glmer.nb - Отрицательный бином по Пуассону
У меня есть несколько вопросов, касающихся спецификации и интерпретации GLMM. 3 вопроса, безусловно, являются статистическими, а 2 - более конкретно о R. Я пишу здесь, потому что, в конечном счете, я думаю, что проблема заключается в интерпретации результатов GLMM. В настоящее время я пытаюсь соответствовать GLMM. Я использую данные переписи …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.