Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как я могу проверить, существенно ли отличаются оценки двух параметров в одной и той же модели?
У меня есть модель y=xa×zb+ey=xa×zb+e y=x^a \times z^b + e где - зависимая переменная, и - объясняющие переменные, и - параметры, а - термин ошибки. У меня есть оценки параметров и и ковариационная матрица этих оценок. Как мне проверить , значительно ли отличаются и ?yyyxxxzzzaaabbbeeeaaabbbaaabbb

11
Является ли нормальное, но сильно искаженное распределение гауссовским?
У меня такой вопрос: как вы думаете, как выглядит распределение времени, проведенного за день на YouTube? Мой ответ таков: он, вероятно, нормально распределен и сильно перекошен. Я ожидаю, что есть один режим, в котором большинство пользователей тратят около некоторого среднего времени, а затем длинный правый хвост, поскольку некоторые пользователи являются …


2
Разница между двумя и тремя ступенями в Лестнице Причинности
В «Книге причины» Иудеи Перл он говорит о том, что он называет Лестницей Причинности, которая, по сути, представляет собой иерархию, состоящую из разных уровней причинного мышления. Самый низкий уровень связан с паттернами ассоциации в наблюдаемых данных (например, корреляция, условная вероятность и т. Д.), Следующий фокусируется на вмешательстве (что произойдет, если …
12 causality 

1
Как сделать выборку равномерно с поверхности гипер-эллипсоида (постоянное расстояние Махаланобиса)?
Существует ли способ равномерного отбора точек на поверхности, где расстояние Махаланобиса от среднего значения константы является вещественным многовариантным случаем? РЕДАКТИРОВАТЬ: Это просто сводится к точкам выборки равномерно с поверхности гипер-эллипсоида, который удовлетворяет уравнению, (x−μ)TΣ−1(x−μ)=d2.(x−μ)TΣ−1(x−μ)=d2.(x-\mu)^T \Sigma^{-1}(x-\mu) = d^2. Чтобы быть более точным, под "равномерно" я подразумеваю выборку так, что каждый элемент …

1
Является ли мета-анализ отношений шансов по сути безнадежным?
В недавней работе Norton et al. (2018) утверждают, что[ 1 ][1]^{[1]} Разные отношения шансов из одного и того же исследования нельзя сравнивать, когда статистические модели, которые приводят к оценкам отношения шансов, имеют разные объясняющие переменные, поскольку каждая модель имеет свой произвольный коэффициент масштабирования. Также нельзя сравнивать величину отношения шансов из …

1
Для усреднения модели GLM, мы усредняем прогнозы по ссылке или шкале ответов?
Вычислить усредненные по модели прогнозы по шкале отклика GLM, которая является «правильной» и почему? Вычислить усредненный прогноз по шкале канала и затем преобразовать обратно в шкалу ответов, или Обратно преобразовать прогнозы в шкалу ответов, а затем вычислить среднее по модели Прогнозы близки, но не равны, если модель является GLM. Различные …

1
Каково значение осей в t-SNE?
В настоящее время я пытаюсь обернуть голову вокруг математики t-SNE . К сожалению, есть еще один вопрос, на который я не могу ответить удовлетворительно: каково реальное значение осей в графике t-SNE? Если бы я выступил с докладом на эту тему или включил бы его в любую публикацию: как бы я …

2
Возможно ли, что AIC и BIC дают совершенно разные модели выбора?
Я выполняю модель пуассоновской регрессии с 1 переменной отклика и 6 ковариатами. Выбор модели с использованием AIC приводит к получению модели со всеми ковариатами, а также с 6 терминами взаимодействия. BIC, однако, приводит к модели только с 2 ковариатами и без условий взаимодействия. Возможно ли, что два критерия, которые выглядят …

3
Почему несколько (если не все) тесты параметрических гипотез предполагают случайную выборку?
Тесты, такие как Z, t и некоторые другие, предполагают, что данные основаны на случайной выборке. Почему? Предположим, что я занимаюсь экспериментальными исследованиями, в которых мне важнее внутренняя достоверность, чем внешняя. Итак, если моя выборка может быть немного предвзятой, хорошо, поскольку я согласился не делать вывод о гипотезе для всего населения. …

5
Определить размер выборки перед началом эксперимента или запустить эксперимент на неопределенный срок?
Я изучал статистику несколько лет назад и забыл все это, поэтому они могут показаться общими концептуальными вопросами, а не чем-то конкретным, но вот моя проблема. Я работаю на сайте электронной коммерции как UX Designer. У нас есть система A / B-тестирования, созданная много лет назад, и я начинаю сомневаться в …

3
Сохраняется ли стационарность при линейной комбинации?
Представьте, что у нас есть два процесса временных рядов, которые являются стационарными и производят: .xt,ytxt,ytx_t,y_t Является ли , также стационарным? ∀ α , β ∈ Rzt=αxt+βytzt=αxt+βytz_t=\alpha x_t +\beta y_t∀α,β∈R∀α,β∈R\forall \alpha, \beta \in \mathbb{R} Любая помощь будет оценена. Я бы сказал, да, так как он имеет представление МА.

2
Как строго обосновать выбранные коэффициенты ложноположительных / ложноотрицательных ошибок и базовое соотношение затрат?
контекст Группа социологов и статистиков ( Benjamin et al., 2017 ) недавно предположила, что типичный ложноположительный показатель ( = .05), используемый в качестве порога для определения «статистической значимости», должен быть скорректирован до более консервативного порога. ( = .005). Противоборствующая группа социологов и статистиков ( Lakens et al., 2018 ) ответила, …

1
Матричная форма обратного распространения с нормализацией партии
Нормализация партии была приписана существенным улучшениям производительности в глубоких нейронных сетях. Много материала в интернете показывает, как реализовать его на основе активации за активацию. Я уже реализовал backprop, используя матричную алгебру, и учитывая, что я работаю на языках высокого уровня (полагаясь Rcpp(и, в конечном итоге, на GPU) на плотное матричное …

5
когда
XXX иYYY - независимо распределенные случайные величины, гдеX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)} иY∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right). Каково распределениеZ=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X ? Совместная плотность (X,Y)(X,Y)(X,Y) определяется как fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x&gt;0,0&lt;y&lt;1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|<w\}} Маргинальный ПДФ является то е Z ( г ) = ∫ ∞ | z | f Z , W ( z , w )ZZZ , что меня никуда не ведет.fZ(z)=∫∞|z|fZ,W(z,w)dwfZ(z)=∫|z|∞fZ,W(z,w)dwf_Z(z)=\displaystyle\int_{|z|}^\infty f_{Z,W}(z,w)\,\mathrm{d}w …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.