Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


2
Простой пример, демонстрирующий преимущества Байесовского модельного усреднения (BMA)
Я включил подход Байесовского модельного усреднения (BMA) в свои исследования и скоро представлю мои работы коллегам. Однако BMA на самом деле не так хорошо известен в моей области, поэтому, представив им всю теорию и прежде чем применить ее к моей проблеме, я хочу привести простой, но поучительный пример того, почему …



2
Интерпретация модели логистической регрессии с несколькими предикторами
Я выполнил многомерную логистическую регрессию с зависимой переменной, Yявляющейся смертью в доме престарелых в течение определенного периода времени, и получил следующие результаты (обратите внимание, что переменные, начинающиеся в Aнем, являются непрерывным значением, а те, которые начинаются в, Bявляются категоричными): Call: glm(Y ~ A1 + B2 + B3 + B4 + …
12 r  regression  logistic 

1
MLE для распределения треугольников?
Можно ли применить обычную процедуру MLE к распределению треугольника? - Я пытаюсь, но я, кажется, заблокирован на том или ином этапе в математике, как определяется распределение. Я пытаюсь использовать тот факт, что я знаю количество выборок выше и ниже c (не зная c): эти 2 числа - cn и (1-c) …

1
Что такое «начальные значения» в функции glm ()?
Какие параметры start, etastart, mustartв GLM () функцию ? Я искал в документах и ​​Интернете, но я не нашел четкого объяснения, что это значит. Это похоже на байесовские «начальные значения» для цепочек, но я сомневаюсь, что это связано, так как функция glm () в R является статистикой частых ...

3
Дисперсионно-ковариационная матрица ошибок в линейной регрессии
Как на практике вычисляется матрица ошибок var / cov с помощью пакетов статистического анализа? Эта идея понятна мне в теории. Но не на практике. Я имею в виду, что если у меня есть вектор случайных величин , я понимаю, что матрице дисперсии / ковариации Σ будет дан внешний продукт отклонения …

1
Установить начальное число перед каждым блоком кода или один раз для каждого проекта?
Это стандартный совет, чтобы установить случайное семя, чтобы результаты могли быть воспроизведены. Однако, поскольку начальное число продвигается, когда рисуются псевдослучайные числа, результаты могут измениться, если какой-либо фрагмент кода будет рисовать дополнительное число. На первый взгляд, управление версиями выглядит как решение этой проблемы, поскольку, по крайней мере, оно позволит вам вернуться …

2
Начинающий PyMC: как на самом деле сделать выборку из подобранной модели
Я пробую очень простую модель: подгонка к нормальному, где я предполагаю, что знаю точность, и я просто хочу найти среднее. Код ниже, кажется, соответствует нормальному. Но после подгонки я хочу взять образец из модели, т.е. сгенерировать новые данные, которые похожи на мою dataпеременную. Я знаю, что могу использовать, trace("mean")чтобы получить …
12 mcmc  pymc 

1
Какова оптимальная функция расстояния для людей, когда атрибуты являются номинальными?
Я не знаю, какую функцию расстояния между людьми использовать в случае номинальных (неупорядоченных категориальных) атрибутов. Я читал какой-то учебник, и они предлагают функцию простого сопоставления, но некоторые книги предлагают, чтобы я изменил номинальные на двоичные атрибуты и использовал коэффициент Джакарда . Однако что если значения номинального атрибута не равны 2? …

2
Как вектор переменных может представлять гиперплоскость?
Я читаю Элементы статистического обучения и на странице 12 (раздел 2.3) линейная модель обозначается как: Yˆ= ХTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... где - транспонирование вектора-столбца предикторов / независимых переменных / входных данных. ( В нем говорится , ранее «все векторы предполагаются векторы - столбцов» , так что это не сделаешь …

1
Что делать, если выборочная ковариационная матрица не обратима?
Я работаю над некоторыми методами кластеризации, где для данного кластера векторов d-размерности я предполагаю многомерное нормальное распределение и вычисляю выборочный средний вектор d-размерности и выборочную ковариационную матрицу. Затем, пытаясь решить, принадлежит ли новый, невидимый, d-мерный вектор этому кластеру, я проверяю его расстояние с помощью этой меры: (Xi−μ^X)′σ^−1X(Xi−μ^X)>B0.95(p2,−p2)(Xi−μ^X)′σ^X−1(Xi−μ^X)>B0.95(p2,−p2)\left(X_i-\hat{\mu}_X\right)'\hat{\sigma}_X^{-1}\left(X_i-\hat{\mu}_X\right)>B_{0.95}\left(\frac{p}{2},\frac{-p}{2}\right) Что требует от …

1
Как найти дисперсию между многомерными точками?
Предположим, у меня есть матрица X, которая равна n на p, т.е. она имеет n наблюдений, причем каждое наблюдение в p-мерном пространстве. Как мне найти дисперсию этих n наблюдений? В случае, когда р = 1, мне просто нужно использовать формулу регулярной дисперсии. Как насчет случаев, когда р> 1.
12 variance 

3
Количество значащих цифр для отчета
Существует ли более научный способ определения количества значащих цифр, сообщаемых для среднего значения или доверительного интервала в ситуации, которая является довольно стандартной - например, первый год обучения в колледже. Я видел количество значащих цифр в таблице : почему мы не используем значащие цифры и количество значащих цифр в квадратной форме …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.