Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Разъяснения относительно чтения номограммы
Ниже приведена номограмма, созданная из набора данных mtcars с пакетом rms для формулы: mpg ~ wt + am + qsec Сама модель кажется хорошей с R2 0,85 и P <0,00001 > mod Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination …

2
Помимо теста Дурбина-Уотсона, какие проверки гипотез могут дать неубедительные результаты?
Тестовая статистика Дарбины-Уотсон может лежать в безрезультатной области, где не возможно либо отклонить или не отвергнуть нулевую гипотезу (в данном случае, нулевой автокорреляции). Какие другие статистические тесты могут дать "неубедительные" результаты? Существует ли общее объяснение (хорошо машет рукой), почему этот набор тестов не может принять двоичное решение «отклонить» / «не …


4
Как избежать лог (0) термин в регрессии
У меня есть следующие простые векторы X и Y: > X [1] 1.000 0.063 0.031 0.012 0.005 0.000 > Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 > > plot(X,Y) Я хочу сделать регрессию с использованием журнала X. Чтобы избежать получения журнала (0), я стараюсь положить +1 или +0,1 или …

1
Медиана является «метрическим» или «топологическим» свойством?
Я прошу прощения за небольшое злоупотребление терминологией; Надеюсь, станет понятно, что я имею в виду ниже. Рассмотрим случайную величину . Как среднее значение, так и медиана могут быть охарактеризованы критерием оптимальности: среднее значение - это число которое минимизирует , а медиана - это число, которое минимизирует . С этой точки …
10 mean  median 

1
Случайный лес против Adaboost
В разделе 7 статьи « Случайные леса» (Брейман, 1999) автор высказывает следующую гипотезу: «Adaboost - это случайный лес». Кто-нибудь доказал или опроверг это? Что было сделано, чтобы доказать или опровергнуть этот пост 1999 года?

1
Вывод функции правдоподобия для IV-пробита
Итак, у меня есть двоичная модель, где - скрытая ненаблюдаемая переменная, а - наблюдаемая. определяет а - мой инструмент. Так что короче модель есть. Так как условия ошибки не являются независимыми, Я использую модель IV-пробита.y∗1y1∗y_1^*y1∈{0,1}y1∈{0,1}y_1 \in \{0,1\}y2y2y_2y1y1y_1z2z2z_2y∗1y2y1===δ1z1+α1y2+u1δ21z1+δ22z2+v2=zδ+v21[y∗>0]y1∗=δ1z1+α1y2+u1y2=δ21z1+δ22z2+v2=zδ+v2y1=1[y∗>0]\begin{eqnarray} y_1^*&=& \delta_1 z_1 + \alpha_1 y_2 + u_1 \\ y_2 &=& \delta_{21} z_1 …

2
Что такое предварительная подготовка и как вы обучаете нейронную сеть?
Я понимаю, что предварительная подготовка используется, чтобы избежать некоторых проблем с обычным обучением. Если я использую обратное распространение, скажем, с помощью автоматического кодера, я знаю, что у меня возникнут проблемы со временем, потому что обратное распространение идет медленно, а также что я могу застрять в локальном оптимуме и не изучить …

1
Как проверить, влияет ли «предыдущее состояние» на «последующее состояние» в R
Представьте себе ситуацию: у нас есть исторические записи (20 лет) о трех шахтах. Увеличивает ли присутствие серебра вероятность обнаружения золота в следующем году? Как проверить такой вопрос? Вот пример данных: mine_A <- c("silver","rock","gold","gold","gold","gold","gold", "rock","rock","rock","rock","silver","rock","rock", "rock","rock","rock","silver","rock","rock") mine_B <- c("rock","rock","rock","rock","silver","rock","rock", "silver","gold","gold","gold","gold","gold","rock", "silver","rock","rock","rock","rock","rock") mine_C <- c("rock","rock","silver","rock","rock","rock","rock", "rock","silver","rock","rock","rock","rock","silver", "gold","gold","gold","gold","gold","gold") time <- seq(from = 1, …

1
PCA все еще делается через собственное разложение ковариационной матрицы, когда размерность больше, чем число наблюдений?
У меня есть матрица X размером , содержащая мои N = 20 выборок в D = 100- мерном пространстве. Теперь я хочу написать свой собственный анализ основных компонентов (PCA) в Matlab. Сначала я унижаю X до X 0 .20×10020×10020\times100XXXN=20N=20N=20D=100D=100D=100XXXX0X0X_0 Я читал из чьего-то кода, что в таких сценариях, где у …
10 pca 

2
Кто-нибудь когда-нибудь находил данные, где работают модели ARCH и GARCH?
Я аналитик в области финансов и страхования, и всякий раз, когда я пытаюсь соответствовать моделям волатильности, я получаю ужасные результаты: остатки часто нестационарны (в смысле единичного корня) и гетероскедастичны (поэтому модель не объясняет волатильность). Возможно, модели ARCH / GARCH работают с данными другого типа? Отредактировано 17/04/2015 15:07 для уточнения некоторых …

1
Последующее тестирование в multcomp :: glht для моделей со смешанными эффектами (lme4) с взаимодействиями
Я выполняю специальные тесты на линейной модели смешанных эффектов в R( lme4пакет). Я использую multcompпакет ( glht()функцию) для выполнения специальных тестов. Мой экспериментальный дизайн - повторные измерения со случайным эффектом блока. Модели указаны как: mymod <- lmer(variable ~ treatment * time + (1|block), data = mydata, REML = TRUE) Вместо …

4
Предположим, что
Как предлагается в заголовке. Предположим, что X1,X2,…,XnX1,X2,…,XnX_1, X_2, \dotsc, X_n - непрерывные случайные величины с pdf fff . Рассмотрим случай, когда X1≤X2…≤XN−1>XNX1≤X2…≤XN−1>XNX_1 \leq X_2 \dotsc \leq X_{N-1} > X_N , N≥2N≥2N \geq 2 , поэтому NNN - это когда последовательность уменьшается в первый раз. Тогда каково значение E[N]E[N]E[N] ? Я …

1
Доверительные интервалы из теста Холма-Бонферрони?
Я новичок в проблеме множественных сравнений. Интересно, как рассчитать доверительные интервалы для метода Холма-Бонферрони? Я знаю, что для метода Бонферрони мы можем просто изменить уровень достоверности с на .1 - α1-α1-\alpha1 - αм1-αм1-\frac{\alpha}{m} Этот метод также работает для Холма-Бонферрони? E d i t :ЕdяT:\bf{Edit}: кажется, что метод HB не предоставляет …

2
Применение PCA для проверки данных в целях классификации
Недавно я узнал о замечательном PCA, и я сделал пример, изложенный в документации scikit-learn . Мне интересно знать, как я могу применить PCA к новым точкам данных для целей классификации. После визуализации PCA в двухмерной плоскости (ось x, y) я вижу, что, вероятно, могу нарисовать линию, чтобы отделить точки данных, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.