Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


1
Укрощение перекоса ... Почему так много перекосов?
Я надеюсь получить более полное представление о четырех типах перекоса этого сообщества. Типы, на которые я ссылаюсь, упоминаются на странице помощи http://www.inside-r.org/packages/cran/e1071/docs/skewness . Старый метод не был упомянут на странице справки, но я все же включаю его. require(moments) require(e1071) x=rnorm(100) n=length(x) hist(x) ###############type=1 e1071::skewness(x,type=1) sqrt(n) * sum((x-mean(x))^3)/(sum((x - mean(x))^2)^(3/2)) #from …
9 skewness 

1
Как применить регрессию к основным компонентам для прогнозирования выходной переменной?
Я прочитал об основах анализа основных компонентов из учебника 1 , ссылки 1 и ссылки 2 . У меня есть набор данных из 100 переменных (включая выходную переменную Y), я хочу уменьшить переменные до 40 с помощью PCA, а затем предсказать переменную Y, используя эти 40 переменных. Проблема 1: После …
9 regression  pca 

7
Если все 1000 тестируемых пациентов не излечиваются препаратом, разве мы не можем сказать, что принимаем нулевую гипотезу?
Во многих местах я читал, что мы никогда не можем сказать, что мы «принимаем» нулевую гипотезу. Вместо этого мы должны сказать, что мы «не можем отвергнуть» нулевую гипотезу. Но я не вижу, как это согласуется с этим простым примером: предположим, мы тестируем лекарство, которое должно полностью излечить диабет в течение …

1
Оценка многоуровневых моделей логистической регрессии
Следующая многоуровневая логистическая модель с одной пояснительной переменной на уровне 1 (индивидуальный уровень) и одной пояснительной переменной на уровне 2 (групповой уровень): π 0 j = γ 00 + γ 01 z j + u 0 j … ( 2 ) π 1 j = γ 10 + γ 11 …

2
Что такое «параметр компонента дисперсии» в модели смешанного эффекта?
На странице 12 книги Бейтса о модели смешанного эффекта он описывает модель следующим образом: В конце скриншота он упоминает коэффициент относительной ковариации , зависящий от параметра дисперсионной составляющей , θΛθΛθ\Lambda_{\theta}θθ\theta не объясняя, что именно отношения. Скажем , нам дается , как бы мы выводим Л θ от него?θθ\thetaΛθΛθ\Lambda_{\theta} С другой …

1
Пакет Metafor: диагностика смещения и чувствительности
Я провожу многоуровневый метаанализ, который включает несколько статей с несколькими результатами. Поэтому я использую rma.mv()функцию. Пример кода: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) У меня есть два вопроса: Я прочитал в предыдущем запросе , что при использовании rma.mv(), ranktest()не является надежным тест воронки участка асимметрии. Однако, если образец …

2
Схемы альтернативного взвешивания для мета-анализа случайных эффектов: отсутствуют стандартные отклонения
Я работаю над метаанализом случайных эффектов, охватывающим ряд исследований, в которых не сообщается о стандартных отклонениях; все исследования указывают размер выборки. Я не верю, что можно приблизить или приписать отсутствующие данные SD. Как метаанализ, который использует сырые (нестандартные) средние различия как величину эффекта, должен быть взвешен, когда стандартные отклонения доступны …

1
Почему обратное исключение оправдано при множественной регрессии?
Не приводит ли это к переоснащению? Могут ли мои результаты быть более надежными, если я добавлю процедуру «домкрат» или процедуру начальной загрузки как часть анализа?

2
При использовании SVM зачем мне масштабировать функции?
Согласно документации объекта StandardScaler в scikit-learn: Например, многие элементы, используемые в целевой функции алгоритма обучения (например, ядро ​​RBF машин опорных векторов или регуляризаторы L1 и L2 линейных моделей), предполагают, что все объекты сосредоточены вокруг 0 ​​и имеют дисперсию в том же порядке. Если у признака есть отклонение, которое на несколько …

1
Почему оценки основных компонентов некоррелированы?
Supose - это матрица среднецентрированных данных. Матрица равна , имеет различных собственных значений и собственные векторы , ... , которые являются ортогональными.S = cov ( A ) m × m m s 1 s 2 s mAA\mathbf AS=cov(A)S=cov(A)\mathbf S=\text{cov}(\mathbf A)m×mm×mm\times mmmms1s1\mathbf s_1s2s2\mathbf s_2smsm\mathbf s_m -м главный компонент (некоторые люди называют …

1
Как использовать anova для сравнения двух моделей?
Как понимать anovaрезультат при сравнении двух моделей? Пример: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** На странице руководства указано: «Вычислить таблицы отклонений (или отклонений) для одного или нескольких подходящих объектов модели». Однако наш профессор отметил, что это может …
9 r  regression  anova 

1
Согласование деревьев ускоренной регрессии (BRT), обобщенных расширенных моделей (GBM) и машины повышения градиента (GBM)
Вопросов: В чем разница (ы) между деревьями регрессионного усиления (BRT) и обобщенными моделями (GBM)? Могут ли они быть взаимозаменяемыми? Является ли одна конкретная форма другой? Почему Риджуэй использовал фразу «Обобщенные модели ускоренной регрессии» (GBM), чтобы описать то, что Фридман ранее предлагал как «Машина повышения градиента» (GBM)? Эти две аббревиатуры идентичны, …

2
Оценка ошибки из пакета для повышения?
В Случайном Лесу каждое дерево растет параллельно на уникальной выборке данных Boostrap. Поскольку ожидается, что каждая выборка бустрапа будет содержать около 63% уникальных наблюдений, это оставляет примерно 37% наблюдений, которые можно использовать для тестирования дерева. Теперь, кажется , что в стохастической Градиент Активизации, существует также оценки похож на тот , …

2
Обратное тестирование или перекрестная проверка, когда процесс построения модели был интерактивным
У меня есть несколько прогностических моделей, производительность которых я хотел бы протестировать (например, взять мой набор данных, «перемотать» его к предыдущему моменту времени и посмотреть, как модель будет работать перспективно). Проблема в том, что некоторые из моих моделей были созданы с помощью интерактивного процесса. Например, следуя совету в Стратегиях регрессионного …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.