Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Должны ли мы учитывать множественные корректировки сравнений при использовании доверительных интервалов?
Предположим, у нас есть сценарий множественного сравнения, такой как постфакторный вывод по парной статистике, или, например, множественная регрессия, где мы делаем в общей сложности сравнений. Предположим также, что мы хотели бы поддержать вывод в этих кратных числах, используя доверительные интервалы.ммm 1. Применяем ли мы несколько сравнительных корректировок к КИ? То …

4
Разница ядер в SVM?
Может кто-нибудь подскажите пожалуйста разницу между ядрами в SVM: линейный многочлен Гауссовский (RBF) сигмоид Потому что, как мы знаем, ядро ​​используется для отображения нашего входного пространства в пространство пространственных объектов высокой размерности. И в этом пространстве признаков мы находим линейно отделимую границу .. Когда они используются (при каких условиях) и …

5
Стратегия борьбы с редкими событиями логистическая регрессия
Я хотел бы изучить редкие события в конечной популяции. Поскольку я не уверен, какая стратегия лучше всего подходит, я был бы признателен за советы и рекомендации, связанные с этим вопросом, хотя я хорошо понимаю, что он в значительной степени освещен. Я просто не знаю, с чего начать. Моя проблема - …

3
Распределение скалярных произведений двух случайных единичных векторов в измерениях
Если и являются двумя независимыми случайными единичными векторами в (равномерно распределенными по единичной сфере), каково распределение их скалярного произведения (точечного произведения) ?xx\mathbf{x}yy\mathbf{y}RDRD\mathbb{R}^Dx⋅yx⋅y\mathbf x \cdot \mathbf y Я думаю, что по мере роста распределение быстро (?) Становится нормальным с нулевым средним и уменьшением дисперсии в более высоких измерениях но существует ли …

1
Преобразование матрицы подобия в (евклидову) матрицу расстояний
В алгоритме «Случайный лес» Брейман (автор) строит матрицу подобия следующим образом: Посылайте все учебные примеры по каждому дереву в лесу Если два примера попадают в один и тот же лист, увеличивайте соответствующий элемент в матрице подобия на 1 Нормализовать матрицу количеством деревьев Он говорит: Близость между случаями n и k …

4
Обнаружение выбросов с использованием стандартных отклонений
После моего вопроса здесь , мне интересно , если есть сильные мнения за или против использования стандартного отклонения для выявления выбросов (например , любой Datapoint , что более чем 2 стандартное отклонение является останец). Я знаю, что это зависит от контекста исследования, например, точка данных, 48 кг, безусловно, будет выделяться …
27 outliers 

2
Оценка дисперсии в k-кратной перекрестной проверке
K-кратная перекрестная проверка может использоваться для оценки возможности обобщения данного классификатора. Могу ли я (или я должен) также вычислить объединенную дисперсию из всех проверочных прогонов, чтобы получить лучшую оценку ее дисперсии? Если нет, то почему? Я нашел документы, в которых действительно используется объединенное стандартное отклонение при выполнении перекрестной проверки . …

1
В чем разница между обобщенными оценочными уравнениями и GLMM?
Я запускаю GEE на 3-уровневых несбалансированных данных, используя ссылку logit. Как это отличается (с точки зрения выводов, которые я могу сделать, и значения коэффициентов) от GLM со смешанными эффектами (GLMM) и логит-связью? Более подробно: наблюдения представляют собой одиночные испытания Бернулли. Они сгруппированы в классы и школы. Используя R. Casewise, опущение …

3
Всегда ли хорошо отбеливать?
Обычным этапом предварительной обработки алгоритмов машинного обучения является отбеливание данных. Кажется, что всегда полезно делать отбеливание, так как оно не коррелирует данные, что упрощает их моделирование. Когда отбеливание не рекомендуется? Примечание: я имею в виду декорреляцию данных.

3
Что я должен проверить на нормальность: необработанные данные или остатки?
Я узнал, что должен проверять нормальность не на необработанных данных, а на их остатках. Должен ли я рассчитать невязки, а затем пройти тест Шапиро – Вилка? Рассчитываются остатки как: ?Xi−meanXi−meanX_i - \text{mean} Пожалуйста, посмотрите этот предыдущий вопрос для моих данных и дизайна.

2
Создайте список имен переменных в цикле for, затем присвойте им значения
Интересно, есть ли простой способ создать список переменных, используя цикл for, и указать его значение? for(i in 1:3) { noquote(paste("a",i,sep=""))=i } В приведенной выше коде, я пытаюсь создать a1, a2, a3, задающие значения 1, 2, 3. Однако, R выдает сообщение об ошибке. Спасибо за вашу помощь.
27 r 

5
Есть ли 99 процентилей или 100 процентилей? И являются ли они группами чисел, или делителями, или указателями на отдельные числа?
Есть ли 99 процентилей или 100 процентилей? Являются ли они группами чисел, или разделительными линиями, или указателями на отдельные числа? Я полагаю, что тот же вопрос будет применяться для квартилей или любого квантиля. Я читал, что индекс числа в конкретном процентиле (р), учитывая n пунктов, i = (p / 100) …
27 quantiles 

2
Нейронная сеть: для двоичной классификации использовать 1 или 2 выходных нейрона?
Предположим, я хочу сделать бинарную классификацию (что-то принадлежит классу A или классу B). Есть несколько возможностей сделать это в выходном слое нейронной сети: Используйте 1 выходной узел. Выход 0 (<0.5) считается классом A, а 1 (> = 0.5) считается классом B (в случае сигмовидной кишки) Используйте 2 выходных узла. Входные …

2
Какая разница между дисперсией и среднеквадратичной ошибкой?
Я удивлен, что об этом раньше не спрашивали, но я не могу найти вопрос на stats.stackexchange. Это формула для расчета дисперсии нормально распределенной выборки: ∑ ( X- Х¯)2n - 1Σ(Икс-Икс¯)2N-1\frac{\sum(X - \bar{X}) ^2}{n-1} Это формула для расчета среднеквадратичной ошибки наблюдений в простой линейной регрессии: Σ ( уя- у^я)2н -2Σ(Yя-Y^я)2N-2\frac{\sum(y_i - …
27 variance  error 

3
Как судить о том, что контролируемая модель машинного обучения подходит или нет?
Может кто-нибудь сказать мне, как судить, модель контролируемого машинного обучения переоснащение или нет? Если у меня нет внешнего набора данных проверки, я хочу знать, могу ли я использовать ROC с 10-кратной перекрестной проверкой, чтобы объяснить переобучение. Если у меня есть внешний набор данных проверки, что мне делать дальше?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.