Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Какова связь между частичными наименьшими квадратами, регрессией пониженного ранга и регрессией главных компонент?
Являются ли регрессия с пониженным рангом и регрессия главных компонентов просто частными случаями частичных наименьших квадратов? В этом руководстве (Страница 6, «Сравнение целей») утверждается, что когда мы делаем частичные наименьшие квадраты без проецирования X или Y (то есть «не частичные»), оно становится соответственно уменьшенной ранговой регрессией или регрессией главных компонент. …

4
Почему мы говорим, что переменная результата «регрессирует» на предиктор (ы)?
Есть ли интуитивное объяснение этой терминологии? Почему это так, а не предсказатель (ы) регрессируют на результат? В идеале я надеюсь, что правильное объяснение того, почему существует эта терминология, поможет студентам запомнить ее и помешать им сказать это неправильно.


3
Когда работает максимальная вероятность, а когда нет?
Меня смущает метод максимального правдоподобия по сравнению, например, с вычислением среднего арифметического. Когда и почему максимальное правдоподобие дает «лучшие» оценки, чем, например, среднее арифметическое? Как это проверяется?

1
Как смоделировать неотрицательные данные с нулевой раздувкой?
В настоящее время я пытаюсь применить линейную модель ( family = gaussian) к индикатору биоразнообразия, который не может принимать значения ниже нуля, имеет нулевое раздувание и непрерывен. Значения варьируются от 0 до чуть более 0,25. Как следствие, в остатках модели есть довольно очевидная закономерность, от которой мне не удалось избавиться: …

3
Дискриминантный анализ против логистической регрессии
Я нашел некоторые плюсы дискриминантного анализа, и у меня есть вопросы о них. Так: Когда классы хорошо разделены, оценки параметров для логистической регрессии удивительно нестабильны. Коэффициенты могут уходить в бесконечность. LDA не страдает от этой проблемы. Если число признаков мало и распределение предикторов ИксИксX приблизительно нормальное в каждом из классов, …


2
Линейность дисперсии
Я думаю, что следующие две формулы верны: V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) XVar(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) то время как a является постоянным числом если , независимыVar(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY Тем не менее, я …

1
R пакет для взвешенного случайного леса? вариант classwt?
Я пытаюсь использовать Случайный Лес, чтобы предсказать исход крайне несбалансированного набора данных (уровень меньшинства составляет около 1% или даже меньше). Поскольку традиционный алгоритм случайного леса минимизирует общую частоту ошибок, вместо того, чтобы уделять особое внимание классам меньшинства, он не применим напрямую к несбалансированным данным. Поэтому я хочу назначить высокую цену …
16 r  random-forest 

1
В теории статистического обучения, нет ли проблемы переоснащения на тестовом наборе?
Давайте рассмотрим проблему классификации набора данных MNIST. Согласно веб -странице MNIST Яна ЛеКуна , «Ciresan et al.» получил 0,23% ошибок в тестовом наборе MNIST с использованием сверточной нейронной сети. Давайте обозначим обучающий набор MNIST как , тестовый набор MNIST как , окончательную гипотезу, которую они получили, используя качестве , и …

3
Что именно является дистрибутивом?
Я очень мало знаю о вероятности и статистике, и я хочу учиться. Я вижу слово «распространение», используемое повсеместно в разных контекстах. Например, дискретная случайная величина имеет «распределение вероятностей». Я знаю что это. Непрерывная случайная величина имеет функцию плотности вероятности, тогда для интеграл от до функции плотности вероятности является кумулятивной функцией …

2
Апостериорный тест для критерия пригодности хи-квадрат
Я провожу тест на соответствие критерию хи-квадрат (GOF) с тремя категориями и специально хочу проверить нулевое, что пропорции населения в каждой категории равны (то есть пропорция составляет 1/3 в каждой группе): НАБЛЮДЕННЫЕ ДАННЫЕ Группа 1 Группа 2 Группа 3 Всего 686 928 1012 2626 Таким образом, для этого теста GOF …

3
Почему достаточная статистика содержит всю информацию, необходимую для вычисления какой-либо оценки параметра?
Я только начал изучать статистику, и я не могу получить интуитивное понимание достаточности. Чтобы быть более точным, я не могу понять, как показать, что следующие два абзаца эквивалентны: Грубо говоря, с учетом набора X независимых идентично распределенных данных, обусловленных неизвестным параметром θ, достаточной статистикой является функция T (X), значение которой …

1
Почему «расслабленное лассо» отличается от стандартного лассо?
Если мы начнем с набора данных , применим к нему Лассо и получим решение , мы можем снова применить Лассо к набору данных , где - это набор ноль индексов , чтобы получить решение, , называемое «расслабленным решением LASSO» (поправьте меня, если я ошибаюсь!). Решение должно удовлетворять условиям Каруша-Куна-Такера (KKT) …

2
Почему GLM отличается от LM с преобразованной переменной
Как поясняется в раздаточном материале этого курса (стр. 1) , линейная модель может быть записана в виде: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, где - переменная ответа, а - пояснительная переменная .yyyxixix_{i}ithithi^{th} Часто с целью удовлетворения предположений теста можно преобразовать переменную ответа. Например, мы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.