Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Должен ли я выбрать регрессор или классификатор Random Forest?
Я подгоняю набор данных с бинарным целевым классом по случайному лесу. В Python я могу сделать это либо randomforestclassifier, либо randomforestregressor. Я могу получить классификацию напрямую из randomforestclassifier или я могу сначала запустить randomforestregressor и вернуть набор оценочных баллов (непрерывное значение). Затем я могу найти предельное значение, чтобы вывести прогнозируемые …

4
Является ли AUC вероятностью правильной классификации случайно выбранного экземпляра из каждого класса?
Я прочитал эту подпись в газете и никогда не видел, чтобы AUC описывали таким образом где-либо еще. Это правда? Есть ли доказательство или простой способ увидеть это? На рис. 2 показана точность прогнозирования дихотомических переменных, выраженная в терминах площади под кривой рабочих характеристик приемника (AUC), которая эквивалентна вероятности правильной классификации …

3
Почему OLS-оценка коэффициента AR (1) смещена?
Я пытаюсь понять, почему OLS дает необъективную оценку процесса AR (1). Рассмотрим В этой модели строгая экзогенность нарушается, т. е. и коррелируют, а и не коррелированы. Но если это правда, то почему следующий простой вывод не выполняется? утεтут-1εтPlim βytϵt=α+βyt−1+ϵt,∼iidN(0,1).yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} y_{t} &= \alpha + \beta y_{t-1} + \epsilon_{t}, \\ \epsilon_{t} …

3
Использовать Holt-Winters или ARIMA?
Мой вопрос касается концептуальной разницы между Holt-Winters и ARIMA. Насколько я понимаю, Holt-Winters - это особый случай ARIMA. Но когда один алгоритм предпочтительнее другого? Возможно, Холт-Винтерс является инкрементным и поэтому служит встроенным (более быстрым) алгоритмом? Ждем некоторого понимания здесь.

3
Каковы преимущества ступенчатой ​​регрессии?
Я экспериментирую со ступенчатой ​​регрессией ради разнообразия в моем подходе к проблеме. Итак, у меня есть 2 вопроса: Каковы преимущества ступенчатой ​​регрессии? Каковы его конкретные сильные стороны? Что вы думаете о гибридном подходе, где вы используете ступенчатую регрессию для выбора объектов, а затем применяете регулярную регрессию, объединяя все выбранные объекты …

2
Обработка неизвестных слов в задачах моделирования языка с использованием LSTM
Для задачи обработки естественного языка (NLP) часто используют векторы word2vec в качестве вложения для слов. Тем не менее, может быть много неизвестных слов, которые не перехвачены векторами word2vec просто потому, что эти слова не видны достаточно часто в обучающих данных (многие реализации используют минимальное количество перед добавлением слова в словарь). …


1
Подгонка биномиального GLMM (glmer) к переменной отклика, которая является пропорцией или долей
Я надеюсь, что кто-то может помочь с тем, что я считаю относительно простым вопросом, и я думаю, что знаю ответ, но без подтверждения он стал тем, в чем я просто не могу быть уверен. У меня есть данные подсчета в качестве переменной ответа, и я хочу измерить, как эта переменная …

1
Вопрос о вычитании среднего значения в поезде / действительном / тестовом наборе
Я делаю предварительную обработку данных и собираюсь создать Convonets на моих данных после. Мой вопрос: скажем, у меня есть общие наборы данных со 100 изображениями, я вычислял среднее значение для каждого из 100 изображений, а затем вычитал его из каждого из изображений, затем делил его на набор обучающих и проверочных …

4
Как визуализировать два независимых t-критерия?
Каковы наиболее приемлемые способы визуализации результатов независимого двух-выборочного t-теста? Чаще всего используется числовая таблица или какой-то сюжет? Цель состоит в том, чтобы случайный наблюдатель посмотрел на фигуру и сразу увидел, что они, вероятно, из двух разных групп населения.

2
Несмещенная оценка для модели AR ( )
Рассмотрим модель AR ( ) (предполагая нулевое среднее значение для простоты):ппp ИксT= φ1Икст - 1+ … + ΦпИкст - р+ εTИксTзнак равноφ1ИксT-1+...+φпИксT-п+εT x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t Оценщик OLS (эквивалентный условному максимального правдоподобия) для является предвзятым, как отмечалось в недавнем потоке .φ : = …

1
Как интерпретировать коэффициент второй ступени в регрессии инструментальных переменных с помощью бинарного инструмента и бинарной эндогенной переменной?
(довольно длинный пост, извините. Он включает в себя много дополнительной информации, поэтому не стесняйтесь переходить к вопросу внизу.) Введение: я работаю над проектом, в котором мы пытаемся определить влияние двоичной эндогенной переменной, , на непрерывный результат, . Мы придумали инструмент , который, по нашему убеждению, назначен случайным образом.x1x1x_1yyyz1z1z_1 Данные: сами …

4
Когда использовать градиентный спуск против Монте-Карло в качестве метода численной оптимизации
Когда набор уравнений не может быть решен аналитически, тогда мы можем использовать алгоритм градиентного спуска. Но, похоже, существует также метод моделирования Монте-Карло, который можно использовать для решения задач, которые не имеют аналитических решений. Как определить, когда использовать градиентный спуск, а когда - Монте-Карло? Или я просто путаю термин «симуляция» с …


2
Кластеризация очень искаженных, подсчитываемых данных: есть ли какие-либо предложения (трансформировать и т.д.)
Основная проблема Вот моя основная проблема: я пытаюсь кластеризовать набор данных, содержащий некоторые очень искаженные переменные со счетчиками. Переменные содержат много нулей и поэтому не очень информативны для моей процедуры кластеризации, которая, вероятно, будет алгоритмом k-средних. Хорошо, вы говорите, просто преобразуйте переменные, используя квадратный корень, блок-кокс или логарифм. Но так …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.