Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Ссылки и лучшие практики для установки семян в генерации псевдослучайных чисел
В этом документе , касающемся команды «set seed», сотрудники Stata обсуждают вопросы, связанные с установкой seed при генерации псевдослучайных чисел. Примечательным «не» является «не использовать последовательно последовательность натуральных чисел в качестве начальных чисел, потому что это имеет паттерн и ставит под угрозу псевдослучайность». Только одна четверть примечательного «до» - это …

2
Что такое распределение логов?
Я читаю учебник по машинному обучению (Data Mining by Witten, et al., 2011) и наткнулся на этот отрывок: ... Кроме того, могут использоваться разные дистрибутивы. Хотя нормальное распределение обычно является хорошим выбором для числовых атрибутов, оно не подходит для атрибутов, которые имеют заранее определенный минимум, но не имеют верхней границы; …

2
Если временной ряд является стационарным второго порядка, означает ли это, что он является строго стационарным?
Процесс является строго стационарным , если совместное распределение X т 1 , Х т 2 , . , , , Х т т такое же , как совместное распределение X т 1 + K , X т 2 + к , . , , , X t m + k …

3
Что такое хороший AUC для кривой точного возврата?
Поскольку у меня очень несбалансированный набор данных (9% положительных результатов), я решил, что кривая точного отзыва была более подходящей, чем кривая ROC. Я получил аналогичную сводную меру площади под кривой PR (.49, если вам интересно), но не уверен, как ее интерпретировать. Я слышал, что 0,8 или выше - это то, …

2
Как выполнить остаточный анализ для бинарных / дихотомических независимых предикторов в линейной регрессии?
Я выполняю множественную линейную регрессию ниже в R, чтобы предсказать доходность управляемого фонда. reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) Здесь только GRI и MBA являются бинарными / дихотомическими предикторами; остальные предикторы являются непрерывными. Я использую этот код для генерации остаточных графиков для двоичных переменных. plot(rawdata$GRI, reg$residuals) abline(lm(reg$residuals~rawdata$GRI, data=rawdata), col="red") # regression line …


2
Можно ли принять альтернативную гипотезу?
Мне известно о нескольких связанных с этим вопросах (например, терминология проверки гипотез, окружающая нуль , возможно ли доказать нулевую гипотезу? ), Но я не знаю окончательного ответа на мой вопрос ниже. Предположим, что мы проверяем гипотезу о том, честна ли монета или нет. У нас есть две гипотезы: H0:p(head)=0.5H0:p(head)=0.5H_0: p(head)=0.5 …

1
регрессия для угловых / круговых данных
Я контролировал проблему обучения, где цели - это углы. Если бы я выполнил простую регрессию, то числа 360 и 1 были бы далеко для моей модели, но на самом деле они близки и предсказывать координаты x и y нехорошо, так как я пытаюсь предсказать здесь только одно число. Как правильно …

1
Задержка заказа на тест причинности Грейнджер
Предположим, я рассматриваю несколько независимых переменных для возможного включения в разрабатываемую модель ARIMAX. Прежде чем подгонять различные переменные, я бы хотел отобрать переменные, которые проявляют обратную причинность, с помощью теста Грейнджера (я использую granger.testфункцию из MSBVARпакета в R, хотя, я полагаю, другие имплиментации работают аналогично). Как определить, сколько лагов нужно …

2
Обнаружение выбросов с использованием регрессии
Может ли регрессия использоваться для внешнего обнаружения. Я понимаю, что существуют способы улучшить регрессионную модель путем устранения выбросов. Но основная цель здесь не в том, чтобы подогнать регрессионную модель, а в том, чтобы выяснить, кто использует регрессию.

4
Как справиться с отсутствующими значениями, чтобы подготовить данные для выбора функции с помощью LASSO?
Моя ситуация: небольшой размер выборки: 116 двоичная переменная результата длинный список объясняющих переменных: 44 объясняющие переменные не исходили из головы; их выбор был основан на литературе. В большинстве случаев в выборке и в большинстве переменных отсутствуют значения. Подход к выбору функции выбран: LASSO Пакет R glmnet не позволит мне запустить …

1
Плюсы дистанции Джеффриса Матуситы
Согласно какой-то статье, которую я читаю, расстояние Джеффриса и Матуситы обычно используется. Но я не мог найти много информации об этом, кроме формулы ниже JMD (x, y) =∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} Это похоже на евклидово расстояние, за исключением квадратного корня E (x, y) =∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} JM расстояние считается более надежным, чем евклидово расстояние с …

2
Процентные функции потери
Решение проблемы: минмЕ[ | м - х| ]minmE[|m−X|] \min_{m} \; E[|m-X|] Хорошо известно, что это медиана , но как выглядит функция потерь для других процентилей? Пример: 25-й процентиль X является решением для:ИксXX минмЕ[ L ( м , х) ]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] Что такое LLL в этом случае?

5
Алгоритм Метрополис Гастингс
Мне нужно изучить методы Марковской цепочки Монте-Карло, чтобы быть более конкретным, мне нужно изучить алгоритм Метрополиса Гастингса и все о нем, как критерии сходимости. Кто может назначить мне книгу, или газету, или веб-сайт, который объясняет этот аргумент простыми терминами, но без тривиальности?
11 references  mcmc 

3
Как обучить (логистическую?) Регрессию в R с использованием функции потерь L1?
Я могу обучить логистической регрессии в Rиспользовании glm(y ~ x, family=binomial(logit))) но, IIUC, это оптимизирует для логарифмической вероятности. Есть ли способ обучить модель, используя линейную ( ) функцию потерь (которая в этом случае такая же, как общее расстояние изменения )?L1L1L_1 Т.е., учитывая числовой вектор и битовый (логический) вектор , я …
11 logistic 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.