Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
стохастик против детерминированной тенденции / сезонности в прогнозировании временных рядов
У меня умеренный фон в прогнозировании временных рядов. Я просмотрел несколько книг по прогнозированию и не вижу следующих вопросов, адресованных ни в одной из них. У меня есть два вопроса: Как бы я определил объективно (с помощью статистического теста), имеет ли данный временной ряд: Стохастическая сезонность или детерминированная сезонность Стохастический …

3
Площадь под кривой ROC или область под кривой PR для несбалансированных данных?
У меня есть некоторые сомнения по поводу того, какую меру эффективности использовать: область под кривой ROC (TPR как функция FPR) или область под кривой точности-отзыва (точность как функция отзыва). Мои данные несбалансированы, то есть количество отрицательных экземпляров намного больше, чем положительных. Я использую выходной прогноз Weka, пример: inst#,actual,predicted,prediction 1,2:0,2:0,0.873 2,2:0,2:0,0.972 …

1
Значение предупреждения о сходимости в glmer
Я использую glmerфункцию из lme4пакета в R, и я использую bobyqaоптимизатор (т.е. по умолчанию в моем случае). Я получаю предупреждение, и мне любопытно, что это значит. Warning message: In optwrap(optimizer, devfun, start, rho$lower, control = control, : convergence code 3 from bobyqa: bobyqa -- a trust region step failed to …

1
Подготовка базового марковского случайного поля для классификации пикселей на изображении
Я пытаюсь научиться использовать случайные поля Маркова для сегментирования областей на изображении. Я не понимаю некоторые параметры в MRF или почему максимизация ожидания, которую я выполняю, иногда не сходится к решению. Исходя из теоремы Байеса, я имею , где y - значение серой шкалы пикселя, а x - метка класса. …

7
Пересмотр двух конвертов
Я думал об этой проблеме. http://en.wikipedia.org/wiki/Two_envelopes_problem Я верю в решение и думаю, что понимаю его, но если я выберу следующий подход, я полностью запутался. Проблема 1: Я предложу вам следующую игру. Вы платите мне 10 долларов, а я подброшу честную монету. Головы я даю вам 5 долларов, а хвосты - …

4
Ожидаемое значение медианы выборки, учитывая среднее значение выборки
Пусть обозначает медиану, а обозначает среднее случайной выборки размером из распределения . Как я могу вычислить ?Y ˉ X n = 2 k + 1 N ( μ , σ 2 ) E ( Y | ˉ X = ˉ x )YYX¯\bar{X}n=2k+1n=2k+1N(μ,σ2)N(\mu,\sigma^2)E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x}) Интуитивно понятно, что из предположения о нормальности имеет …

4
Во что верить: тест Колмогорова-Смирнова или сюжет QQ?
Я пытаюсь определить, соответствует ли мой набор данных непрерывных данных гамма-распределению с параметрами shape 1.7 и rate = 0.000063.===знак равно== Проблема в том, когда я использую R для создания графика QQ моего набора данных отношению к теоретической гамме распределения (1,7, 0,000063), я получаю график, который показывает, что эмпирические данные примерно …

1
Достаточная статистика, особенности / проблемы интуиции
Я учу себя статистике для удовольствия, и у меня есть путаница относительно достаточной статистики . Я напишу мои путаницы в виде списка: Если у распределения есть nnn параметров, то оно будет иметьnnn достаточной статистики? Есть ли какое-то прямое соответствие между достаточной статистикой и параметрами? Или же достаточная статистика просто служит …

1
Проблема определения порядка ARIMA
Это длинный пост, поэтому я надеюсь, что вы можете терпеть меня, и, пожалуйста, поправьте меня, где я неправ. Моя цель - составить ежедневный прогноз на основе исторических данных за 3 или 4 недели. Данные представляют собой 15-минутные данные локальной нагрузки одной из трансформаторных линий. У меня проблемы с поиском модельного …

1
Понимание дисперсии случайных эффектов в моделях lmer ()
У меня проблемы с пониманием вывода моей lmer()модели. Это простая модель исходной переменной (Поддержка) с различными перехватами состояний / случайными эффектами состояний: mlm1 <- lmer(Support ~ (1 | State)) Результаты summary(mlm1): Linear mixed model fit by REML Formula: Support ~ (1 | State) AIC BIC logLik deviance REMLdev 12088 12107 …

2
Выбор объектов со случайными лесами
У меня есть набор данных с в основном финансовыми переменными (120 функций, 4k примеров), которые в основном сильно коррелированы и очень шумные (например, технические индикаторы), поэтому я хотел бы выбрать около 20-30 максимум для последующего использования с обучением модели (бинарная классификация) - увеличение уменьшение). Я думал об использовании случайных лесов …

2
Отображение пространственной и временной корреляции на картах
У меня есть данные для сети метеостанций по всей территории Соединенных Штатов. Это дает мне фрейм данных, который содержит дату, широту, долготу и некоторое измеренное значение. Предположим, что данные собираются один раз в день и определяются погодой регионального масштаба (нет, мы не будем вдаваться в это обсуждение). Я хотел бы …

2
При каких условиях машины повышения градиента превосходят случайные леса?
Может ли машина повышения градиента Фридмана достичь лучшей производительности, чем «Случайный лес» Бреймана ? Если да, то в каких условиях или какой набор данных может сделать gbm лучше?

2
Один класс SVM против образца SVM
Я понимаю, что одноклассные SVM (OSVM) были предложены с учетом отсутствия отрицательных данных, и что они стремятся найти границы решений, которые разделяют положительный набор и некоторую отрицательную опорную точку, скажем, источник. В работе 2011 года предлагаются « Образцы SVM» (ESVM), которые обучают «единому классификатору для каждой категории», который утверждает, что …

4
Есть ли закон, который гласит, что, если вы пройдете достаточно испытаний, случатся редкие вещи?
Я пытаюсь снять видео о загруженных игральных кубиках, и в какой-то момент видео мы бросаем около 200 игральных костей, берем все шестерки, бросаем их снова и берем все шестерки и бросаем их в третий раз. У нас был один кубик, который выпадал 6 три раза подряд, что, очевидно, не является …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.