Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Вычисление совокупного распределения максимальной просадки случайного блуждания со сносом
Меня интересует распределение максимальной просадки случайного блуждания: пусть где , Максимальная просадка после n периодов равна \ max_ {0 \ le i \ le j \ le n} (X_i - X_j) . Статья Магдона-Исмаила и др. и др. дает распределение для максимальной просадки броуновского движения со сносом. Выражение включает в …

2
Динамический расчет количества образцов, необходимых для оценки среднего
Я пытаюсь оценить среднее значение более или менее гауссовского распределения с помощью выборки. У меня нет предварительных знаний о его значении или его дисперсии. Каждый образец дорогой для получения. Как мне динамически решить, сколько образцов мне нужно, чтобы получить определенный уровень достоверности / точности? Или как узнать, когда я могу …

3
Об использовании наклонного вращения после PCA
Несколько статистических пакетов, таких как SAS, SPSS и R, позволяют выполнять некую ротацию факторов после PCA. Почему ротация необходима после PCA? Зачем вам применять наклонное вращение после PCA, учитывая, что целью PCA является получение ортогональных размеров?

2
Сопряженный априор для гамма-распределения
Мне нужно обновить частоту отказов (заданную как детерминированную) на основе новой частоты отказов в той же системе (она также является детерминированной). Я читал о сопряженных априорах и гамма-распределении как сопряженном для пуассоновского процесса. Также я могу приравнять среднее значение гамма-расст. ( ) к новой норме (как среднее значение), но у …
9 bayesian 

3
Автокорреляция при наличии нестационарности?
Имеет ли функция автокорреляции какое-либо значение для нестационарного временного ряда? Временные ряды обычно предполагаются стационарными до того, как автокорреляция используется для целей моделирования Бокса и Дженкинса.

1
Желательные и нежелательные свойства латинских квадратов в экспериментах?
Беглый поиск показывает, что латинские квадраты довольно широко используются при планировании экспериментов. Во время моей докторской диссертации я изучал различные теоретические свойства латинских квадратов (с точки зрения комбинаторики), но не имею глубокого понимания того, что такое латинские квадраты, которые делают их особенно подходящими для экспериментального дизайна. Я понимаю, что латинские …

3
Как создать доверительный интервал для параметра теста перестановки?
Тесты перестановок - это тесты значимости, основанные на повторных выборках перестановок, взятых случайным образом из исходных данных. Образцы перестановки составляются без замены, в отличие от образцов начальной загрузки, которые составляются с заменой. Вот пример, который я сделал в R простого теста перестановки. (Ваши комментарии приветствуются) Тесты перестановок имеют большие преимущества. …

2
Измерение качества соответствия в модели, которая объединяет два распределения
У меня есть данные с двойным пиком, которые я пытаюсь смоделировать, и между пиками достаточно совпадений, поэтому я не могу обработать их независимо. Гистограмма данных может выглядеть примерно так: Для этого я создал две модели: одна использует два распределения Пуассона, а другая использует два отрицательных биномиальных распределения (для учета избыточной …

3
Размеры эффекта линейной регрессии при использовании преобразованных переменных
При выполнении линейной регрессии часто бывает полезно выполнить преобразование, такое как лог-преобразование для зависимой переменной, для достижения лучшей конформации нормального распределения. Часто также полезно проверять бета-результаты по регрессии, чтобы лучше оценить величину эффекта / реальную актуальность результатов. Это поднимает проблему, заключающуюся в том, что при использовании, например, преобразования журнала размеры …

3
Вычисление лучшего подмножества предикторов для линейной регрессии
Какие методы доступны для выбора предикторов в многомерной линейной регрессии с подходящими предикторами, чтобы найти «оптимальное» подмножество предикторов без явного тестирования всех 2 p подмножеств? В «Прикладном анализе выживания» Хосмер и Лемешоу ссылаются на метод Кука, но я не могу найти оригинальную статью. Кто-нибудь может описать этот метод или, что …

2
Сравнивая два генетических алгоритма
У меня есть две реализации генетического алгоритма, которые должны вести себя одинаково. Однако из-за технических ограничений, которые не могут быть разрешены, их выходные данные не совпадают, учитывая тот же вклад. Тем не менее, я хотел бы показать, что нет существенной разницы в производительности. У меня есть 20 прогонов с одинаковой …


2
Как определить передаточные функции в модели прогнозирования регрессии временных рядов?
Я пытаюсь построить модель прогнозирования регрессии временных рядов для выходной переменной в долларовом выражении с точки зрения других предикторов / входных переменных и автокоррелированных ошибок. Этот тип модели также называется моделью динамической регрессии. Мне нужно научиться определять функции передачи для каждого предиктора, и я хотел бы услышать от вас, как …

7
Куда идет загрузка? Кто-нибудь может дать простое объяснение, чтобы начать меня?
Несмотря на несколько попыток прочесть о начальной загрузке, я, кажется, всегда сталкиваюсь с кирпичной стеной. Интересно, кто-нибудь может дать достаточно нетехническое определение начальной загрузки? Я знаю, что на этом форуме невозможно предоставить достаточно подробностей, чтобы я мог полностью это понять, но нежный толчок в правильном направлении с главной целью и …

2
Как мне вертикально сложить два графика с одинаковым масштабом x, но с другим масштабом y в R?
Приветствую, В настоящее время я делаю следующее в R: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Snip of summary.csv: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.