Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Генерация значений из многомерного гауссовского распределения
В настоящее время я пытаюсь моделировать значений NNN - мерной случайной величины XXX , который имеет многомерное нормальное распределение со средним вектором μ=(μ1,...,μN)Tμ=(μ1,...,μN)T\mu = (\mu_1,...,\mu_N)^T и ковариационной матрицей SSS . Я надеюсь использовать методику , аналогичную методу обратной CDF, а это означает , что я хочу , чтобы сначала создать …

2
Выбор модели Box-Jenkins
Процедура выбора модели Бокса-Дженкинса в анализе временных рядов начинается с рассмотрения автокорреляционных и частичных автокорреляционных функций ряда. Эти графики могут предложить соответствующие и в модели ARMA . Процедура продолжается, предлагая пользователю применить критерии AIC / BIC для выбора наиболее экономной модели среди тех, которые дают модель с ошибкой в ​​виде …

2
Примеры интеллектуального анализа текста с помощью R (пакет tm)
Я потратил три дня на то, чтобы поболтать с tmчитателем черновика статьи от друга, где он исследовал текстовый корпус с помощью UCINET, показывая текстовые облака, двухрежимные сетевые графики и разложение по одному значению (с графикой, используя Stata). Я столкнулся с большим количеством проблем: в Mac OS X есть проблемы с …
14 r  text-mining 

3
Как масштабировать скрипичные участки для сравнения?
Я пытаюсь нарисовать скрипичные сюжеты и задаюсь вопросом, есть ли приемлемая лучшая практика для их распределения по группам. Вот три варианта, которые я пробовал использовать mtcarsнабор данных R (Motor Trend Cars от 1973 года, найденный здесь ). Равные ширины Похоже, что делает оригинальная статья * и что vioplotделает R ( …

1
Как рассчитать ошибку прогноза (доверительные интервалы) для текущих периодов?
Мне часто нужно прогнозировать будущие периоды в ежемесячных рядах данных. Формулы доступны для расчета доверительного интервала в альфа для следующего периода во временном ряду, но это никогда не включает, как обрабатывать второй период, третий и т. Д. Я бы визуально предположил, что, если какой-либо прогноз был построен с верхним и …

1
Как настроить сглаживание в модели mgcv GAM
Я пытаюсь выяснить, как контролировать параметры сглаживания в модели mgcv: gam. У меня есть биноминальная переменная, которую я пытаюсь смоделировать, в первую очередь как функция координат x и y на фиксированной сетке, плюс некоторые другие переменные с меньшим влиянием. В прошлом я построил достаточно хорошую модель локальной регрессии, используя пакет …
14 r  smoothing  mgcv 

3
Метрики или для кластеризации?
Кто-нибудь использует метрики или для кластеризации, а не ? Аггарвал и др. Об удивительном поведении метрик расстояния в многомерном пространстве сказали (в 2001 г.), чтоL1L1L_1L.5L.5L_.5L2L2L_2 L1L1L_1 неизменно предпочтительнее, чем евклидова метрика расстояния для приложений анализа больших размеров данных.L2L2L_2 и утверждал, что или могут быть еще лучше.L.5L.5L_.5L.1L.1L_.1 Причины использования или могут …

5
Программное обеспечение (или веб-приложения) для обучения детей статистике или вероятности?
Я бы хотел (в далеком будущем) научить детей статистике. В этом отношении я был бы рад узнать о программном обеспечении (очевидно, я склоняюсь к FOSS) или веб-приложениям, которые помогают объяснить статистические / вероятностные идеи детям (или взрослым в этом отношении). Это может быть использовано либо инструктором, детьми, либо и тем, …


2
Интуитивное объяснение стационарности
Некоторое время я боролся со стационарностью в голове ... Ты так об этом думаешь? Любые комментарии или дальнейшие мысли будут оценены. Стационарный процесс - это тот, который генерирует значения временных рядов, так что среднее значение распределения и дисперсия остаются постоянными. Строго говоря, это известно как слабая форма стационарности или ковариации …

3
Имеет ли смысл частичная корреляция быть больше, чем корреляция нулевого порядка?
Это, вероятно, демонстрирует фундаментальное отсутствие понимания того, как работают частичные корреляции. У меня есть 3 переменные, х, у, я. Когда я контролирую для z, корреляция между x и y увеличивается по сравнению с корреляцией между x и y, когда z не контролировался. Имеет ли это смысл? Я склонен думать, что …

1
Когда можно использовать AdaBoost?
Как я слышал о классификаторе AdaBoost, который неоднократно упоминался на работе, я хотел лучше понять, как он работает и когда его можно использовать. Я прочитал несколько статей и учебных пособий, которые я нашел в Google, но есть некоторые аспекты классификатора, которые я до сих пор не могу понять: Большинство уроков, …


7
Стоит ли моделировать короткие временные ряды?
Вот некоторый контекст. Я заинтересован в определении того, как две переменные среды (температура, уровни питательных веществ) влияют на среднее значение переменной отклика за 11-летний период. В течение каждого года есть данные из более чем 100 тысяч мест. Цель состоит в том, чтобы определить, отразилось ли в течение 11-летнего периода среднее …

1
Скремблирование и корреляция в последовательностях с низким расхождением (Halton / Sobol)
В настоящее время я работаю над проектом, в котором я генерирую случайные значения, используя наборы точек с малыми расхождениями / квазислучайными точками , такие как наборы точек Халтона и Соболя. Это по существу мерные векторы, которые имитируют d- мерные однородные (0,1) переменные, но имеют лучший разброс. Теоретически, они должны помочь …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.