Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Подгонка смешанной модели Пуассона GLM со случайным наклоном и пересечением
В настоящее время я работаю над серией моделей временных рядов Пуассона, пытаясь оценить влияние изменения в том, как были получены подсчеты (переключение с одного диагностического теста на другой), в то же время контролируя другие тренды во времени (скажем, общее увеличение заболеваемость). У меня есть данные для разных сайтов. Хотя я …

1
Логистическая регрессия: сгруппированные и разгруппированные переменные (с использованием R)
Я читаю A. Agresti (2007), Введение в категориальный анализ данных , 2-е. редакция, и я не уверен, правильно ли я понимаю этот параграф (с.106, 4.2.1) (хотя это должно быть легко): В Таблице 3.1, посвященной храпу и сердечным заболеваниям в предыдущей главе, 254 пациента сообщали о храпе каждую ночь, из которых …

3
Сплайн df-выбор в общей аддитивной задаче модели Пуассона
Я подгонял некоторые данные временных рядов, используя общую аддитивную модель Пуассона, используя SAS PROC GAM. Вообще говоря, у меня есть встроенная обобщенная процедура перекрестной проверки, которая генерирует, по крайней мере, достойную «начальную точку» для моего единственного сплайна, который является нелинейной функцией времени вместе с одним параметрическим членом (который я меня …

1
Какая модель для сложного набора данных? (сотни временных рядов с большим количеством вложений)
У меня достаточно сложный набор данных для анализа, и я не могу найти для него хорошего решения. Вот эта вещь: 1. сырые данные по существу записи песен насекомых. Каждая песня состоит из нескольких очередей, а каждая - из подразделений. Все лица были зарегистрированы в течение 5 минут. Количество пакетов и …

1
Как вписать модель Брэдли – Терри – Люса в R без сложной формулы?
Модель Брэдли – Терри – Люса (BTL) утверждает, что , где - вероятность того, что объект j будет оценен как «лучший», тяжелее, и т. д., чем объект i , и \ delta_i , и \ delta_j являются параметрами.pji=logit−1(δj−δi)pji=logit−1(δj−δi)p_{ji} = logit^{-1}(\delta_j - \delta_i)pijpijp_{ij}jjjiiiδiδi\delta_iδjδj\delta_j Кажется, это кандидат на функцию glm с family …

3
Как называется RMSE, нормализованная по среднему наблюдаемому значению?
Я использую Root Mean Squared Error(RMSE) для измерения точности значений, прогнозируемых с помощью модели. Я понимаю, что возвращаемое значение использует единицы измерения (а не процент). Тем не менее, я хотел бы процитировать мои значения в процентах. Подход, который я выбрал, заключается в нормализации RMSEсреднего значения моих наблюдений. Есть ли термин …

2
Использование регрессионной модели для прогнозирования: когда остановиться?
Я рассчитал простую модель линейной регрессии из моих экспериментальных мер, чтобы делать прогнозы. Я прочитал, что вы не должны рассчитывать прогнозы для точек, которые слишком далеко от доступных данных. Однако я не смог найти каких-либо указаний, которые бы помогли мне понять, как далеко я могу экстраполировать. Например, если я вычислю …

3
auto.arima предупреждает о появлении NaN при ошибке std
Мои данные - это временной ряд занятого населения, L, и временной интервал, год. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 …
9 r  regression  arima 

1
Прогноз GLM Пуассона со смещением
Я знаю, что это, вероятно, основной вопрос ... Но я, кажется, не могу найти ответ. Я подгоняю GLM к семейству Пуассонов, а затем попытался взглянуть на прогнозы, однако смещение, похоже, принимается во внимание: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Я получаю случаи, а не ставки ... Я пробовал …

2
Как смоделировать повторные измерения многовариантных результатов в R?
@whuber продемонстрировал, как моделировать многовариантные результаты ( , и ) для одной временной точки.у 2 у 3Y1y1y_1Y2y2y_2Y3y3y_3 Как известно, продольные данные часто встречаются в медицинских исследованиях. Мой вопрос заключается в том, как имитировать повторные измерения многовариантных результатов в R? Например, мы неоднократно измеряем , и в 5 различных временных точках …

1
Как получить границы решения от линейного SVM в R?
Мне нужен пакет, который может дать мне уравнение для линейной модели SVM. В настоящее время я использую E1071 так: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Тем не менее, я не уверен, как e1071::svm()выбирать положительные и …
9 r  svm  e1071 

3
Частые рассуждения и обусловленность наблюдений (пример из Wagenmakers et al.)
Я не специалист в области статистики, но я понимаю, что существует разногласие относительно того, является ли «частое» или «байесовское» толкование вероятности «правильным». От Wagenmakers et. Аль р. 183: Рассмотрим равномерное распределение со средним и шириной . Нарисуйте два значения случайным образом из этого распределения, пометьте наименьшее и наибольшее и проверьте, …

1
Классификация с одним доминирующим предиктором
У меня есть проблема классификации ( class) порядка 100 реальных предикторов, один из которых, по-видимому, обладает гораздо большей объяснительной силой, чем любой другой. Я хотел бы углубиться в эффекты других переменных. Однако стандартные методы машинного обучения (случайные леса, SVM и т. Д.) Кажутся одоленными одним сильным предиктором и не дают …

2
Понимание и применение анализа настроений
Мне только что поручили проект проведения анализа настроений для некоторых коллекций документов. По словам Гуглинга, появилось много исследований, связанных с настроениями. Мои вопросы: Каковы основные методы / алгоритмы анализа настроений в области машинного обучения и статистического анализа? Есть ли какие-либо устоявшиеся результаты? Существуют ли какие-либо программы с открытым исходным кодом, …

1
Простой вопрос комбинации / вероятности, основанный на длине строки и возможных символах
Предполагая «полную случайность» и получая строку длиной 20 символов, где каждый символ может быть одним из 62 возможных символов: Какое общее количество возможных комбинаций? (Угадай 20 до степени 62.) Кроме того, если новые строки выбираются случайным образом одна за другой и добавляются в список выбранных строк, сколько строк должно быть …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.