Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Скрещенные случайные эффекты и несбалансированные данные
Я моделирую некоторые данные, где я думаю, что у меня есть два скрещенных случайных эффекта. Но набор данных не сбалансирован, и я не уверен, что нужно сделать, чтобы учесть это. Мои данные - это набор событий. Событие происходит, когда клиент встречается с поставщиком для выполнения задачи, которая является успешной или …

3
Линейная модель Гетероскедастичность
У меня есть следующая линейная модель: журнал( Y+ 1 )log⁡(Y+1)\log(Y + 1) > summary(Y) Min. :-0.0005647 1st Qu.: 0.0001066 Median : 0.0003060 Mean : 0.0004617 3rd Qu.: 0.0006333 Max. : 0.0105730 NA's :30.0000000 Как я могу преобразовать переменные, чтобы улучшить ошибку и дисперсию предсказания, особенно для крайних правых значений?

2
Как выполнить регрессию гауссовского процесса, когда аппроксимируемая функция изменяется со временем?
Каковы хорошие стратегии для выполнения регрессии гауссовского процесса, когда функция, которую я пытаюсь приблизить, изменяется во времени? Наивный подход, который приходит мне в голову, состоит в том, чтобы использовать только N самых последних точек данных для выполнения регрессии. Какие стратегии лучше?

1
Помимо ядер Фишера
Какое-то время казалось, что ядра Фишера могут стать популярными, поскольку они, похоже, являются способом построения ядер из вероятностных моделей. Однако я редко видел, чтобы они использовались на практике, и у меня есть все основания полагать, что они не очень хорошо работают. Они полагаются на вычисление информации Фишера, цитируя Википедию: информация …

3
Как прогнозировать на основе агрегированных данных по нерегулярным интервалам?
Я пытаюсь прогнозировать продажи продуктов в автоматах. Проблема заключается в том, что машина заполняется с нерегулярными интервалами, и при каждой загрузке мы можем записывать только совокупные продажи с момента последней загрузки машины (т.е. у нас нет данных о ежедневных продажах). Так что в основном у нас есть данные для агрегированных …

3
Подходит при обучении из огромных наборов данных?
По сути, есть два распространенных способа обучения на огромных наборах данных (когда вы сталкиваетесь с ограничениями времени / пространства): Обман :) - используйте только «управляемое» подмножество для обучения. Потеря точности может быть незначительной из-за закона убывающей отдачи - прогностическая эффективность модели часто выравнивается задолго до того, как все обучающие данные …

1
Помощь в моделировании SEM (OpenMx, polycor)
У меня много проблем с одним набором данных, к которому я пытаюсь применить SEM. Мы предполагаем наличие 5 скрытых факторов A, B, C, D, E с показателями соотв. A1 - A5 (упорядоченные факторы), B1 - B3 (количественные), C1, D1, E1 (все три последних упорядоченных фактора, всего 2 уровня для E1. …

1
Работа с очень большими наборами данных временных рядов
У меня есть доступ к очень большому набору данных. Данные взяты из записей MEG людей, слушающих музыкальные отрывки из одного из четырех жанров. Данные следующие: 6 предметов 3 экспериментальных повторения (эпохи) 120 испытаний за эпоху 8 секунд данных на испытание при 500 Гц (= 4000 отсчетов) по 275 каналам MEG …

3
Автоматическая очистка данных
Общей проблемой является ML низкого качества данных: ошибки в значениях признаков, неправильно классифицированные экземпляры и т. Д. Один из способов решения этой проблемы - вручную просмотреть данные и проверить, но есть ли другие способы? (Бьюсь об заклад, есть!) Какие из них лучше и почему?

1
Являются ли MFCC оптимальным методом представления музыки в поисковой системе?
Техника обработки сигналов, Мелкополосный Кепстр , часто используется для извлечения информации из музыкальной пьесы для использования в задаче машинного обучения. Этот метод дает кратковременный спектр мощности, а коэффициенты используются в качестве входных данных. При проектировании систем поиска музыки такие коэффициенты считаются характерными для произведения (очевидно, не обязательно уникальными, но отличительными). …

3
Почему существует значение R ^ 2 (и что его определяет), когда lm не имеет дисперсии в прогнозируемом значении?
Рассмотрим следующий код R: example <- function(n) { X <- 1:n Y <- rep(1,n) return(lm(Y~X)) } #(2.13.0, i386-pc-mingw32) summary(example(7)) #R^2 = .1963 summary(example(62)) #R^2 = .4529 summary(example(4540)) #R^2 = .7832 summary(example(104))) #R^2 = 0 #I did a search for n 6:10000, the result for R^2 is NaN for #n = …
10 r  regression 

3
Многократное моделирование структурного уравнения моделирования
Мне нужно проанализировать набор данных клинической реабилитации. Меня интересуют гипотезы о взаимосвязи между количественным «вкладом» (количеством терапии) и изменениями в состоянии здоровья. Хотя набор данных является относительно небольшим (n ~ 70), мы повторили данные, отражающие временные изменения в обоих. Я знаком с нелинейным моделированием смешанных эффектов в R, однако меня …

4
Есть ли способ использовать перекрестную проверку для выбора переменных / признаков в R?
У меня есть набор данных с около 70 переменных, которые я хотел бы сократить. Я хочу использовать CV, чтобы найти наиболее полезные переменные следующим образом. 1) Случайно выберите, скажем, 20 переменных. 2) Используйте stepwise/ LASSO/ lars/ etc для выбора наиболее важных переменных. 3) Повторите ~ 50x и посмотрите, какие переменные …

2
Доверительный интервал для хи-квадрат
Я пытаюсь найти решение для сравнения двух тестов "хи-квадрат". Точнее, я хочу сравнить результаты двух независимых экспериментов. В этих экспериментах авторы использовали хи-квадрат добротности, чтобы сравнить случайное предположение (ожидаемые частоты) с наблюдаемыми частотами. Два эксперимента получили одинаковое количество участников, и экспериментальные процедуры идентичны, только стимулы изменены. Результаты двух экспериментов показали …

4
Объяснение статистического моделирования
Я не статистика. Так что, пожалуйста, потерпите мои промахи, если таковые имеются. Не могли бы вы объяснить простым способом, как выполняется симуляция? Я знаю, что он выбирает случайную выборку из нормального распределения и использует ее для моделирования. Но не понимаю ясно.
10 simulation 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.