Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
QQ интерпретация сюжета
Рассмотрим следующий код и вывод: par(mfrow=c(3,2)) # generate random data from weibull distribution x = rweibull(20, 8, 2) # Quantile-Quantile Plot for different distributions qqPlot(x, "log-normal") qqPlot(x, "normal") qqPlot(x, "exponential", DB = TRUE) qqPlot(x, "cauchy") qqPlot(x, "weibull") qqPlot(x, "logistic") Похоже, что график QQ для log-normal почти такой же, как график …

2
Как найти показатель корреляции между двумя номинальными переменными?
Был проведен опрос, когда люди выбрали то, что они используют, чтобы представить своего смайлика, и въехали в страну происхождения. Я перекодировал текстовые ответы в числовые. Какую форму анализа следует использовать (предпочтительно в SPSS), чтобы проверить уровень корреляции между тем, откуда приходят люди, и представлениями, которые они выбрали?

1
Интуитивное понимание ковариации, кросс-ковариации, авто- / кросс-корреляции и плотности спектра мощности
В настоящее время я готовлюсь к выпускным экзаменам по базовой статистике для моего бакалавра ЕЭК. Хотя я думаю, что математика в основном не работает, мне не хватает интуитивного понимания, что на самом деле означают цифры (Преамбула: я буду использовать довольно небрежный язык). Я знаю, что E [X] является «средневзвешенным значением» …

1
Всегда ли степени свободы для теста Уэлча меньше, чем DF объединенного теста?
Я преподаю курс по основам статистики, и мы проводим t-тест для двух независимых выборок с неравными отклонениями (тест Уэлча). В примерах, которые я видел, скорректированные степени свободы, используемые в тесте Уэлча, всегда меньше или равны . n1+n2−2n1+n2−2n_1+n_2-2 Это всегда так? Всегда ли критерий Уэлча уменьшает (или оставляет неизменным) степени свободы …

1
Функция стоимости для проверки моделей регрессии Пуассона
Для собранных данных я использую регрессию Пуассона для построения моделей. Я делаю это с помощью glmфункции в R, где я использую family = "poisson". Для оценки возможных моделей (у меня есть несколько предикторов) я использую AIC. Все идет нормально. Теперь я хочу выполнить перекрестную проверку. Я уже преуспел в этом, …

5
Если не Пуассон, то что это за распределение?
У меня есть набор данных, содержащий количество действий, совершенных отдельными лицами в течение 7 дней. Конкретные действия не должны иметь отношение к этому вопросу. Вот некоторые описательные статистические данные для набора данных: СпектрЖадныйотклонениеКоличество наблюдений0 - 77218,22791+696Range0−772Mean18.2Variance2791Number of observations696 \begin{array}{|c|c|} \hline \text{Range} & 0 - 772 \\ \hline \text{Mean} & 18.2 …

1
Рао-Блеквеллизация последовательных фильтров Монте-Карло
В оригинальной работе A. Doucet et. "Рао-Блэквелизированная фильтрация частиц для динамических байесовских сетей" . и др. Предложен последовательный фильтр Монте-Карло (фильтр частиц), который использует линейную субструктуру в марковском процессе . Путем маргинализации этой линейной структуры фильтр можно разделить на две части: нелинейную часть, которая использует фильтр частиц, и одну линейную …

1
Как вы можете определить, является ли гауссовский процесс более подходящим?
Я тренирую гауссовский процесс с ядром ARD с большим количеством параметров, максимизируя предельное правдоподобие данных вместо перекрестной проверки. Я подозреваю, что это чрезмерно. Как я могу проверить это подозрение в байесовском контексте?

3
Важность переменных в логистической регрессии
Я, вероятно, имею дело с проблемой, которая, вероятно, была решена сто раз прежде, но я не уверен, где найти ответ. При использовании логистической регрессии, учитывая многие функции и пытаясь предсказать двоичное категориальное значение y , я заинтересован в выборе подмножества признаков, которые хорошо предсказывают y .x1,...,xnx1,...,xnx_1,...,x_nyyyyyy Есть ли процедура, похожая …

2
Меры разделимости классов в задачах классификации
Примером хорошей меры отделимости классов у учащихся с линейным дискриминантом является коэффициент линейного дискриминанта Фишера. Существуют ли другие полезные метрики, чтобы определить, обеспечивают ли наборы функций хорошее разделение классов между целевыми переменными? В частности, я заинтересован в поиске хороших многомерных входных атрибутов для максимального разделения целевых классов, и было бы …

2
Выборка с заменой в R randomForest
Реализация randomForest не позволяет производить выборку сверх количества наблюдений, даже при выборке с заменой. Почему это? Работает отлично: rf <- randomForest(Species ~ ., iris, sampsize=c(1, 1, 1), replace=TRUE) rf <- randomForest(Species ~ ., iris, sampsize=3, replace=TRUE) Что я хочу сделать: rf <- randomForest(Species ~ ., iris, sampsize=c(51, 1, 1), replace=TRUE) …

2
Анализ обогащения по уровню дупликации генов
Биологический Фон Со временем некоторые виды растений имеют тенденцию дублировать свои полные геномы, получая дополнительную копию каждого гена. Из-за нестабильности этой установки многие из этих генов затем удаляются, и геном перестраивается и стабилизируется, готовый к повторному дублированию. Эти события дублирования связаны с событиями видообразования и вторжения, и теория заключается в …

5
«Пик» перекошенной функции плотности вероятности
Я хотел бы описать «пиковость» и «тяжесть хвоста» нескольких искаженных функций плотности вероятности. Особенности, которые я хочу описать, будут ли они называться «куртозом»? Я видел только слово "эксцесс", используемое для симметричных распределений?

1
Система голосования, которая использует точность каждого избирателя и связанную с этим неопределенность
Допустим, у нас есть простой вопрос «да / нет», на который мы хотим знать ответ. И есть N людей, «голосующих» за правильный ответ. У каждого избирателя есть история - список 1 и 0, показывающий, были ли они правы или нет в отношении таких вопросов в прошлом. Если мы примем историю …

2
Модели с нулевым раздувом в R: в чем реальное преимущество?
Для анализа числа птиц с нулевым уровнем инфляции я хотел бы применить модели с нулевым уровнем инфляции с использованием пакета R pscl . Однако, взглянув на приведенный в документации пример для одной из основных функций ( ? Zeroinfl ), я начинаю сомневаться в том, каково реальное преимущество этих моделей. Согласно …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.