Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Выбор кластеров для k-средних: случай 1 кластера
Кто-нибудь знает хороший метод, чтобы определить, подходит ли даже кластеризация с использованием kmeans? То есть, что если ваш образец на самом деле является однородным? Я знаю, что нечто вроде смешанной модели (через mclust в R) предоставит статистику соответствия для случая кластера 1: k, но, похоже, что для всех методов оценки …
9 r  clustering  k-means 

1
Каков был вклад Стьюдента (Госсета) в разработку критерия Стьюдента?
Недавний вопрос , связанный с этим вопрос , и привел источник , недавно сделал мне известно , что коррекцию для выборочных оценок дисперсии генеральной совокупности называется коррекцией Бесселя . Бессель был мертв в 1846 году ( цитата из Википедии ), а t-тест был опубликован в 1908 году ( цитата из …

2
Использование алгоритма EM для связывания записей
Мне интересно связать записи между двумя наборами данных по имени, фамилии и году рождения. Можно ли это сделать с помощью алгоритма EM, и если да, то как? В качестве примера рассмотрим следующую запись в 1-м: Карл Маккарти, 1967. Я буду искать по всем записям во втором наборе данных и назначать …

3
Загадка регрессии к среднему
В главе «Возвращение к среднему значению» Даниеля Канемана «Мышление, быстрое и медленное» приводится пример, и читателю предлагается спрогнозировать продажи отдельных магазинов с учетом общего прогноза продаж и показателей продаж за предыдущий год. , Например (пример книги имеет 4 магазина, я использую 2 здесь для простоты): Store 2011 2012 1 100 …

1
Генерирующая момент функция внутреннего произведения двух гауссовских случайных векторов
Кто-нибудь может предложить, как я могу вычислить производящую момент функцию внутреннего произведения двух гауссовских случайных векторов, каждый из которых распределен как N( 0 , σ2)N(0,σ2)\mathcal N(0,\sigma^2) , независимо друг от друга? Есть ли какой-то стандартный результат для этого? Любой указатель высоко ценится.

2
Понимание усов коробочного участка
У меня есть вопрос, касающийся интерпретации усов коробочного сюжета. Я прочитал следующее: «В верхней и нижней части прямоугольника« усы »показывают диапазон, в 1,5 раза превышающий расстояние между 0,25 и 0,75 квантилями», но не совсем понимаю, что подразумевается под «расстоянием». , Не может быть, что имеется в виду масса вероятности, поскольку …

2
Как я могу визуализировать важность различных входных данных для прогноза для нелинейной модели черного ящика?
Я создаю интерактивный инструмент прогнозирования (на python), чтобы помочь прогнозированию, которое делается в моей организации. До настоящего времени процесс прогнозирования был в значительной степени ориентирован на человека, так как синоптики ассимилировали данные в своих естественных нейронных сетях и использовали свое научное настроение для прогнозирования. Из проведенного мною долгосрочного подтверждения прогноза …

1
Моделирование данных для логистической регрессии с категориальной переменной
Я пытался создать некоторые тестовые данные для логистической регрессии, и я нашел этот пост Как имитировать искусственные данные для логистической регрессии? Это хороший ответ, но он создает только непрерывные переменные. Как насчет категориальной переменной x3 с 5 уровнями (ABCDE), связанной с y для того же примера, что и в ссылке?

2
Предположения обобщенных линейных моделей
На странице 232 «Компаньон R в прикладной регрессии» записка Фокса и Вейсберга Только семейство Гауссов имеет постоянную дисперсию, а во всех других GLM условная дисперсия y в зависит отИксИкс\bf{x}μ ( х )μ(Икс)\mu(x) Ранее они отмечали, что условная дисперсия Пуассона равна а дисперсия бинома - .μμ\muμ(1−μ)Nμ(1−μ)N\frac{\mu(1-\mu)}{N} Для гауссиана это знакомое и …

1
Предлагаемые книги по пространственной статистике
Каковы некоторые из лучших книг для изучения i) изменчивость одномерных и многомерных переменных (реальных, счетных данных) в пространственной области. ii) выборка одномерной или многомерной переменной на основе ее распределения по пространственным местоположениям. (Пространственная выборка вкратце)

2
Какое ядро ​​SVM использовать для решения проблемы двоичной классификации?
Я начинающий, когда дело доходит до поддержки векторных машин. Существуют ли рекомендации, в которых говорится, какое ядро ​​(например, линейное, полиномиальное) лучше всего подходит для конкретной задачи? В моем случае я должен классифицировать веб-страницы в зависимости от того, содержат ли они какую-то конкретную информацию или нет, то есть у меня есть …

3
Расчет Jaccard или другого коэффициента ассоциации для двоичных данных с использованием умножения матриц
Я хочу знать, есть ли какой-нибудь возможный способ для вычисления коэффициента Жакара с использованием умножения матриц. Я использовал этот код jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | …

1
Огромные коэффициенты в логистической регрессии - что это значит и что делать?
Я получаю огромные коэффициенты во время логистической регрессии, смотрите коэффициенты с krajULKV: > summary(m5) Call: glm(formula = cbind(ml, ad) ~ rok + obdobi + kraj + resid_usili2 + rok:obdobi + rok:kraj + obdobi:kraj + kraj:resid_usili2 + rok:obdobi:kraj, family = "quasibinomial") Deviance Residuals: Min 1Q Median 3Q Max -2.7796 -1.0958 -0.3101 …

1
Расчет логарифмической вероятности для заданного MLE (цепочки Маркова)
В настоящее время я работаю с цепями Маркова и рассчитал оценку максимального правдоподобия, используя вероятности переходов, как предложено несколькими источниками (т. Е. Количество переходов от a к b, деленное на количество общих переходов от a к другим узлам). Теперь я хочу вычислить логарифмическую вероятность MLE.

1
Когда включать случайный эффект в модель
Я новичок в смешанном моделировании, и меня смущает вопрос о целесообразности использования случайного эффекта в анализе, который я делаю. Любой совет будет принят во внимание. мое исследование проверяет, насколько хорошо недавно разработанный индекс численности млекопитающих может предсказать значение установленного, но более трудоемкого индекса. Я измерял эти индексы в нескольких лесных …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.