Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


2
Какие описательные статистические данные не являются величинами эффекта?
Википедия говорит величина эффекта - это мера силы явления или оценка этой величины на основе выборки. Величина эффекта, рассчитанная на основе данных, представляет собой описательную статистику, которая передает оценочную величину отношения, не делая никаких заявлений о том, отражает ли кажущаяся связь в данных истинную связь в популяции. Чтобы лучше это …

2
Когда данные имеют гауссово распределение, сколько выборок будет характеризовать это?
Гауссовские данные, распределенные в одном измерении, требуют двух параметров для его характеристики (среднее значение, дисперсия), и, по слухам, около 30 случайно выбранных выборок обычно достаточно для оценки этих параметров с достаточно высокой достоверностью. Но что происходит, когда число измерений увеличивается? В двух измерениях (например, рост, вес) требуется 5 параметров для …

1
Первые шаги в обучении для прогнозирования финансовых временных рядов с использованием машинного обучения
Я пытаюсь понять, как использовать машинное обучение для прогнозирования финансовых временных рядов на 1 или более шагов в будущее. У меня есть финансовые временные ряды с некоторыми описательными данными, и я хотел бы сформировать модель и затем использовать модель для прогнозирования n шагов вперед. Что я делал до сих пор: …


2
Название «парадокса», сообщенного Гельманом
В книге Эндрю Гельмана «Красное государство, Голубое государство» он анализирует тот факт, что богатые люди в отдельных штатах, как правило, голосуют больше за республиканцев, чем за бедных, но богатые государства склонны голосовать за более демократических, чем бедных. Есть ли название для этого парадокса? Мне кажется, это связано, но не идентично, …
12 paradox 

2
Как проверить избыточную дисперсию в пуассоновском GLMM с помощью lmer () в R?
У меня есть следующая модель: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... и это сводный результат. > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 …

3
Наивные байесовские характеристики вероятности: я должен дважды считать слова?
Я создаю прототип своей собственной модели Naive Bayes bag o 'words, и у меня возник вопрос о вычислении вероятностей характеристик. Допустим, у меня есть два класса, я просто буду использовать спам, а не спам, поскольку это то, что все используют. И давайте возьмем слово «виагра» в качестве примера. В моем …

2
Каково ожидаемое распределение остатков в обобщенной линейной модели?
Я выполняю обобщенную линейную модель, где я должен указать семью, отличную от нормальной. Каково ожидаемое распределение остатков? Например, должны ли остатки распределяться нормально?

5
Пакеты выбора функций в R, которые выполняют регрессию и классификацию
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я очень плохо знаком с R. Я сейчас учусь машинному обучению. Очень жаль, если этот вопрос кажется очень простым. Я пытаюсь найти …

5
Число 20 волшебство?
У меня есть ссылки, в которых рекомендуется учитывать размер выборки не менее 20 для распределения данных. Есть ли в этом смысл? Благодарность

2
Разница в сообщаемых значениях p между lm и aov в R
Чем объясняются различия в p-значениях в следующих aovи lmвызовах? Разница только из-за различных типов вычислений сумм квадратов? set.seed(10) data=rnorm(12) f1=rep(c(1,2),6) f2=c(rep(1,6),rep(2,6)) summary(aov(data~f1*f2)) summary(lm(data~f1*f2))$coeff

3
Применяется ли процедура фиксированных эффектов Мундлака для логистической регрессии с использованием макетов?
У меня есть набор данных с 8000 кластеров и 4 миллиона наблюдений. К сожалению, мое статистическое программное обеспечение, Stata, работает довольно медленно при использовании функции панельных данных для логистической регрессии: xtlogitдаже с 10% -ной выборкой. Однако при использовании непанельной logitфункции результаты появляются гораздо раньше. Поэтому я могу извлечь выгоду из …

2
График QQ не соответствует гистограмме
У меня есть гистограмма, плотность ядра и соответствующее нормальное распределение финансовых отчетов, которые превращаются в убытки (знаки меняются), и обычный график QQ этих данных: График QQ ясно показывает, что хвосты установлены неправильно. Но если я взгляну на гистограмму и установленное нормальное распределение (синее), даже значения около 0,0 не будут корректно …

3
ROC кривая пересекает диагональ
Я запускаю двоичный классификатор в данный момент. Когда я строю кривую ROC, вначале я получаю хороший подъем, затем он меняет направление и пересекает диагональ, затем, конечно, обратно, делая кривую наклонной S-образной формы. Что может быть интерпретацией / объяснением этого эффекта? Благодарность
12 roc 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.