Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Помогите мне понять в байесовском GLM
Я пытаюсь запустить байесовский логит на данных здесь . Я использую bayesglm()в armпакете в R. Кодирование достаточно просто: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) дает следующий вывод: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 …
13 r  bayesian  p-value 

4
В поисках реальной иллюстрации цитаты Фишера о DoE
Моя команда и я хотели бы сделать презентацию для статистиков компании о полезности планирования экспериментов. Эти не статистики также являются нашими клиентами, и они обычно не консультируются с нами перед сбором своих данных. Знаете ли вы реальные примеры, которые бы хорошо иллюстрировали известную цитату Фишера: «Позвонить статистику после завершения эксперимента …

2
Как получить результаты специального теста Tukey HSD в таблице, показывающей сгруппированные пары?
Я хотел бы выполнить специальный тест TukeyHSD после моей двусторонней Anova с R, получив таблицу, содержащую отсортированные пары, сгруппированные по значительным различиям. (Извините за формулировку, я все еще новичок со статистикой.) Я хотел бы иметь что-то вроде этого: Итак, сгруппированы по звездам или буквам. Любая идея? Я протестировал функцию HSD.test()из …

2
Почему проблема беспорядка неразрешима для больших выборок?
Предположим, у нас есть множество точек y={y1,y2,…,yN}y={y1,y2,…,yN}\mathbf{y} = \{y_1, y_2, \ldots, y_N \} . Каждая точка yiyiy_i генерируется с использованием распределения p(yi|x)=12N(x,1)+12N(0,10).p(yi|x)=12N(x,1)+12N(0,10). p(y_i| x) = \frac12 \mathcal{N}(x, 1) + \frac12 \mathcal{N}(0, 10). Чтобы получить апостериор дляxxxмы пишем p(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x).p(x|y)∝p(y|x)p(x)=p(x)∏i=1Np(yi|x). p(x| \mathbf{y}) \propto p(\mathbf{y}| x) p(x) = p(x) \prod_{i = 1}^N p(y_i …

1
Прогнозы с использованием glmnet в R
Я пытаюсь смоделировать некоторые данные, используя glmnetпакет в R. Допустим, у меня есть следующие данные training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Это упрощение; мои данные намного сложнее.) Затем я использовал следующий код для …
13 r  glmnet 

1
Смешные статистические ответы на экзамен [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 7 лет назад . Исправление экзаменов, наверное, самая скучная задача учителя. Но нам может быть забавно собирать забавные статистические ответы на экзамены. Одна …
13 teaching  humor 


1
Использование обобщенного метода моментов (GMM) для расчета параметра логистической регрессии
Я хочу вычислить коэффициенты для регрессии, которая очень похожа на логистическую регрессию (На самом деле логистическая регрессия с другим коэффициентом: когда может быть дано). Я думал об использовании GMM для вычисления коэффициентов, но я не уверен, какие условия момента я должен использовать.A1+e−(b0+b1x1+b2x2+…),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- (b_0 + b_1 x_1 + …

4
Инициализация K-средних центров с помощью случайных подвыборок набора данных?
Если у меня есть определенный набор данных, насколько разумно было бы инициализировать центры кластеров, используя случайные выборки этого набора данных? Например, предположим, я хочу 5 clusters. Я, 5 random samplesскажем, size=20%из оригинального набора данных. Могу ли я затем взять среднее значение каждой из этих 5 случайных выборок и использовать эти …


3
Какие хорошие, свободно доступные журналы для отслеживания последних событий в области машинного обучения?
Не стесняйтесь заменять «журналы» любым другим полезным порталом знаний. Я заинтересован в том, чтобы следить за новыми разработками в области машинного обучения с целью практического применения. Я не академик, стремящийся опубликовать свою собственную работу (по крайней мере, не в этой области), но я хочу знать о потенциальных новых алгоритмах или …

6
Случайный лес: как обрабатывать новые уровни факторов в тестовом наборе?
Я пытаюсь делать прогнозы, используя модель случайного леса в R. Однако я получаю ошибки, так как некоторые факторы имеют разные значения в тестовом наборе, чем в обучающем наборе. Например, фактор Cat_2имеет значения 34, 68, 76и т. Д. В тестовом наборе, которые не отображаются в обучающем наборе. К сожалению, я не …

3
Концептуальное понимание среднеквадратичной ошибки и среднего отклонения
Я хотел бы получить концептуальное понимание среднеквадратичной ошибки (RMSE) и среднего отклонения смещения (MBD). Рассчитав эти показатели для моих собственных сравнений данных, я часто был озадачен, обнаружив, что RMSE высока (например, 100 кг), тогда как MBD низка (например, менее 1%). Более конкретно, я ищу ссылку (не онлайн), которая перечисляет и …

2
Линейная регрессия, когда вы знаете только
Пусть Xβ=YXβ=YX\beta =Y . Мы не знаем , YYY точно, только его корреляции с каждым предиктором, XtYXtYX^\mathrm{t}Y . Обычное решение наименьших квадратов (OLS) - это и здесь нет проблем.β=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y Но предположим, что близок к единственному (мультиколлинеарность), и вам нужно оценить оптимальный параметр гребня. Все методы , кажется, нужны …

1
Регуляризованная байесовская логистическая регрессия в JAGS
Есть несколько математических работ, описывающих байесовское лассо, но я хочу протестировать правильный код JAGS, который я могу использовать. Может ли кто-нибудь опубликовать пример кода BUGS / JAGS, который реализует регуляризованную логистическую регрессию? Любая схема (L1, L2, Elasticnet) была бы отличной, но Лассо предпочтительнее. Мне также интересно, есть ли интересные альтернативные …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.