Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Вменение до или после разделения на поезд и тест?
У меня есть набор данных с N ~ 5000 и около 1/2 отсутствует по крайней мере по одной важной переменной. Основным аналитическим методом будет пропорциональный риск Кокса. Я планирую использовать множественное вменение. Я также буду разделяться на поезд и тестовый набор. Должен ли я разделять данные и затем вменять отдельно, …

5
Изменчивость в результатах cv.glmnet
Я использую, cv.glmnetчтобы найти предикторов. Я использую следующие настройки: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Чтобы убедиться, что результаты воспроизводимы, я set.seed(1). Результаты сильно различаются. Я запустил точно такой же код 100, чтобы увидеть, насколько переменными были результаты. В 98/100 прогонах всегда был выбран один конкретный предиктор (иногда только сам по …

4
Являются ли «случайная выборка» и «случайная переменная» синонимами?
Я столкнулся с трудностями в понимании значения «случайной выборки», а также «случайной переменной iid». Я пытался выяснить смысл из нескольких источников, но все больше запутывался. Я публикую здесь то, что я попробовал и узнал: Вероятность и статистика Дегрута говорит: Случайные выборки / iid / Размер выборки: рассмотрим заданное распределение вероятностей …

1
Разница между Первичной, Двойственной и Ядровой Регрессией
В чем разница между Первичной , Двойственной и Ядровой Регрессией? Люди используют все три, и из-за разных обозначений, которые все используют в разных источниках, мне трудно следовать. Так может кто-нибудь сказать мне простыми словами, в чем разница между этими тремя? Кроме того, в чем могут быть некоторые преимущества или недостатки …

4
Как лучше всего визуализировать различия во многих пропорциях в трех группах?
Я пытаюсь визуально сравнить, как три разные новостные публикации освещают разные темы (определенные с помощью модели тем LDA). Для этого у меня есть два связанных метода, но я получил много отзывов от коллег, что это не очень интуитивно понятно. Я надеюсь, что у кого-то есть лучшая идея для визуализации этого. …

2
Рассчитать коэффициенты в логистической регрессии с помощью R
В множественной линейной регрессии можно найти коэффициент по следующей формуле. б = ( х'Икс)- 1( X') Yбзнак равно(Икс'Икс)-1(Икс')Yb = (X'X)^{-1}(X')Y beta = solve(t(X) %*% X) %*% (t(X) %*% Y) ; beta Например: > y <- c(9.3, 4.8, 8.9, 6.5, 4.2, 6.2, 7.4, 6, 7.6, 6.1) > x0 <- c(1,1,1,1,1,1,1,1,1,1) > …

1
MCMC в ограниченном пространстве параметров?
Я пытаюсь применить MCMC к проблеме, но мои априоры (в моем случае это α∈[0,1],β∈[0,1]α∈[0,1],β∈[0,1]\alpha\in[0,1],\beta\in[0,1] )) ограничены областью? Могу ли я использовать обычный MCMC и игнорировать выборки, которые выходят за пределы запрещенной зоны (которая в моем случае равна [0,1] ^ 2), то есть повторно использовать функцию перехода, когда новый переход выпадает …

3
Что означает «нормализация» и как проверить, что выборка или распределение нормализованы?
У меня есть вопрос, в котором он просит проверить, нормализовано ли равномерное распределение ( Uniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ). С одной стороны, что означает для любого распределения быть нормализованным? И второе: как нам проверить, нормализовано ли распределение? Я понимаю, вычисляя X−meansdX−meansd \frac{X-\text{mean}}{\text{sd}} мы получаем нормализованныеданные, но здесь мы просим проверить,нормализованолираспределение.

2
Какие четыре оси на биплоте PCA?
Когда вы строите биплот для анализа PCA, у вас есть оценки PC1 основного компонента по оси x и оценки PC2 по оси y. Но каковы две другие оси справа и сверху экрана?
18 r  pca  biplot 

2
Обнаружение аномалий с фиктивными характеристиками (и другими дискретными / категориальными характеристиками)
ТЛ; др Каков рекомендуемый способ обработки discreteданных при обнаружении аномалий? Каков рекомендуемый способ обработки categoricalданных при обнаружении аномалий? Этот ответ предлагает использовать дискретные данные для фильтрации результатов. Возможно, замените значение категории шансом наблюдения перктата? вступление Это моя первая публикация здесь, поэтому, пожалуйста, если что-то не кажется технически правильным, ни в …

2
использование весов в svyglm vs glm
Я хотел бы знать, как обработка веса отличается между svyglmиglm Я использую twangпакет в R для создания оценок склонности, которые затем используются в качестве весов, как показано ниже (этот код взят из twangдокументации): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black + hispan + nodegree …
18 r  survey 

1
Основные вопросы об анализе выживания в дискретном времени
Я пытаюсь провести анализ выживания с дискретным временем, используя модель логистической регрессии, и я не уверен, что полностью понимаю процесс. Я был бы очень признателен за помощь с несколькими основными вопросами. Вот установка: Я смотрю на членство в группе в течение пятилетнего периода времени. Каждый участник имеет ежемесячную запись членства …


2
Множественное вложение для исходных переменных
У меня есть набор данных по сельскохозяйственным испытаниям. Моя переменная ответа - это соотношение ответов: log (лечение / контроль). Меня интересует, что опосредует разницу, поэтому я использую мета-регрессии RE (невзвешенные, потому что кажется довольно ясным, что величина эффекта не связана с дисперсией оценок). Каждое исследование сообщает урожай зерна, урожай биомассы …

1
Как проверить статистическую значимость категориальной переменной в линейной регрессии?
Если в линейной регрессии у меня есть категориальная переменная ... как я могу узнать статистическую значимость категориальной переменной? Допустим, фактор имеет 10 уровней ... будет 10 различных результирующих t-значений под зонтиком одной факторной переменной ...X1X1X_1X1X1X_1 Мне кажется, что статистическая значимость проверяется для каждого уровня факторной переменной? Нет? @Macro: Следуя вашему …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.