Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Почему runif не генерирует один и тот же результат каждый раз?
Почему генераторы случайных чисел, такие как runif()в R, не генерируют один и тот же результат каждый раз? Например: X <- runif(100) X генерирует разные выходы каждый раз. В чем причина создания разных выходов каждый раз? Какие функции у него есть в фоновом режиме, чтобы сделать это?

2
glmnet: как понять многочленовую параметризацию?
Следующая проблема: я хочу предсказать переменную категориального ответа с одной (или более) категориальными переменными, используя glmnet (). Тем не менее, я не могу понять, какой вывод дает мне glmnet. Хорошо, сначала давайте сгенерируем две связанные категориальные переменные: Генерировать данные p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), …

2
Квадратичное программирование и лассо
Я пытаюсь выполнить регрессию лассо, которая имеет следующую форму: Минимизируйте вwww(Y−Xw)′(Y−Xw)+λ|w|1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 Учитывая , мне посоветовали найти оптимальное с помощью квадратичного программирования, которое принимает следующую форму:λλ\lambdawww Минимизируйте в , в зависимости отxxx12x′Qx+c′x12x′Qx+c′x\frac{1}{2} x'Qx + c'xAx≤b.Ax≤b.Ax \le b. Теперь я понимаю, что термин должен быть …

1
Оценщик Джеймса-Стейна с неравными отклонениями
Каждое утверждение, которое я нахожу относительно оценки Джеймса-Стейна, предполагает, что оцениваемые случайные переменные имеют одинаковую (и единичную) дисперсию. Но во всех этих примерах также упоминается, что оценка JS может использоваться для оценки величин, не имеющих ничего общего друг с другом. Пример википедии является скорость света, потребление чая в Тайване, и …

1
Обратное преобразование результатов регрессии при моделировании журнала (y)
Я подгоняю регрессию к . Является ли обоснованным обратное преобразование точечных оценок (и доверительных интервалов / интервалов прогнозирования) путем возведения в степень? Я не верю в это, поскольку но хотел мнения других.log(y)log⁡(y)\log(y)E[f(X)]≠f(E[X])E[f(X)]≠f(E[X])E[f(X)] \ne f(E[X]) Мой пример ниже показывает конфликты с обратным преобразованием (.239 против .219). set.seed(123) a=-5 b=2 x=runif(100,0,1) y=exp(a*x+b+rnorm(100,0,.2)) …

2
Ожидание квадрата гамма
Если гамма-распределение параметризовано с помощью и , то:αα\alphaββ\beta E(Γ(α,β))=αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} Я хотел бы рассчитать ожидание квадрата гаммы, то есть: E(Γ(α,β)2)=?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? Я думаю, что это: E(Γ(α,β)2)=(αβ)2+αβ2E(Γ(α,β)2)=(αβ)2+αβ2 E(\Gamma(\alpha, \beta)^2) = \left(\frac{\alpha}{\beta}\right)^2 + \frac{\alpha}{\beta^2} Кто-нибудь знает, правильно ли это последнее выражение?

1
Когда корректировать значения p в нескольких сравнениях?
Боюсь, что связанные вопросы не ответили на мои. Мы оцениваем показатели> 2 классификаторов (машинное обучение). Наша нулевая гипотеза состоит в том, что показатели не отличаются. Мы проводим параметрический (ANOVA) и непараметрический (Friedman) тесты, чтобы оценить эту гипотезу. Если они важны, мы хотим выяснить, какие классификаторы отличаются в заданном квесте. Мой …

2
Что такое эквивалент lme4 :: lmer трехсторонних повторяющихся мер ANOVA?
Мой вопрос основан на этом ответе, который показал, какая lme4::lmerмодель соответствует двусторонним повторным измерениям ANOVA: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == "1",])) # …

1
Байесовское моделирование с использованием многомерного нормального с ковариатным
Предположим, у вас есть объясняющая переменная Х =(Х( с1) , … , X( сN) )Иксзнак равно(Икс(s1),...,Икс(sN)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right) где sss представляет данную координату. У вас также есть переменная ответа Y =(Y( с1) , … , Y( сN) )Yзнак равно(Y(s1),...,Y(sN)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) . Теперь мы можем объединить обе переменные как: W …

1
Подходит ли начальная загрузка для этих непрерывных данных?
Я полный новичок :) Я делаю исследование с размером выборки 10 000 человек из примерно 745 000 человек. Каждый образец представляет «процентное сходство». Подавляющее большинство выборок составляет около 97% -98%, но некоторые составляют от 60% до 90%, то есть распределение сильно искажено. Около 0,6% результатов составляют 0%, но они будут …

1
Многократные сравнения в непараметрическом тесте
Я работаю с набором данных, который является непараметрическим и имеет 12 обработок. Я выполнил тест Крускала-Уоллиса и получил значительное значение, и теперь я хотел бы провести процедуру множественных сравнений, чтобы увидеть, какие из обработок значительно различаются. По этой теме имеется много информации, но я не нашел ничего, что бы конкретно …

2
Как определить относительную значимость переменной в логистической регрессии в терминах p?
Предположим, что модель логистической регрессии используется для прогнозирования того, будет ли покупатель онлайн покупать продукт (результат: покупка) после того, как он нажал на набор онлайн-рекламы (предикторы: Ad1, Ad2 и Ad3). Результатом является двоичная переменная: 1 (купленная) или 0 (не приобретенная). Предикторами являются также двоичные переменные: 1 (нажата) или 0 (не …

6
Методы в R или Python для выбора функций в обучении без учителя [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Каковы доступные методы / реализации в R / Python для отбрасывания / выбора неважных / важных функций в данных? …

1
Выбор модели в автономном режиме и онлайн-обучения
В последнее время я пытался узнать больше об онлайн-обучении (это абсолютно увлекательно!), И одна тема, которую я так и не смог понять, - как думать о выборе моделей в офлайновом и онлайн-контекстах. В частности, предположим , что мы тренируем классификатор в автономном режиме, на основе некоторого фиксированного набора данных D …

3
GLM с непрерывными данными, накопленными в нуле
Я пытаюсь использовать модель для оценки того, насколько катастрофические заболевания, такие как туберкулез, СПИД и т. Д., Влияют на расходы на госпитализацию. У меня есть «стоимость госпитализации» в качестве зависимой переменной и различные индивидуальные маркеры в качестве независимых переменных, почти все из которых являются фиктивными, такими как пол, глава семьи, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.