Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Сюжет и интерпретация порядковой логистической регрессии
У меня есть порядковая зависимая переменная, легкость, которая варьируется от 1 (не просто) до 5 (очень легко). Увеличение значений независимых факторов связано с повышением рейтинга легкости. Две из моих независимых переменных ( condAи condB) являются категориальными, каждая с 2 уровнями, а 2 ( abilityA, abilityB) - непрерывными. Я использую порядковый …

5
Что на практике означает «вероятность определяется только с точностью до мультипликативной константы пропорциональности»?
Я читаю статью, в которой авторы ведут от обсуждения оценки максимального правдоподобия к теореме Байеса, якобы в качестве введения для начинающих. Как пример вероятности, они начинаются с биномиального распределения: p(x|n,θ)=(nx)θx(1−θ)n−xp(x|n,θ)=(nx)θx(1−θ)n−xp(x|n,\theta) = \binom{n}{x}\theta^x(1-\theta)^{n-x} а затем войти обе стороны ℓ(θ|x,n)=xln(θ)+(n−x)ln(1−θ)ℓ(θ|x,n)=xln⁡(θ)+(n−x)ln⁡(1−θ)\ell(\theta|x, n) = x \ln (\theta) + (n-x)\ln (1-\theta) с обоснованием того, что: …

2
Как вы «контролируете» фактор / переменную?
Насколько я понимаю, «Контроль» может иметь два значения в статистике. Контрольная группа: в эксперименте лечение контрольной группе не проводится. Пример: плацебо против наркотиков: вы даете наркотики одной группе, а не другой (контроль), что также называется «контролируемым экспериментом». Контроль за переменной: метод выделения эффекта конкретной независимой переменной. Некоторые из других имен, …

4
Как оценить подгонку биномиального GLMM с lme4 (> 1,0)?
У меня есть GLMM с биномиальным распределением и функцией logit link, и у меня есть ощущение, что важный аспект данных недостаточно хорошо представлен в модели. Чтобы проверить это, я хотел бы знать, хорошо ли данные описываются линейной функцией на шкале логита. Следовательно, я хотел бы знать, хорошо ли ведут себя …

2
Какой самый безболезненный способ вписать кривые логистического роста в R?
Для Google это не так просто, как для некоторых других вещей, поскольку, для ясности, я не говорю о логистической регрессии в смысле использования регрессии для прогнозирования категориальных переменных. Я говорю о подгонке кривой логистического роста к данным точкам данных. Чтобы быть точным, - это конкретный год с 1958 по 2012 …

5
Бета-регрессия данных о пропорциях, включая 1 и 0
Я пытаюсь создать модель, для которой у меня есть переменная ответа, которая составляет пропорцию между 0 и 1, это включает довольно много 0 и 1, но также и много значений между ними. Я думаю о попытке бета-регрессии. Пакет, который я нашел для R (betareg), допускает только значения в диапазоне от …


1
Как настроить аргумент xreg в auto.arima () в R? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 лет назад . Я работаю над небольшим проектом с одним временным рядом, который измеряет данные о посещениях клиентов (ежедневно). Мои ковариаты - это …

1
Исходная опасность Кокса
Допустим, у меня есть набор данных «почечный катетер». Я пытаюсь смоделировать кривую выживания, используя модель Кокса. Если я рассматриваю модель Кокса: мне нужна оценка базовой опасности. Используя встроенную функцию пакета R , я легко могу сделать это так:ч (t,Z) =h0exp(b'Z) ,h(T,Z)знак равночас0ехр⁡(б'Z),h(t,Z) = h_0 \exp(b'Z),survivalbasehaz() library(survival) data(kidney) fit <- coxph(Surv(time, …
19 r  cox-model  hazard 

2
Учебники для разработки функций
Как всем известно, разработка функций чрезвычайно важна для машинного обучения, однако я нашел немного материалов, связанных с этой областью. Я участвовал в нескольких соревнованиях в Kaggle и считаю, что в некоторых случаях хорошие характеристики могут быть даже важнее, чем хороший классификатор. Кто-нибудь знает какие-либо учебники по проектированию функций, или это …

1
Достижимые корреляции для логнормальных случайных величин
Рассмотрим логнормальные случайные величины X1X1X_1 и X2X2X_2 с log(X1)∼N(0,1)log⁡(X1)∼N(0,1)\log(X_1)\sim \mathcal{N}(0,1) и log(X2)∼N(0,σ2)log⁡(X2)∼N(0,σ2)\log(X_2)\sim \mathcal{N}(0,\sigma^2) . ρmaxρmax\rho_{\max}ρminρmin\rho_{\min}ρ(X1,X2)ρ(X1,X2)\rho (X_1,X_2) ρmax=ρ(exp(Z),exp(σZ))ρmax=ρ(exp⁡(Z),exp⁡(σZ))\rho_{\max}=\rho (\exp(Z),\exp(\sigma Z)) и ρmin=ρ(exp(Z),exp(−σZ))ρmin=ρ(exp⁡(Z),exp⁡(−σZ))\rho_{\min}=\rho (\exp(Z),\exp(-\sigma Z)) , но они сделали некоторые ссылки на комонотонность и контркомонотонность. Я надеялся, что кто-нибудь поможет мне понять, насколько они актуальны. (Я знаю, как получить это из общего …

2
Почему регрессия по поводу дисперсии?
Я читаю эту заметку . На странице 2 говорится: «Какая разница в данных объясняется данной регрессионной моделью?» «Интерпретация регрессии - это среднее значение коэффициентов, а вывод - об их дисперсии». Я много раз читал о таких утверждениях. Почему нас волнует вопрос: «Сколько различий в данных объясняет данная модель регрессии?» ... …

2
Что такое эмпирическая энтропия?
В определении совместно типичных множеств (в «Элементах теории информации», гл. 7.6, с. 195) мы используем пр(хп)=П п я = 1 р(хя)- 1Nжурналр ( хN)-1Nжурнал⁡п(ИксN)-\frac{1}{n} \log{p(x^n)} в качестве эмпирической энтропии в качестве -sequence с . Я никогда не сталкивался с этой терминологией раньше. Это нигде не определено явно согласно индексу книги.NNnр …

2
Каково определение симметричного распределения?
Каково определение симметричного распределения? Кто-то сказал мне, что случайная величина пришла из симметричного распределения тогда и только тогда, когда и имеют одинаковое распределение. Но я думаю, что это определение отчасти верно. Потому что я могу представить контрпример и . Очевидно, что оно имеет симметричное распределение, но и имеют разное распределение! …

2
Является ли преобразование журнала допустимым методом для t-тестирования ненормальных данных?
В рецензии на статью авторы утверждают: «Непрерывные переменные результата, демонстрирующие искаженное распределение, были преобразованы с использованием натуральных логарифмов перед проведением t-тестов для удовлетворения предварительных условий нормальности». Является ли это приемлемым способом анализа нестандартных данных, особенно если базовое распределение не обязательно является логнормальным? Это может быть очень глупый вопрос, но я …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.