Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Интуиция по определению ковариации
Я пытался лучше понять Ковариацию двух случайных переменных и понять, как первый человек, который об этом подумал, пришел к определению, которое обычно используется в статистике. Я пошел в Википедию, чтобы понять это лучше. Из статьи видно, что хороший показатель-кандидат или величина для должны обладать следующими свойствами:Cov(X,Y)Cov(X,Y)Cov(X,Y) Он должен иметь положительный …

2
Логистическая регрессия: интерпретация непрерывных переменных
У меня было несколько вопросов о том, как интерпретировать отношения шансов для непрерывных переменных в логистической регрессии. Я чувствую, что это основные вопросы о логистической регрессии (и, вероятно, о регрессии в целом), и, хотя мне немного стыдно, что я не знаю ответов, я проглочу свою гордость и задам их, чтобы …

3
Разница между ep-SVR и nu-SVR (и методом наименьших квадратов SVR)
Я пытаюсь выяснить, какой SVR подходит для такого рода данных. Я знаю 4 типа СВР: эпсилон ню наименьших квадратов и линейно. Я понимаю, что линейный SVR более или менее похож на лассо с L1 Reg, но в чем разница между оставшимися 3 методами?
11 regression  svm 

1
Как мы предсказываем редкие события?
Я работаю над разработкой модели прогнозирования страхового риска. Эти модели относятся к «редким событиям», таким как прогнозирование неявки авиакомпаний, обнаружение неисправностей оборудования и т. Д. Когда я готовил свой набор данных, я пытался применить классификацию, но не смог получить полезные классификаторы из-за высокой доли отрицательных случаев. , У меня нет …

1
Как выбрать вероятность отсечения для редкого события Логистическая регрессия
У меня есть 100 000 наблюдений (9 фиктивных переменных индикатора) с 1000 положительных результатов. Логистическая регрессия должна работать нормально в этом случае, но вероятность отсечения озадачивает меня. В обычной литературе мы выбираем 50% -ное сокращение, чтобы предсказать 1 и 0. Я не могу этого сделать, так как моя модель дает …

4
Введение в непараметрическую статистику
Я изучал статистику в течение последних двух лет. Почти все, что я узнал, о параметрической статистике. Теперь я хотел бы узнать больше о непараметрической статистике. Кто-нибудь может предложить какое-то краткое (возможно, читабельное) введение в эту область?

3
Какой алгоритм я должен использовать, чтобы разбить огромный набор двоичных данных на несколько категорий?
У меня есть большая (650K строк * 62 столбцов) матрица двоичных данных (только 0-1 записей). Матрица в основном скудная: около 8% заполнено. Я хотел бы разбить его на 5 групп, скажем, с именами от 1 до 5. Я пробовал иерархическую кластеризацию, и она не смогла обработать размер. Я также использовал …

2
Общий метод получения стандартной ошибки
Я не могу найти общий метод для получения стандартных ошибок в любом месте. Я смотрел на Google, этот веб-сайт и даже в учебниках, но все, что я могу найти, - это формула для стандартных ошибок среднего, дисперсии, пропорции, степени риска и т. Д., А не то, как были получены эти …

1
Обратно преобразованные доверительные интервалы
Столкнувшись с этим обсуждением, я поднимаю вопрос о конвенциях с обратным преобразованием доверительных интервалов. В соответствии с этой статьей номинальное покрытие обратного преобразования КИ для среднего значения логнормальной случайной величины составляет: UCL(X)=exp(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) UCL(X)=exp⁡(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ UCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}+z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) LCL(X)=exp(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) LCL(X)=exp⁡(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1))\ LCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}-z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) / а не наивный /exp((Y)+zvar(Y)−−−−−−√)exp⁡((Y)+zvar(Y))\exp((Y)+z\sqrt{\text{var}(Y)}) Теперь, что такое такие КИ для …

1
Оценки параметров для нормального распределения асимметрии
Каковы оценки параметров формул для косой нормали? Если вы можете, деривация через MLE или Mom тоже была бы отличной. Спасибо Редактировать . У меня есть набор данных, для которых я могу сказать визуально по графикам немного перекошен влево. Я хочу оценить среднее значение и дисперсию, а затем провести тест на …

2
Значение среднего коэффициента корреляции
Отказ от ответственности: если вы обнаружите, что этот вопрос слишком похож на другой, я рад его объединению. Тем не менее, я не нашел удовлетворительного ответа где-либо еще (и у меня пока нет «репутации», чтобы комментировать или поднимать голос), поэтому я подумал, что было бы лучше задать новый вопрос самостоятельно. У …

3
Когда наименьшие квадраты будут плохой идеей?
Если у меня есть модель регрессии: где и ,Y= Хβ+ εY=Xβ+ε Y = X\beta + \varepsilon V [ε]=Id∈ Rn × nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E [ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) когда использование , обычного метода наименьших квадратов , будет плохим выбором для оценки?βМНКβOLS\beta_{\text{OLS}}ββ\beta Я пытаюсь понять пример, где …

1
SurveyMonkey игнорирует тот факт, что вы получаете неслучайный образец?
SurveyMonkey имеет шаги и диаграмму, чтобы вы могли определить, какой размер выборки вам нужен для данного диапазона погрешности или доверительного интервала, исходя из размера вашей популяции. Размер выборки SurveyMonkey Эта диаграмма просто игнорирует тот факт, что вы не получите случайную выборку, поскольку вы получаете только людей, которые потрудились ответить на …

1
Тест отношения правдоподобия и тест Вальда дают разные выводы для glm в R
Я воспроизводлю пример из обобщенных, линейных и смешанных моделей . Мой MWE ниже: Dilution <- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates <- rep(x=5, times=10) NoPositive <- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data <- data.frame(Dilution, NoofPlates, NoPositive) fm1 <- glm(formula=NoPositive/NoofPlates~log(Dilution), family=binomial("logit"), …

3
Первый основной компонент не разделяет классы, но другие ПК делают; как это возможно?
Я запустил PCA на 17 количественных переменных, чтобы получить меньший набор переменных, которые являются основными компонентами, которые будут использоваться в контролируемом машинном обучении для классификации экземпляров на два класса. После PCA на ПК1 приходится 31% отклонений в данных, на ПК2 - 17%, на ПК3 - 10%, на ПК4 - 8%, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.