Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Почему мы говорим «Остаточная стандартная ошибка»?
Стандартной ошибкой является оценочное стандартное отклонение оценки для параметра . & thetas ; & thetasσ^( θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta Почему расчетное стандартное отклонение от остатков называется «остаточной стандартной ошибкой» (например, при выводе функции R summary.lm), а не «остаточное стандартное отклонение»? Какую оценку параметров мы снабжаем здесь стандартной ошибкой? Рассматриваем ли мы каждый …

2
Почему квадратная разница так часто используется?
Очень часто, когда я исследую новые статистические методы и концепции, я сталкиваюсь с квадратом разницы (или среднеквадратичной ошибкой, или множеством других эпитетов). Как пример, r Пирсона определяется на основе среднего квадрата разности от линии регрессии, в которой лежат точки. Для ANOVA вы смотрите на сумму квадратов и так далее. Теперь …

4
Как интерпретировать кривую ROC?
Я применил логистическую регрессию к своим данным в SAS, и вот кривая ROC и таблица классификации. Я доволен цифрами в таблице классификации, но не совсем уверен, что показывают кривая Рока и область под ней. Любое объяснение будет с благодарностью.

1
Прогноз временных рядов Arima (auto.arima) с несколькими экзогенными переменными в R
Я хотел бы провести прогноз на основе ARIMA-модели с несколькими временными рядами с несколькими экзогенными переменными. Поскольку я не настолько опытен в отношении статистики, которую ни RI хотят сохранить, это настолько просто, насколько это возможно (прогноз тренда на 3 месяца достаточно). У меня есть 1 зависимый временной ряд и 3-5 …
14 r  time-series  arima 

1
Почему Ридж Регресс хорошо работает при наличии мультиколлинеарности?
Я узнаю о регрессии гребня и знаю, что регрессия гребня работает лучше при наличии мультиколлинеарности. Мне интересно, почему это правда? Был бы удовлетворен либо интуитивный, либо математический ответ (оба типа ответов были бы еще более удовлетворительными). Кроме того , я знаю, что β всегда можно получить, но насколько хорошо хребет …

4
Следует ли использовать среднее значение при перекосе данных?
Часто вводные тексты по прикладной статистике отличают среднее от медианного (часто в контексте описательной статистики и мотивации суммирования центральной тенденции с использованием среднего, медианного значения и режима), объясняя, что среднее значение чувствительно к выбросам в данных выборки и / или искаженное распределение населения, и это используется в качестве оправдания для …

3
При выполнении t-теста для значимости коэффициента регрессии, почему число степеней свободы
Я прочитал здесь, что было числом степеней свободы, которые я должен использовать, выполняя t-тест на значимость коэффициента регрессии, но я не понимаю, почему. Насколько я понимаю, t-тесты обычно имеют n - 1 степень свободы.n - p - 1n−p−1n-p-1n - 1n−1n-1

3
Термин перехвата в логистической регрессии
Предположим, у нас есть следующая модель логистической регрессии: логит ( р ) = β0+ β1Икс1+ β2Икс2logit(p)=β0+β1x1+β2x2\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} Является ли вероятностью события, когда и ? Другими словами, это вероятность события, когда и находятся на самых низких уровнях (даже если это не 0)? Например, если и принимают только значения …

2
Правила «когда использовать боксплот и когда барплот» (большого пальца?)
Оба коробчатые и усы- график и гистограмма являются соответствующими графиками для ANOVA в соответствии с R Book (Кроули, 2013), но который является более подходящим ? Я полагаю, это зависит от ситуации ... кто-нибудь может мне помочь?

5
Нахождение точек перегиба в R по сглаженным данным
У меня есть некоторые данные, которые я использую loess. Я хотел бы найти точки перегиба сглаженной линии. Это возможно? Я уверен, что кто-то нашел причудливый метод, чтобы решить эту проблему ... Я имею в виду ... в конце концов, это R! Я в порядке с изменением функции сглаживания, которую я …
14 r  smoothing  loess 

3
Как я могу интерпретировать, что я получаю от PCA?
В рамках университетского задания я должен провести предварительную обработку данных на довольно большом, многомерном (> 10) наборе необработанных данных. Я не статистик в каком-либо смысле этого слова, поэтому я немного смущен тем, что происходит. Заранее извиняюсь за, возможно, смешной простой вопрос - у меня кружится голова, когда я смотрю на …
14 pca 

4
ROC и multiROC анализ: как рассчитать оптимальную точку среза?
Я пытаюсь понять, как вычислить оптимальную точку отсечения для кривой ROC (значение, при котором чувствительность и специфичность максимальны). Я использую набор данных aSAHиз пакета pROC. outcomeПеременная может быть объяснено двумя независимыми переменными: s100bи ndka. Используя синтаксис Epiпакета, я создал две модели: library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) Вывод иллюстрируется на …

2
Моделирование множественной линейной регрессии
Я новичок в языке R. Я хотел бы знать, как имитировать модель множественной линейной регрессии, которая удовлетворяет всем четырем предположениям регрессии. хорошо спасибо. Допустим, я хочу смоделировать данные на основе этого набора данных: y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) тогда я получаю вывод: Call: lm(formula = y ~ x1 + x2) …

2
Использование R для GLM с гамма-распределением
В настоящее время у меня проблема с пониманием синтаксиса R для подгонки GLM с использованием гамма-распределения. У меня есть набор данных, где каждая строка содержит 3 ко-вариации ( ), переменную ответа ( ) и параметр формы ( K ). Я хочу смоделировать масштаб гамма-распределения как линейную функцию от трех ковариат, …

3
Выполните линейную регрессию, но заставьте решение пройти через определенные точки данных
Я знаю, как выполнить линейную регрессию на множестве точек. То есть я знаю, как подогнать полином по своему выбору для данного набора данных (в смысле LSE). Однако чего я не знаю, так это как заставить мое решение пройти через некоторые конкретные пункты моего выбора. Я видел, как это было сделано …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.