Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Требуется ли предварительная обработка перед прогнозированием с использованием FinalModel из RandomForest с пакетом Caret?
Я использую пакет caret для обучения объекта randomForest с 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) После этого я тестирую randomForest на testSet (новые данные) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Матрица путаницы показывает мне, что модель не так уж и …

3
Когда уместно выбирать модели, сводя к минимуму AIC?
Хорошо известно, по крайней мере среди статистиков более высокого уровня, что модели со значениями статистики AIC в пределах определенного порога минимального значения следует рассматривать как соответствующие модели, минимизирующей статистику AIC. Например, в [1, с.221] находим Тогда модели с маленьким GCV или AIC будут считаться лучшими. Конечно, нельзя просто слепо минимизировать …

2
Интуиция за именами «частичные» и «маргинальные» корреляции
Кто-нибудь имеет представление о том, почему условную корреляцию между двумя переменными называют «частичной» корреляцией, а простую корреляцию между ними (то есть, если она не обусловлена ​​какой-либо другой переменной) называют «предельной» корреляцией? Что такое интуиция за словами «частичный» и «маргинальный»? Что они делают с «частями» или «полями»? Было бы хорошо узнать …

1
Необходимое и достаточное условие совместной МГФ для независимости
Предположим, у меня есть совместная функция, генерирующая момент для совместного распределения с CDF . Является ли необходимым и достаточным условием независимости и ? Я проверил пару учебников, в которых упоминалась только необходимость:MX,Y(s,t)MX,Y(s,t)M_{X,Y}(s,t)FX,Y(x,y)FX,Y(x,y)F_{X,Y}(x,y)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)M_{X,Y}(s,t)=M_{X,Y}(s,0)⋅M_{X,Y}(0,t)XXXYYY FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)F_{X,Y}(x,y)=F_X(x)\cdot F_Y(y) \implies M_{X,Y}(s,t)=M_X(s) \cdot M_Y(t) Этот результат очевиден, поскольку независимость подразумевает . Так как MGF маргиналов определяются …

2
При подборе кривой, как рассчитать 95% доверительный интервал для моих подогнанных параметров?
Я подгоняю кривые к своим данным, чтобы извлечь один параметр. Однако я не уверен, какова достоверность этого параметра и как я рассчитал бы / выразил его % доверительный интервал.959595 Скажем, для набора данных, содержащего данные, которые экспоненциально распадаются, я подгоняю кривую к каждому набору данных. Тогда информация, которую я хочу …

4
Сравнение оценки максимального правдоподобия (MLE) и теоремы Байеса
В теореме Байеса , а из книги, которую я читаю, называется вероятность , но я предполагаю , что это всего лишь условная вероятность от дается , не так ли? p(x|y)p(y|x)=p(x|y)p(y)p(x)п(Y|Икс)знак равноп(Икс|Y)п(Y)п(Икс)p(y|x) = \frac{p(x|y)p(y)}{p(x)}p(x|y)п(Икс|Y)p(x|y)уxИксxyYy Оценка максимального правдоподобия пытается максимизировать , верно? Если это так, я сильно запутался, потому что обе случайные …

3
Рассчитать неопределенность наклона линейной регрессии на основе неопределенности данных
Как рассчитать неопределенность наклона линейной регрессии на основе неопределенности данных (возможно, в Excel / Mathematica)? Пример: у нас есть точки данных (0,0), (1,2), (2,4), (3,6), (4,8), ... (8, 16), но каждое значение y имеет неопределенность 4. Большинство функций, которые я обнаружил, вычислили бы неопределенность как 0, так как точки полностью …

4
Почему вообще стоит рассматривать выборку без замены в практическом применении?
Выборка с заменой имеет два преимущества перед выборкой без замены: 1) Вам не нужно беспокоиться о конечной коррекции населения. 2) Существует вероятность, что элементы из совокупности отрисовываются несколько раз - тогда вы можете перезапустить измерения и сэкономить время. Конечно, из академического POV нужно исследовать оба метода. Но из практического POV …

2
Обеспечивает ли MCMC выполнение детального баланса стационарное распределение?
Я предполагаю, что понимаю уравнение условия детального баланса, в котором говорится, что для вероятности перехода и стационарного распределения π марковская цепь удовлетворяет подробному балансу, если q ( x | y ) π ( y ) = q ( y | x ) π ( х ) ,qqqππ\piq(x|y)π(y)=q(y|x)π(x),q(x|y)π(y)=q(y|x)π(x),q(x|y)\pi(y)=q(y|x)\pi(x), это имеет больше …

4
Проверка гипотез с большими данными
Как вы выполняете проверки гипотез с большими данными? Я написал следующий скрипт MATLAB, чтобы подчеркнуть мою путаницу. Все, что он делает, это генерирует два случайных ряда и запускает простую линейную регрессию одной переменной с другой. Он выполняет эту регрессию несколько раз, используя разные случайные значения и сообщает средние значения. Как …

2
Почему значение Морана I не равно «-1» в идеально распределенной точке
Википедия не так ... или я не понимаю? Википедия: Белые и черные квадраты («шахматный рисунок») отлично рассеяны, поэтому у Морана я буду -1. Если бы белые квадраты были сложены на одной половине доски, а черные - на другой, значение Морана I было бы близко к +1. Случайное расположение квадратных цветов …

1
Достижимые корреляции для экспоненциальных случайных величин
Каков диапазон достижимых корреляций для пары экспоненциально распределенных случайных величин и , где - это параметры ставки?X1∼Exp(λ1)X1∼Exp(λ1)X_1 \sim {\rm Exp}(\lambda_1)X2∼Exp(λ2)X2∼Exp(λ2)X_2 \sim {\rm Exp}(\lambda_2)λ1,λ2>0λ1,λ2>0\lambda_1, \lambda_2 > 0

3
Что такое стационарный процесс второго порядка?
Мне было интересно, как его «стационарный процесс второго порядка» определяется в книге Броквелла и Дэвиса « Введение во временные ряды и прогнозирование» : Класс моделей линейных временных рядов, который включает в себя класс моделей авторегрессионного скользящего среднего (ARMA), обеспечивает общую основу для изучения стационарных процессов. Фактически, каждый стационарный процесс второго …

2
Прогнозирование часовых временных рядов с ежедневной, еженедельной и годовой периодичностью
Основная редакция: Я хотел бы сказать большое спасибо Дэйву и Нику за их ответы. Хорошая новость заключается в том, что у меня получился цикл (принцип заимствован из поста профессора Гиднмана о пакетном прогнозировании). Чтобы объединить невыполненные запросы: а) Как мне увеличить максимальное число итераций для auto.arima - кажется, что при …

2
Гетероскедастичность и нормальность остатков
Полагаю, у меня неплохая линейная регрессия (это для университетского проекта, поэтому мне не нужно быть очень точным). Дело в том, что если я построю график зависимости остатков от прогнозируемых значений, то (по словам моего учителя) есть намек на гетероскедастичность. Но если я нанесу QQ-график остатков, ясно, что они нормально распределены. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.