Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Как проверить и избежать мультиколлинеарности в смешанной линейной модели?
В настоящее время я использую линейные модели со смешанным эффектом. Я использую пакет "lme4" в R. Мои модели принимают форму: model <- lmer(response ~ predictor1 + predictor2 + (1 | random effect)) Перед запуском моих моделей я проверил возможную мультиколлинеарность между предикторами. Я сделал это путем: Создайте план данных из …

3
Зачем использовать оценки Лассо над оценками OLS для Лассо-идентифицированного подмножества переменных?
Для регрессии Лассо предположим что лучшее решение (например, минимальная ошибка тестирования) выбирает k функций, так что \ hat {\ beta} ^ {lasso} = \ left (\ hat {\ beta} _1 ^ {lasso}, \ hat {\ beta} _2 ^ {lasso}, ..., \ hat {\ beta} _k ^ {lasso}, 0, ... 0 …

4
Интуиция за стандартным отклонением
Я пытаюсь лучше понять стандартное отклонение. Из того, что я понимаю, оно представляет собой среднее значение отличий набора наблюдений в наборе данных от среднего значения этого набора данных. Однако на самом деле он НЕ равен средним значениям различий, так как он придает больший вес наблюдениям дальше от среднего значения. Скажем, …

2
Правильно ли я указал свою модель в lmer?
Я просмотрел множество справочных сайтов и все еще не понимаю, как указать более сложные вложенные термины в смешанной модели. Меня также смущает использование :и /и |при указании взаимодействий и вложений со случайными факторами, использующимися lmer()в lme4пакете в R. Для целей этого вопроса давайте предположим, что я точно изобразил свои данные …

4
Внутренняя и внешняя перекрестная проверка и выбор модели
Насколько я понимаю, с помощью перекрестной проверки и выбора модели мы пытаемся решить две проблемы: P1 . Оцените ожидаемую потерю населения при обучении с нашей выборкой P2 . Измерьте и сообщите нашу неопределенность этой оценки (дисперсия, доверительные интервалы, отклонения и т. Д.) Стандартная практика, как представляется, заключается в проведении повторной …

2
Что на самом деле означает значение logit?
У меня есть модель логита, которая во многих случаях подходит от 0 до 1, но как мы можем это интерпретировать? Давайте возьмем случай с логитом 0,20 Можем ли мы утверждать, что существует 20% вероятность того, что дело принадлежит группе B против группы A? это правильный способ интерпретации значения логита?

5
Включение лаговой зависимой переменной в регрессию
Меня очень смущает вопрос, законно ли включать в регрессионную модель отстающую зависимую переменную. По сути, я думаю, что если эта модель фокусируется на взаимосвязи между изменением Y и другими независимыми переменными, то добавление зависимой переменной с запаздыванием в правой части может гарантировать, что коэффициент перед другими IV не зависит от …

6
Есть ли «привет, мир» для статистической графики?
В компьютерном программировании существует классическая первая программа для изучения / преподавания нового языка или системы, называемая «привет, мир». http://en.wikipedia.org/wiki/Hello_world_program Существует ли классическая первая визуализация данных для использования графического пакета? Если так, то, что это? А если нет, то какими будут хорошие кандидаты?

2
В сущности, какова реальная разница между cv и repeatcv?
Это похоже на методы повторной выборки вопроса Карета , хотя в действительности это никогда не отвечало на эту часть вопроса согласованным образом. Функция поезда Caret предлагает cvи repeatedcv. В чем разница, скажем, делать: MyTrainControl=trainControl( method = "cv", number=5, repeats=5 ) против MyTrainControl=trainControl( method = "repeatedcv", number=5, repeats=5 ) Я понимаю, …

3
Предварительные условия для сравнения моделей AIC
Какие именно предварительные условия необходимо выполнить для сравнения моделей AIC для работы? Я только пришел к этому вопросу, когда я сделал сравнение, как это: > uu0 = lm(log(usili) ~ rok) > uu1 = lm(usili ~ rok) > AIC(uu0) [1] 3192.14 > AIC(uu1) [1] 14277.29 Таким образом, я оправдал logпреобразование переменной …

1
PCA, LDA, CCA и PLS
Как связаны PCA, LDA, CCA и PLS? Все они кажутся «спектральными» и линейными алгебраическими и очень хорошо понятными (скажем, 50+ лет теории, построенной вокруг них). Они используются для самых разных вещей (PCA для уменьшения размерности, LDA для классификации, PLS для регрессии), но все же они чувствуют себя очень тесно связанными.

4
Прогнозирование с использованием как непрерывных, так и категориальных функций
Некоторые методы прогнозирующего моделирования больше предназначены для обработки непрерывных предикторов, а другие - для обработки категориальных или дискретных переменных. Конечно, существуют методы преобразования одного типа в другой (дискретизация, фиктивные переменные и т. Д.). Однако существуют ли какие-либо методы прогнозного моделирования, которые предназначены для одновременной обработки обоих типов ввода без простой …

6
Оценка одной и той же модели по нескольким временным рядам
У меня есть опыт новичка во временных рядах (некоторые оценки / прогнозы ARIMA), и я столкнулся с проблемой, которую я не до конца понимаю. Любая помощь будет принята с благодарностью. Я анализирую несколько временных рядов, все в одном и том же временном интервале и на одной и той же частоте, …


1
Эквивалентность наименьших квадратов и MLE в гауссовой модели
Я новичок в машинном обучении и пытаюсь научиться этому сам. Недавно я читал некоторые конспекты лекций и у меня возник основной вопрос. Слайд 13 говорит, что «Оценка по методу наименьших квадратов такая же, как и оценка максимального правдоподобия по гауссовой модели». Кажется, это что-то простое, но я не могу этого …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.