Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Каков типичный диапазон возможных значений параметра усадки в штрафной регрессии?
В регрессии лассо или гребня необходимо указать параметр сжатия, часто называемый или . Это значение часто выбирается путем перекрестной проверки путем проверки множества различных значений на обучающих данных и определения того, какое из них дает наилучший результат, например, на тестовых данных. Какой диапазон значений следует проверить? Это ?λλ\lambdaαα\alphaр2р2R^2( 0 , …

2
Оценить коэффициенты ARMA путем проверки ACF и PACF
Как вы оцениваете подходящую модель прогноза для временного ряда путем визуального осмотра графиков ACF и PACF? Какой из них (например, ACF или PACF) сообщает AR или MA (или они оба)? Какая часть графиков показывает вам сезонную и несезонную часть для сезонной ARIMA? Рассмотрим функции ACF и PCF, показанные ниже. Они …

1
Имеет ли логарифмическая вероятность в GLM гарантированную сходимость к глобальным максимумам?
Мои вопросы: Обязательно ли обобщенные линейные модели (GLM) сходятся к глобальному максимуму? Если так, то почему? Кроме того, какие ограничения существуют для функции связи для обеспечения выпуклости? Мое понимание GLM состоит в том, что они максимизируют крайне нелинейную функцию правдоподобия. Таким образом, я бы предположил, что существует несколько локальных максимумов, …

2
Каковы требования стационарности использования регрессии с ошибками ARIMA для вывода?
Каковы требования стационарности использования регрессии с ошибками ARIMA (динамическая регрессия) для вывода? В частности, у меня есть нестационарная непрерывная переменная исхода , нестационарная непрерывная переменная предиктора и ряд обработки фиктивных переменных . Я хотел бы знать, коррелировалось ли лечение с изменением исходной переменной, которое составляет более двух стандартных ошибок по …

3
В чем разница между онлайн и пакетным обучением?
В настоящее время я читаю статью « Эффективное онлайн и пакетное обучение с использованием прямого и обратного разделения » Джона Дючи и Йорама Сингера. Я очень смущен использованием терминов «Онлайн» и «Пакетный режим». Я подумал: «Онлайн» означает, что мы обновляем весовые параметры после обработки одной единицы тренировочных данных. Затем мы …

4
Какая лучшая книга об обобщенных линейных моделях для новичков?
Я все еще довольно новичок в обобщенных линейных моделях, и я борюсь со многими обозначениями в большинстве текстов GLM, которые я выбрал. Существуют ли чрезвычайно популярные книги по GLM, которые лучше читаются?

2
Как правильно выбрать алгоритм оптимизации?
Мне нужно найти минимум функции. Читая документы по адресу http://docs.scipy.org/doc/scipy/reference/optimize.html, я вижу, что есть несколько алгоритмов, которые делают одно и то же, то есть находят минимум. Как я узнаю, какой из них выбрать? некоторые из перечисленных алгоритмов Минимизируйте функцию, используя алгоритм симплексного спуска. Минимизируйте функцию, используя алгоритм BFGS. Минимизируйте функцию …

3
Меняет ли добавление большего количества переменных в многовариантную регрессию коэффициенты существующих переменных?
Скажем, у меня есть регрессия с несколькими переменными (несколько независимых переменных), которая состоит из 3 переменных. Каждая из этих переменных имеет заданный коэффициент. Если я решу ввести 4-ю переменную и повторно запустить регрессию, изменятся ли коэффициенты 3 исходных переменных? В более широком смысле: в регрессии с несколькими переменными (множественными независимыми …

5
Как распределение выборки означает, что выборка приближается к средней численности населения?
Я пытаюсь изучать статистику, потому что я нахожу, что она настолько распространена, что запрещает мне изучать некоторые вещи, если я не понимаю ее должным образом. У меня возникли проблемы с пониманием этого понятия выборочного распределения средних значений. Я не могу понять, как некоторые книги и сайты объясняют это. Я думаю, …

3
Использование пакета прогноза R с отсутствующими значениями и / или нерегулярными временными рядами
Я впечатлен forecastпакетом R , а также, например, zooпакетом для нерегулярных временных рядов и интерполяции пропущенных значений. Мое приложение находится в области прогнозирования трафика в колл-центре, поэтому данные о выходных (почти) всегда отсутствуют, что может быть легко обработано zoo. Кроме того, некоторые дискретные точки могут отсутствовать, я просто использую R …

2
PCA и k-кратная перекрестная проверка в пакете каретки в R
Я только что посмотрел лекцию из курса машинного обучения на Coursera. В разделе, где профессор обсуждает PCA для предварительной обработки данных в контролируемых учебных приложениях, он говорит, что PCA следует выполнять только на обучающих данных, а затем отображение используется для преобразования перекрестной проверки и тестовых наборов. См. Также PCA и …

2
Когда кто-то говорит, что для модели Пуассона остаточное отклонение / df должно составлять ~ 1, насколько приблизительным является приблизительное значение?
Я часто видел советы по проверке того, является ли подход Пуассона более рассредоточенным, включая деление остаточного отклонения на степени свободы. Результирующее соотношение должно быть «примерно 1». Вопрос в том, о каком диапазоне мы говорим о «приблизительном» - каково соотношение, которое должно вызывать сигналы тревоги для рассмотрения альтернативных форм моделей?

5
Как влияет увеличение данных обучения на общую точность системы?
Может ли кто-то резюмировать для меня возможные примеры, в каких ситуациях увеличение обучающих данных улучшает общую систему? Когда мы обнаружим, что добавление большего количества данных для обучения может привести к переопределению данных и не дать точных данных теста? Это очень неспецифичный вопрос, но если вы хотите ответить на него конкретно …

2
Тест на выборку IID
Как бы вы проверили или проверили, что выборка является IID (независимой и идентично распределенной)? Обратите внимание, что я не имею в виду гауссово и идентично распределенное, просто IID. И идея, которая приходит мне в голову, состоит в том, чтобы многократно разделить выборку на две подвыборки одинакового размера, выполнить тест Колмогорова-Смирнова …

3
Существует ли общий метод для моделирования данных из формулы или анализа?
De novo моделирование данных из экспериментальной модели данных. С акцентом на R (хотя другое языковое решение было бы здорово). При разработке эксперимента или опроса моделирование данных и проведение анализа этих смоделированных данных может обеспечить потрясающее понимание преимуществ и недостатков проекта. Такой подход также может быть необходим для понимания и правильного …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.