Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Примеры расширенного регрессионного моделирования
Я ищу расширенное тематическое исследование линейной регрессии, иллюстрирующее шаги, необходимые для моделирования сложных, множественных нелинейных отношений с использованием GLM или OLS. На удивление трудно найти ресурсы, выходящие за рамки базовых школьных примеров: большинство книг, которые я прочитал, не пойдет дальше, чем лог-преобразование ответа в сочетании с BoxCox одного предиктора или …

5
Что выучить после Casella & Berger?
Я чистый аспирант с небольшим опытом в прикладной математике. С прошлой осени я посещал занятия по книге Казеллы и Бергера, и я закончил сотни (более 230) страниц с упражнениями в книге. Прямо сейчас я нахожусь в главе 10. Однако, поскольку я не специализировался в статистике или планировал стать статистиком, я …


3
Как проверить, соответствует ли мои данные экспоненциальному распределению?
Как я могу проверить, являются ли мои данные, например, зарплата непрерывным экспоненциальным распределением в R? Вот гистограмма моего образца: , Любая помощь будет оценена!

2
Почему PCA данных с помощью SVD данных?
Этот вопрос касается эффективного способа вычисления основных компонентов. Многие тексты по линейному PCA рекомендуют использовать разложение по регистру данных по сингулярным значениям . То есть, если у нас есть данные и мы хотим заменить переменные (их столбцы ) на главные компоненты, мы делаем SVD: , особые значения (квадратные корни из …

4
Метод Z-счета Стоуффера: что если мы сложим вместо ?
Я выполняю независимых статистических тестов с одинаковой нулевой гипотезой и хотел бы объединить результаты в одно значение. Кажется, что есть два «принятых» метода: метод Фишера и метод Стоуффера .NNNppp Мой вопрос о методе Стоуффера. Для каждого отдельного теста я получаю z-оценку . Под нулевой гипотезой, каждый из них распределяются со …

3
Что означает «при прочих равных» в множественной регрессии?
Когда мы делаем множественные регрессии и говорим, что смотрим на среднее изменение переменной для изменения переменной , сохраняя все остальные переменные постоянными, при каких значениях мы держим другие переменные постоянными? Их значит? Нуль? Любое значение?yyyxxx Я склонен думать, что это любой ценностью; просто ищу разъяснений. Если бы у кого-то было …

3
Преимущества использования QQ-графиков над гистограммами
В этом комментарии Ник Кокс написал: Объединение в классы - древний метод. Хотя гистограммы могут быть полезны, современное статистическое программное обеспечение позволяет легко и целесообразно адаптировать распределения к необработанным данным. Биннинг просто отбрасывает детали, которые имеют решающее значение при определении того, какие распределения правдоподобны. Контекст этого комментария предлагает использовать QQ-графики …

3
Почему используется алгоритм максимизации ожидания?
Из того, что я мало знаю, ЭМ-алгоритм может быть использован для нахождения максимальной вероятности, когда установка на ноль частных производных по параметрам вероятности дает набор уравнений, которые не могут быть решены аналитически. Но нужен ли EM-алгоритм вместо использования какой-либо численной техники, чтобы попытаться найти максимум вероятности в отношении ограничения упомянутой …

2
Следующие шаги после «Байесовского рассуждения и машинного обучения»
В настоящее время я изучаю «Байесовское рассуждение и машинное обучение» Дэвида Барбера, и это очень хорошо написанная и интересная книга для изучения основ. Так что вопрос к тому, кто уже сделал это. Какую следующую серию книг я должен пройти после того, как у меня будет достаточное знание большинства понятий в …

2
Как на самом деле работает самозагрузка в R?
Я изучал загрузочный пакет в R, и хотя я нашел несколько хороших учебников по его использованию, мне еще предстоит найти что-то, что точно описывает то, что происходит "за кулисами". Например, в этом примере руководство показывает, как использовать стандартные коэффициенты регрессии в качестве отправной точки для регрессии начальной загрузки, но не …

5
Что именно делает непараметрический тест и что вы делаете с результатами?
У меня такое чувство, что его, возможно, спросили в другом месте, но не совсем с тем типом базового описания, которое мне нужно. Я знаю, что непараметрический метод основан на медиане, а не на средстве для сравнения ... чего-то. Я также считаю, что это зависит от «степеней свободы» (?) Вместо стандартного …

5
R's randomForest не может обрабатывать более 32 уровней. Что такое обходной путь?
R-пакет randomForest не может обрабатывать фактор с более чем 32 уровнями. Когда ему дается более 32 уровней, выдается сообщение об ошибке: Не может обрабатывать категориальные предикторы с более чем 32 категориями. Но у меня есть несколько факторов. Некоторые из них имеют более 1000 уровней, а некоторые - более 100. У …

3
Для статистиков важно изучать машинное обучение?
Является ли машинное обучение важным предметом, с которым любой статистик может познакомиться? Кажется, машинное обучение - это статистика. Почему программы статистики (бакалавриат и магистратура) не требуют машинного обучения?

1
Есть ли причина предпочитать конкретную меру мультиколлинеарности?
При работе со многими входными переменными нас часто беспокоит мультиколлинеарность . Существует ряд мер мультиколлинеарности, которые используются для обнаружения, анализа и / или передачи мультиколлинеарности. Некоторые общие рекомендации: Кратный для конкретной переменной р2JрJ2R^2_j Допуск, , для конкретной переменной 1 - R2J1-рJ21-R^2_j Коэффициент инфляции дисперсии, , для конкретной переменной VIF = …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.