Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Когда мы должны дискретизировать / bin непрерывные независимые переменные / функции, а когда нет?
Когда мы должны дискретизировать / bin независимые переменные / функции, а когда нет? Мои попытки ответить на вопрос: В общем, мы не должны bin, потому что binning потеряет информацию. Биннинг на самом деле увеличивает степень свободы модели, поэтому после биннинга возможна чрезмерная подгонка. Если у нас модель «высокого смещения», биннинг …

3
Классификационные / оценочные показатели для сильно несбалансированных данных
Я имею дело с проблемой обнаружения мошенничества (кредитной оценки). Таким образом, существует очень несбалансированная связь между мошенническими и не мошенническими наблюдениями. http://blog.revolutionanalytics.com/2016/03/com_class_eval_metrics_r.html предоставляет большой обзор различных метрик классификации. Precision and Recallили kappaоба кажутся хорошим выбором: Один из способов оправдать результаты таких классификаторов - это сравнить их с результатами базовых классификаторов …

3
Что такое предварительное обучение нейронной сети?
Ну, вопрос говорит сам за себя. Что подразумевается под «предварительным обучением нейронной сети»? Может кто-нибудь объяснить на чистом простом английском? Я не могу найти какие-либо ресурсы, связанные с этим. Было бы здорово, если бы кто-то указал мне на них.

6
Вероятность - зачем умножать?
Я изучаю оценку максимального правдоподобия и читаю, что функция правдоподобия является произведением вероятностей каждой переменной. Почему это продукт? Почему не сумма? Я пытался найти в Google, но не могу найти сколько-нибудь значимых ответов. https://en.wikipedia.org/wiki/Maximum_likelihood

2
Все ли алгоритмы машинного обучения разделяют данные линейно?
Я энтузиаст программирования и машинного обучения. Всего несколько месяцев назад я начал изучать программирование машинного обучения. Как и многие люди, у которых нет количественного научного опыта, я также начал изучать ML, работая с алгоритмами и наборами данных в широко используемом пакете ML (Caret R). Некоторое время назад я прочитал блог, …

2
Каковы предположения о тесте перестановки?
Часто утверждается, что тесты перестановок не имеют никаких предположений, однако это, безусловно, не так. Например, если мои образцы как-то коррелируют, я могу представить, что перестановка их меток не будет правильной вещью. Единственное, что я обнаружил в этой проблеме, - это предложение из Википедии: «Важное предположение, стоящее за тестом перестановки, заключается …

2
Интерпретация средней абсолютной масштабированной ошибки (MASE)
Средняя абсолютная масштабированная ошибка (MASE) является мерой точности прогноза, предложенной Koehler & Hyndman (2006) . MA SЕ= МА ЕMА Ея п - ев м р л е ,н а я в еMASЕзнак равноMAЕMAЕяN-saмпLе,NaяvеMASE=\frac{MAE}{MAE_{in-sample, \, naive}} где - средняя абсолютная ошибка, произведенная фактическим прогнозом; в то время как - это средняя …

1
Почему выборочное распределение дисперсии является распределением хи-квадрат?
Заявление Распределение выборки дисперсии выборки представляет собой распределение хи-квадрат со степенью свободы, равной , где - размер выборки (учитывая, что интересующая случайная величина обычно распределена).nn−1n−1n-1nnn Источник Моя интуиция Мне это кажется интуитивно понятным: 1) потому что критерий хи-квадрат выглядит как сумма квадратов и 2) потому что распределение хи-квадрат - это …

3
интерпретация оси Y частичной зависимости графиков
Этот вопрос был перенесен из переполнения стека, потому что на него можно ответить по перекрестной проверке. Мигрировал 5 лет назад . Я читал другие темы о графиках частичной зависимости, и большинство из них касаются того, как вы на самом деле строите их с помощью разных пакетов, а не того, как …

2
Почему я получаю нулевую дисперсию случайного эффекта в моей смешанной модели, несмотря на некоторые различия в данных?
Мы запустили логистическую регрессию со смешанными эффектами, используя следующий синтаксис; # fit model fm0 <- glmer(GoalEncoding ~ 1 + Group + (1|Subject) + (1|Item), exp0, family = binomial(link="logit")) # model output summary(fm0) Предмет и Предмет - случайные эффекты. Мы получаем странный результат: коэффициент и стандартное отклонение для предметного термина равны …

5
Как разделить набор данных для прогнозирования временных рядов?
У меня есть исторические данные о продажах из пекарни (ежедневно, более 3 лет). Теперь я хочу построить модель для прогнозирования будущих продаж (используя такие функции, как день недели, переменные погоды и т. Д.). Как я должен разделить набор данных для подбора и оценки моделей? Должен ли он быть хронологическим составом …

3
Почему максимальная вероятность, а не ожидаемая вероятность?
Почему так часто получают оценки максимального правдоподобия параметров, но вы практически никогда не слышали об ожидаемых оценках параметров правдоподобия (т. Е. На основе ожидаемого значения, а не режима функции правдоподобия)? Это в первую очередь по историческим причинам или по более предметным техническим или теоретическим причинам? Будут ли существенные преимущества и …

5
Как контролировать предварительные анализы больших наборов данных?
Когда я начинаю исследовательский анализ большого набора данных (много выборок, много переменных), я часто оказываюсь с сотнями производных переменных и тоннами разных графиков, и у меня нет реального способа отслеживать, что и где происходит. Код заканчивается как спагетти, потому что нет направления с самого начала ... Существуют ли рекомендуемые методы …

4
Является ли ЛСД Фишера таким плохим, как они говорят?
Когда мы проводим эксперименты (на небольших размерах выборки (обычно размер выборки на группу лечения составляет около 7-8)) в двух группах, мы используем t-критерий для проверки на разницу. Однако, когда мы выполняем ANOVA (очевидно, для более чем двух групп), мы используем что-то вроде Bonferroni (LSD / # парных сравнений) или Tukey …

3
Как неправильный априор может привести к правильному заднему распределению?
Мы знаем, что в случае правильного предварительного распределения, P(θ∣X)=P(X∣θ)P(θ)P(X)P(θ∣X)=P(X∣θ)P(θ)P(X)P(\theta \mid X) = \dfrac{P(X \mid \theta)P(\theta)}{P(X)} ∝P(X∣θ)P(θ)∝P(X∣θ)P(θ) \propto P(X \mid \theta)P(\theta) . Обычное обоснование этого шага состоит в том, что предельное распределение XXX , P(X)P(X)P(X) , является постоянным по отношению к θθ\theta и, таким образом, может быть проигнорировано при получении апостериорного …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.