Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Является ли второй параметр для нормального распределения отклонением или стандартным отклонением?
Иногда я видел в учебниках второй параметр нормального распределения, который называется стандартным отклонением и дисперсией. Например, случайная величина X ~ N (0, 4). Не ясно, равно ли сигма или сигма в квадрате 4. Я просто хочу выяснить общее соглашение, которое используется, когда стандартное отклонение или дисперсия не определены.

1
Классификатор против модели против оценки
В чем разница между классификатором, моделью и оценщиком? Из того, что я могу сказать: оценка - это предиктор, найденный по алгоритму регрессии классификатор - это предиктор, найденный из алгоритма классификации модель может быть как оценщиком, так и классификатором Но, глядя в онлайн, кажется, что я могу смешать эти определения. Итак, …

2
Почему предельное распределение / предельная вероятность описываются как «предельное»?
Маргинал обычно относится к чему-то, что является небольшим эффектом, что-то, что находится за пределами большей системы. Это имеет тенденцию уменьшать важность того, что описывается как «маргинальный». Так как же это относится к вероятности подмножества случайных величин? Предполагая, что слова используются из-за их значения, это может быть рискованным суждением в математике, …

2
Почему усадка действительно работает, что такого особенного в 0?
На этом сайте уже есть пост, посвященный той же проблеме: почему работает усадка? Но, хотя ответы и популярны, я не верю, что суть вопроса действительно решена. Совершенно очевидно, что введение некоторого смещения в оценку приводит к снижению дисперсии и может улучшить качество оценки. Тем не мение: 1) Почему ущерб, нанесенный …

2
Рекурсивное обновление MLE как нового потока наблюдений в
Общий вопрос Скажем, у нас есть потоковые данные , , ... . Мы хотим рекурсивно вычислить оценку максимального правдоподобия \ boldsymbol {\ theta} . То есть, вычислив \ hat {\ boldsymbol {\ theta}} _ {n-1} = \ underset {\ boldsymbol {\ theta} \ in \ mathbb {R} ^ p} {\ …

2
Какое распределение использовать для моделирования времени до прибытия поезда?
Я пытаюсь смоделировать некоторые данные о времени прибытия поезда. Я хотел бы использовать дистрибутив, который фиксирует «чем дольше я жду, тем больше вероятность того, что поезд появится» . Похоже, что такой дистрибутив должен выглядеть как CDF, так что P (Train Train Up | Ожидал 60 минут) близко к 1. Какой …

7
Какая кривая (или модель) должна соответствовать моим процентным данным?
Я пытаюсь создать фигуру, которая показывает связь между вирусными копиями и освещением генома (GCC). Вот как выглядят мои данные: Сначала я только построил линейную регрессию, но мои руководители сказали мне, что это неправильно, и попробовал сигмоидальную кривую. Поэтому я сделал это с помощью geom_smooth: library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y …

2
Являются ли тесты на избыточную дисперсию в GLM действительно * полезными *?
Феномен «чрезмерной дисперсии» в GLM возникает всякий раз, когда мы используем модель, которая ограничивает дисперсию переменной отклика, и данные демонстрируют большую дисперсию, чем позволяет ограничение модели. Это обычно происходит при моделировании данных подсчета с использованием Poisson GLM, и это можно диагностировать с помощью хорошо известных тестов. Если тесты показывают, что …

3
Каковы преимущества линейной регрессии над квантильной регрессией?
Модель линейной регрессии делает кучу предположений, что квантильная регрессия не делает, и, если предположения о линейной регрессии соблюдаются, то моя интуиция (и некоторый очень ограниченный опыт) состоит в том, что срединная регрессия даст почти идентичные результаты как линейная регрессия. Итак, какие преимущества имеет линейная регрессия? Это конечно более знакомо, но …

1
Является ли сумма двух деревьев решений эквивалентной одному дереву решений?
Предположим, у нас есть два дерева регрессии (дерево A и дерево B), которые отображают входные данные на выходные данные . Пусть \ hat {y} = f_A (x) для дерева A и f_B (x) для дерева B. Каждое дерево использует двоичные разбиения с гиперплоскостями в качестве разделяющих функций.x∈Rdx∈Rdx \in \mathbb{R}^dy^∈Ry^∈R\hat{y} \in …

2
Каковы некоторые важные применения генерации случайных чисел в вычислительной статистике?
Как и почему генераторы случайных чисел (ГСЧ) важны в вычислительной статистике? Я понимаю, что случайность важна при выборе выборок для многих статистических тестов, чтобы избежать смещения в отношении любой гипотезы, но есть ли другие области вычислительной статистики, где важны генераторы случайных чисел?

5
Почему
Я полагаю, что п( A | B ) = P( A | B , C) ∗ P( C) + P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) правильно, тогда как п( A | B ) = P( A | B , C) + P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = …

2
Интуиция об оценке параметров в смешанных моделях (параметры дисперсии и условные режимы)
Я много раз читал, что случайные эффекты (BLUP / условные режимы, скажем, для субъектов) не являются параметрами линейной модели смешанных эффектов, а вместо этого могут быть получены из оценочных параметров дисперсии / ковариации. Например, Reinhold Kliegl et al. (2011) состояние: Случайные эффекты - это отклонения испытуемых от среднего значения RT …

3
Когда неуместно контролировать переменную?
Я могу вспомнить хотя бы один наивный пример. Предположим, я хочу изучить отношения между X и Z. Я также подозреваю, что Y влияет на Z, поэтому я контролирую Y. Однако, как выясняется, без ведома меня X вызывает Y, а Y вызывает Z. Поэтому, контролируя для Y я «скрываю» отношения между …

3
Использование glm () вместо простого теста хи-квадрат
Я заинтересован в изменении нулевых гипотез, используя glm()в R. Например: x = rbinom(100, 1, .7) summary(glm(x ~ 1, family = "binomial")) проверяет гипотезу, что . Что если я захочу изменить значение null на = какое-то произвольное значение внутри ? рр = 0,5пзнак равно0,5p = 0.5ппpglm() Я знаю, что это можно …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.