Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Уклон в среднем возрасте для квалификации звания гроссмейстера по возрастным группам?
Уже давно известно, что самый молодой возраст, когда шахматистам удавалось претендовать на звание гроссмейстера, значительно уменьшился с 1950-х годов, и в настоящее время почти 30 игроков стали гроссмейстерами до своего 15-летия . Однако на бирже шахматных стеков возникает вопрос: каков средний возраст, чтобы стать гроссмейстером? , Кто-то опубликовал ответ, для …

5
Какую функцию потери я должен использовать для двоичного обнаружения в обнаружении лица / не лица в CNN?
Я хочу использовать глубокое обучение для обучения двоичному обнаружению лица / лица, какую потерю я должен использовать, я думаю, что это SigmoidCrossEntropyLoss или Hinge-loss . Это правильно, но мне также интересно, должен ли я использовать softmax, но только с двумя классами?

3
Как обсудить диаграмму рассеяния с несколькими появляющимися линиями?
Мы измерили две переменные, и диаграмма рассеяния, кажется, предлагает несколько «линейных» моделей. Есть ли способ попытаться отогнать эти модели? Выявление других независимых переменных оказалось трудным. Обе переменные сильно смещены влево (в сторону небольших чисел), это ожидаемое распределение в нашей области. Интенсивность точки представляет собой количество точек данных (на масштаб) при …

1
В чем разница между AIC () и extractAIC () в R?
Документация R для обоих не проливает много света. Все, что я могу получить по этой ссылке, это то, что использование любого из них должно быть хорошо. Я не понимаю, почему они не равны. Факт: пошаговая функция регрессии в R, step()использует extractAIC(). Интересно, что запуск lm()модели и glm()«нулевой» модели (только пересечение) …

2
Подгонка множественной линейной регрессии в R: автокоррелированные невязки
Я пытаюсь оценить множественную линейную регрессию в R с помощью следующего уравнения: regr <- lm(rate ~ constant + askings + questions + 0) Задания и вопросы представляют собой квартальные временные ряды данных, построенные с помощью askings <- ts(...). Проблема в том, что я получил автокоррелированные остатки. Я знаю, что можно …

2
Является ли размер популяции параметром или размер выборки статистикой?
Определения параметра и статистики в значительной степени согласуются: параметры и статистика представляют собой числовые характеристики или числовые сводки совокупности и выборки, соответственно, для данного исследования. Я не думаю, что это обычное использование, но ... Можно ли считать численность населения NNN параметром? Можно ли считать размер выборки nnn статистикой? В конце …

2
Определение «процентиля»
Сейчас я читаю заметку по биостатистике, написанную PMT Education, и замечаю следующие предложения в разделе 2.7: Ребенок, рожденный на 50-м процентиле по массе, тяжелее, чем 50% детей. Ребенок, рожденный на 25-м процентиле по массе, тяжелее, чем 75% детей. Ребенок, родившийся на 75-м процентиле по массе, тяжелее, чем 25% детей. Но, …

1
Аппроксимация второго порядка функции потерь (Книга глубокого обучения, 7.33)
В книге Гудфеллоу (2016) о глубоком обучении он говорил об эквивалентности раннего прекращения регуляризации L2 ( https://www.deeplearningbook.org/contents/regularization.html стр. 247). Квадратичная аппроксимация функции стоимости jjj определяется как: J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) HHHf(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

3
Почему срезы, используемые для байесовских факторов и значений p, так различны?
Я пытаюсь понять Байесовский фактор (BF). Я считаю, что они как отношение правдоподобия 2 гипотез. Таким образом, если BF равен 5, это означает, что H1 в 5 раз чаще, чем H0. И значение 3-10 указывает на умеренные доказательства, в то время как> 10 указывает на убедительные доказательства. Тем не менее, …

2
Есть ли примеры нормально распределенной переменной, которая * не * обусловлена ​​центральной предельной теоремой?
Нормальное распределение кажется не интуитивным, пока вы не изучите CLT, что объясняет, почему оно так распространено в реальной жизни. Но возникает ли когда-либо как «естественное» распределение для некоторого количества?

2
Почему модели «ошибка в X» не используются более широко?
При расчете стандартной ошибки коэффициента регрессии, мы не учитываем хаотичности в конструкции матрице . Например, в OLS мы вычисляем какИксИксXвар ( β^)вар(β^)\text{var}(\hat{\beta})вар ( ( XTИкс)- 1ИксTY) = σ2( ХTИкс)- 1вар((ИксTИкс)-1ИксTY)знак равноσ2(ИксTИкс)-1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Если рассматривались случайным образом , закон общей дисперсии будет, в некотором смысле, требует дополнительного вклада дисперсии , …

2
Параметры максимального правдоподобия отклоняются от апостериорных распределений
У меня есть функция правдоподобия Л (д| θ)L(d|θ)\mathcal{L}(d | \theta) для вероятности моих данных учетом некоторых параметров модели , которые я хотел бы оценить. Принимая плоские априорные значения параметров, вероятность пропорциональна апостериорной вероятности. Я использую метод MCMC для выборки этой вероятности.dddθ ∈ RNθ∈рN\theta \in \mathbf{R}^N Глядя на полученную сходящуюся цепочку, …

2
Как байесовцы проверяют свои методы, используя методы моделирования Монте-Карло?
Справочная информация : У меня есть доктор философии по социальной психологии, где теоретическая статистика и математика были едва освещены в моей количественной курсовой работе. В старших классах и в аспирантуре меня учили (как и многие из вас, возможно, и в социальных науках), вероятно, через «классическую» систему учащегося. Теперь, я тоже …

2
Существуют ли «эзотерические» статистические тесты с очень низкой мощностью?
Фон В информатике, математике, а иногда и в других областях «эзотерические» примеры могут быть не только занимательными, но и полезными для иллюстрации некоторых понятий, например: Bogosort и Slowsort являются очень неэффективными алгоритмами сортировки, которые можно использовать для понимания свойств алгоритмов, в частности, по сравнению с другими алгоритмами сортировки. Эзотерические языки …

3
Терминология для байесовского апостериорного среднего вероятности с равномерным априором
Если Uniform и Bin , то апостериорное среднее для задается как .р ∼п~p \sim( 0 , 1 )(0,1)(0,1)Икс~Икс~X \sim( н , р )(N,п)(n, p)ппpИкс+ 1n + 2Икс+1N+2\frac{X+1}{n+2} Есть ли общее название для этой оценки? Я обнаружил, что это решает множество проблем людей, и я хотел бы иметь возможность указывать людям …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.