Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Примеры статистики, которая не зависит от распределения выборки?
Это определение для статистики в Википедии Более формально, статистическая теория определяет статистику как функцию выборки, где сама функция не зависит от распределения выборки; то есть функция может быть задана до реализации данных. Термин статистика используется как для функции, так и для значения функции в данном образце. Я думаю, что понимаю …

2
Могу ли я использовать моменты распространения для выборки распределения?
Я замечаю в статистике / методах машинного обучения, распределение часто аппроксимируется гауссианом, а затем этот гауссиан используется для выборки. Они начинают с вычисления первых двух моментов распределения и используют их для оценки μμ\mu и σ2σ2\sigma^2 . Затем они могут выбрать из этого гауссиана. Мне кажется, чем больше моментов я вычисляю, …

5
Как вычислить, имеет ли моя линейная регрессия статистически значимое отличие от известной теоретической линии?
У меня есть некоторые данные, которые соответствуют примерно линейной линии: Когда я делаю линейную регрессию этих значений, я получаю линейное уравнение: Y= 0,997 х - 0,0136Yзнак равно0,997Икс-0,0136y = 0.997x-0.0136 В идеальном мире уравнение должно быть .Y= хYзнак равноИксy = x Ясно, что мои линейные значения близки к этому идеалу, но …

2
Почему Симпсоны (телесериалы) так явно преуспели в «предсказании» будущего? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . В желтой и не очень желтой прессе широко комментировалось, что Симпсоны (сериал) неоднократно предсказывали будущее. Обширные онлайн статьи об …

2
Является ли распределение Коши «непредсказуемым»?
Является ли распределение Коши «непредсказуемым»? Я пытался делать cs <- function(n) { return(rcauchy(n,0,1)) } в R для множества n значений и заметил, что они время от времени генерируют довольно непредсказуемые значения. Сравните это, например, с as <- function(n) { return(rnorm(n,0,1)) } который всегда, кажется, дает «компактное» облако точек. По этой …

3
Если
Вопрос Если являются IID, то вычислите , где .X1,⋯,Xn∼N(μ,1)X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1)E(X1∣T)E(X1∣T)\mathbb{E}\left( X_1 \mid T \right)T=∑iXiT=∑iXiT = \sum_i X_i Попытка : пожалуйста, проверьте правильность приведенного ниже. Пусть говорят, мы возьмем сумму этих условных ожиданий такое , что ∑iE(Xi∣T)=E(∑iXi∣T)=T.∑iE(Xi∣T)=E(∑iXi∣T)=T.\begin{align} \sum_i \mathbb{E}\left( X_i \mid T \right) = \mathbb{E}\left( \sum_i X_i \mid T …

6
Более важная статистика: «выжили 90% всех женщин» или «90% всех выживших были женщинами»?
Рассмотрим следующие утверждения в отношении Титаника: Предположение 1: Только мужчины и женщины были на корабле Предположение 2: было большое количество мужчин и женщин Утверждение 1: 90 процентов всех женщин выжили Утверждение 2: 90 процентов всех, кто выжил, были женщины Первое указывает на то, что спасение женщин, вероятно, было приоритетом (независимо …

1
Глубина дерева решений
Поскольку алгоритм дерева решений разделяется на атрибут на каждом шаге, максимальная глубина дерева решений равна количеству атрибутов данных. Это верно?

1
Какие алгоритмы упаковки являются достойными преемниками Random Forest?
Я бы сказал, что для повышения алгоритмов они развивались довольно хорошо. В начале 1995 года был представлен AdaBoost, затем через некоторое время это была Gradient Boosting Machine (GBM). Недавно, около 2015 года, был представлен XGBoost, который точен, справляется с переоснащением и стал победителем нескольких соревнований Kaggle. В 2017 году Microsoft …

3
Консультации по сотрудничеству с прикладными учеными
Я аспирант в области статистики и, таким образом, участвую в нескольких совместных исследованиях с прикладными учеными (экономистами, лесниками,…). Это совместная работа (в большинстве случаев), и я многому учусь, но есть и некоторые сложности, например: Иногда мое мнение о том, что такое хорошая статистическая модель, отличается от опыта моих сотрудников и …
14 references 

4
Прогнозирующие модели: статистика не может превзойти машинное обучение? [закрыто]
Закрыто . Этот вопрос должен быть более сфокусированным . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он был сосредоточен только на одной проблеме, отредактировав этот пост . Закрыто 2 года назад . В настоящее время я слежу за магистерской программой, ориентированной на статистику …

6
Проницательный об активном / пассивном использовании «коррелированных»
Я сомневаюсь, стоит ли спрашивать об этом здесь в статистике StackExchange или в лингвистическом / английском, но я считаю, что здесь может быть больше пользователей, придирчивых к языку, чем пользователей, разбирающихся в статистике, на другом форуме;) Я часто читаю сообщения, в которых упоминается корреляция как глагол в активном голосе, как …

1
Гамильтониан Монте-Карло для чайников
Не могли бы вы дать пошаговое объяснение манекенам, как работает гамильтониан Монте-Карло? PS: я уже читал ответы здесь, гамильтониан Монте-Карло , и здесь, гамильтониан Монте-Карло против последовательного Монте-Карло , и здесь, гамильтониан Монте-Карло: как понять предложение Метрополиса-Гастинга? и они не обращаются к этому поэтапно.
14 bayesian  hmc 

1
Почему мы не используем непостоянную скорость обучения для градиента, приличного для вещей, отличных от нейронных сетей?
Глубокая учебная литература полна умных трюков с использованием непостоянных скоростей обучения при градиентном спуске. Такие вещи, как экспоненциальный распад, RMSprop, Adagrad и т. Д., Легко реализовать и они доступны в каждом пакете глубокого обучения, но, похоже, их не существует за пределами нейронных сетей. Есть ли причина для этого? Если людям …

3
Может ли трехмерное совместное распределение быть реконструировано по 2D маргиналам?
Предположим, что мы знаем p (x, y), p (x, z) и p (y, z). Верно ли, что совместное распределение p (x, y, z) идентифицируемо? То есть есть только один возможный p (x, y, z), который имеет выше маргиналов?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.