Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Моделирование автокоррелированных двоичных временных рядов
Каков обычный подход к моделированию двоичных временных рядов? Есть ли бумага или учебник, где это лечится? Я думаю о бинарном процессе с сильной автокорреляцией. Что-то вроде знака процесса AR (1), начинающегося с нуля. Скажем, Икс0= 0X0=0X_0 = 0 и Икст + 1= β1ИксT+ ϵT,Xt+1=β1Xt+ϵt, X_{t+1} = \beta_1 X_t + \epsilon_t, …

3
D Коэна для t-теста зависимого образца
Быстрый вопрос: я видел, как d Коэна вычислил два разных способа для t-теста зависимых образцов (например, в рамках дизайна выборки, проверяющего эффективность лекарства с до / после времени). Используя стандартное отклонение оценки изменения в знаменателе уравнения для Коэна d. Используя стандартное отклонение оценки перед тестом в знаменателе уравнения Коэна d. …

3
В CLT почему ?
Пусть - независимые наблюдения из распределения со средним значением и дисперсией , когда , тоX1,...,XnX1,...,XnX_1,...,X_nμμ\muσ2&lt;∞σ2&lt;∞\sigma^2 < \inftyn→∞n→∞n \rightarrow \infty n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). Почему это означает, что X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

3
Какую модель регрессии лучше всего использовать с данными подсчета?
Я пытаюсь немного заняться статистикой, но я застрял в чем-то. Мои данные следующие: Year Number_of_genes 1990 1 1991 1 1993 3 1995 4 Теперь я хочу построить регрессионную модель, чтобы на основе данных можно было прогнозировать количество генов за любой данный год. До сих пор я делал это с помощью …

1
Предотвращение сбоя выборки по важности по Парето (PSIS-LOO)
Недавно я начал использовать перекрестную проверку сглаживания важности по Парето (PSIS-LOO), описанную в следующих статьях: Vehtari, A. &amp; Gelman, A. (2015). Парето сгладил важность выборки. Препринт arXiv ( ссылка ). Вехтари А., Гельман А. и Габри Дж. (2016). Практическая оценка байесовской модели с использованием кросс-проверки без участия и WAIC. Препринт …

3
Примеры использования RBF SVM (против логистической регрессии и случайного леса)
Машины опорных векторов с ядром радиально-базовой функции - это универсальный контролируемый классификатор. Хотя я знаю теоретические основы этих SVM и их сильные стороны, я не знаю случаев, когда они являются предпочтительным методом. Итак, существует ли класс проблем, для которых SVM RBF превосходят другие методы ML? (Либо с точки зрения оценки, …

1
Является ли когда-нибудь хорошей идеей дать «частичный кредит» (непрерывный результат) в обучении логистической регрессии?
Я тренирую логистическую регрессию, чтобы предсказать, какие бегуны, скорее всего, закончат изнурительную гонку на выносливость. Очень немногие бегуны заканчивают эту гонку, поэтому у меня серьезный дисбаланс классов и небольшой пример успеха (возможно, несколько десятков). Я чувствую, что могу получить хороший «сигнал» от десятков бегунов, которые почти сделали это. (Мои тренировочные …

2
Почему ошибки типа II не особо подчеркиваются в статистической литературе?
Я видел много случаев, когда ошибки типа I учитываются (обозначаются как альфа-значение) в различных исследовательских статьях. Я редко обнаруживал, что исследователь принимает во внимание силу или ошибку типа II. Ошибки типа II могут иметь большое значение, верно? Мы случайно отвергли альтернативную гипотезу, когда она фактически была ложной. Почему альфа-значения подчеркиваются …

3
Тест ассоциации для нормально распределенного DV по направленным независимым переменным?
Существует ли проверка гипотезы о том, связана ли нормально-распределенная зависимая переменная с направленно-распределенной переменной? Например, если пояснительная переменная является временем суток (и если предположить, что такие вещи, как день недели, месяц года и т. Д. Не имеют значения), - это то, как следует учитывать тот факт, что в 11 часов …

2
Почему Рао-Blackwell теорема требует
Теорема Рао-Блэквелла утверждает Пусть θ быть оценкой &amp; thetas с E ( θ 2 ) &lt; ∞ для всех &amp; thetas . Предположим , что Т является достаточным для &amp; thetas , и пусть &amp; thetas * = E ( &amp; thetas | T ) Тогда для всех &amp; thetas …

5
Объясняя среднее, медиану, моду в терминах непрофессионала
Как бы вы объяснили понятие среднего, медианы и формы списка чисел и почему они важны для человека, обладающего только базовыми арифметическими навыками? Не будем упоминать асимметрию, CLT, центральную тенденцию, их статистические свойства и т. Д. Я объяснил кому-то, что это просто быстрый и грязный способ «суммировать» список чисел. Но, оглядываясь …

3
Следует ли рассматривать дельта-функцию Дирака как подкласс гауссовского распределения?
В Викиданных можно связать распределения вероятностей (как и все остальное) в онтологии, например, что t-распределение является подклассом нецентрального t-распределения, см., Например, https://angryloki.github.io/wikidata-graph-builder/?property=P279&amp;item=Q209675&amp;iterations=3&amp;limit=3 Существуют различные предельные случаи, например, когда степени свободы в t-распределении переходят в бесконечность или когда дисперсия приближается к нулю для нормального распределения (распределение Гаусса). В последнем случае распределение …

2
Как называется этот тип графика с центрированными горизонтальными столбцами плотности?
Как бы вы назвали этот тип сюжета, и возможно ли его создать в R? РЕДАКТИРОВАТЬ: большое спасибо всем - очень полезно. Лучший титул на данный момент: квантовые сюжеты для скрипки!

3
Каким должен быть неинформативный априор для склона при выполнении линейной регрессии?
При выполнении байесовской линейной регрессии необходимо назначить априор для наклона и точки пересечения . Поскольку является параметром местоположения, имеет смысл назначить унифицированный априор; однако, мне кажется, что сродни параметру масштаба, и кажется неестественным назначать униформу до него.aaaббbббbaaa С другой стороны, не совсем правильно назначать обычный неинформативный арифметический арифметический априор ( …

3
Особенности ранжирования в логистической регрессии
Я использовал логистическую регрессию. У меня есть шесть функций, я хочу знать важные функции в этом классификаторе, которые влияют на результат больше, чем другие функции. Я использовал информационное усиление, но, похоже, оно не зависит от используемого классификатора. Есть ли способ ранжировать объекты в соответствии с их важностью на основе конкретного …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.