Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Надежная оценка куртоза?
Я использую обычный оценщик для , но я заметилчто даже небольшие «выбросы» в моем эмпирическом распределении, то есть небольшие пики далеко от центра, влияютего чрезвычайно. Существует ли более надежная оценка эксцесса?K^=μ^4σ^4K^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

1
В чем разница между «нагрузками» и «корреляционными нагрузками» в PCA и PLS?
При анализе основных компонентов (PCA) обычно нужно распределить две нагрузки друг на друга, чтобы исследовать отношения между переменными. В документе, сопровождающем пакет PLS R для выполнения регрессии главных компонентов и регрессии PLS, есть другой график, называемый графиком корреляционных нагрузок (см. Рисунок 7 и страницу 15 в документе). Корреляция нагрузки , …

3
Каковы проблемы с использованием процентного результата в линейной регрессии?
У меня есть исследование, в котором многие результаты представлены в виде процентов, и я использую множественные линейные регрессии, чтобы оценить влияние некоторых категориальных переменных на эти результаты. Мне было интересно, поскольку линейная регрессия предполагает, что результатом является непрерывное распределение, существуют ли методологические проблемы в применении такой модели к процентам, которые …

1
Примеры неправильного применения теоремы Байеса
Этот вопрос сообщества Math Overflow, заданный для «примеров плохих аргументов, которые включают применение математических теорем в нематематическом контексте», привел к захватывающему списку патологически прикладной математики. Я задаюсь вопросом о подобных примерах патологического использования байесовского вывода. Кто-нибудь сталкивался с научными статьями, эксцентричными постами в блогах, которые используют байесовские методы, причудливо.
11 bayesian 

2
Что это все о машинном обучении в реальной практике?
Я новичок в машинном обучении (также немного статистики), некоторое время изучал знания (алгоритмы обучения под наблюдением / без присмотра, соответствующие методы оптимизации, регуляризации, некоторые философии (такие как компромисс отклонения?)). Я знаю, что без какой-либо реальной практики я не смог бы получить глубокое понимание этих вещей машинного обучения. Поэтому я начну …

1
Установленные значения модели ARMA
Я пытаюсь понять, как подбираются значения для моделей ARMA (p, q). Я уже нашел здесь вопрос, касающийся подгоночных значений процессов ARMA, но не смог понять этого. Если у меня есть модель ARMA (1,1), т.е. ИксT= α1Икст - 1+ ϵT- β1εт - 1Xt=α1Xt−1+ϵt−β1ϵt−1X_t = \alpha_1X_{t-1}+\epsilon_t - \beta_1 \epsilon_{t-1} и мне дан …
11 arma 

2
Модель случайного пересечения против GEE
Рассмотрим линейную модель со случайным перехватом. Это эквивалентно линейной регрессии GEE с заменяемой рабочей корреляционной матрицей. Предположим, что предикторами являются и а коэффициентами для этих предикторов являются , и . Какова интерпретация коэффициентов в модели случайного пересечения? Это то же самое, что линейная регрессия GEE, за исключением того, что она …

3
Функция передачи вмешательства ARIMA - как визуализировать эффект
У меня есть месячные временные ряды с вмешательством, и я хотел бы количественно оценить влияние этого вмешательства на результат. Я понимаю, что серия довольно короткая, и эффект еще не завершен. Данные cds <- structure(c(2580L, 2263L, 3679L, 3461L, 3645L, 3716L, 3955L, 3362L, 2637L, 2524L, 2084L, 2031L, 2256L, 2401L, 3253L, 2881L, 2555L, …

3
Будущее статистики
Этот вопрос возник у меня, когда я читал публичную лекцию по нерешенным вопросам математики. Хорошо известно, что есть еще много нерешенных математических вопросов. Это заставило меня задуматься о том, каковы нерешенные проблемы в статистике. Потратив некоторое время на поиск этой темы, я не думаю, что по этому вопросу было проведено …

1
Что если вероятности не равны в «.632 Правиле»?
Этот вопрос вытекает из вопроса о «.632 Правиле». Я пишу с особым вниманием к ответу / примечанию пользователя 603 в той степени, в которой это упрощает вопросы. Этот ответ начинается с выборки размера с заменой из различных элементов в коллекции (вызов) it N. Вероятность того, что выборка отличается от конкретного …

1
Выборка Гиббса для модели Изинга
Домашнее задание: Рассмотрим 1-ую модель Изинга. Пусть . это либо -1, либо +1x=(x1,...xd)x=(x1,...xd)x = (x_1,...x_d)xixix_i π(x)∝e∑39i=1xixi+1π(x)∝e∑i=139xixi+1\pi(x) \propto e^{\sum_{i=1}^{39}x_ix_{i+1}} Разработайте алгоритм выборки Гиббса, чтобы генерировать выборки приблизительно из целевого распределения .π(x)π(x)\pi(x) Моя попытка: Произвольно выбирайте значения (либо -1, либо 1), чтобы заполнить вектор . Так что, возможно, . Так что это …

1
Как инструментальные переменные решают проблему смещения выбора?
Мне интересно, как инструментальная переменная решает проблему смещения выбора в регрессии. Вот пример, который я пережевываю: В « Эконометрии в основном безвредных» авторы обсуждают регрессию IV, касающуюся военной службы и доходов в более позднем возрасте. Вопрос в том, увеличивает ли служба в армии или уменьшает будущую прибыль? Они исследуют этот …

1
Проверка, существенно ли отличаются два коэффициента регрессии (в идеале R)
Если это дублирующий вопрос, пожалуйста, укажите правильный путь, но похожие вопросы, которые я нашел здесь, не были достаточно похожими. Предположим, я оцениваю модельY= α + βИкс+ тыY=α+βX+uY=\alpha + \beta X + u и найдите, что . Однако оказывается, что , и я подозреваю, что , и, в частности, что . …

1
Всегда ли среднее значение и дисперсия существуют для экспоненциальных распределений семей?
Предположим, что скалярная случайная величина принадлежит семейству вектор-параметров с pdfXXX fX(x|θ)=h(x)exp(∑i=1sηi(θ)Ti(x)−A(θ))fX(x|θ)=h(x)exp⁡(∑i=1sηi(θ)Ti(x)−A(θ)) f_X(x|\boldsymbol \theta) = h(x) \exp\left(\sum_{i=1}^s \eta_i({\boldsymbol \theta}) T_i(x) - A({\boldsymbol \theta}) \right) где θ = ( θ1, θ2, ⋯ , θs)Tθ=(θ1,θ2,⋯,θs)T{\boldsymbol \theta} = \left(\theta_1, \theta_2, \cdots, \theta_s \right )^T - вектор параметров, а Т (х)= ( Т1( х ) …

2
Проверка веб-тестов a / b путем повторного запуска эксперимента - это действительно ли так?
На вебинаре, проведенном на днях компанией по тестированию a / b, их резидент «Data Scientist» объяснил, что вам следует проверить свои результаты, повторно выполнив эксперимент. Исходя из этого, если вы выбрали 95% достоверности, существует вероятность 5% (1/20) ложного срабатывания. Если вы повторно запустите свой эксперимент с теми же ограничениями, то …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.