Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Насколько устойчив коэффициент корреляции Пирсона к нарушениям нормальности?
Данные по определенным переменным типам имеют тенденцию быть ненормальными при измерении в определенных группах населения (например, уровни депрессии в группе людей с серьезным депрессивным расстройством). Учитывая, что Пирсона предполагает нормальность, насколько надежна статистика теста в условиях ненормальности? У меня есть ряд переменных, для которых я хотел бы получить коэффициенты корреляции, …

3
Как интерпретировать коэффициенты регрессии, когда ответ был преобразован 4-м корнем?
Я использую четвертое 1/4преобразование степени root ( ) в моей переменной ответа в результате гетероскедастичности. Но сейчас я не знаю, как интерпретировать мои коэффициенты регрессии. Я предполагаю, что мне понадобится взять коэффициенты до четвертой степени при обратном преобразовании (см. Ниже результат регрессии). Все переменные выражены в долларах в миллионах, но …

3
Элементарная статистика для присяжных
Меня вызвали на должность присяжного. Я осознаю актуальность статистики для некоторых судебных процессов присяжных. Например, понятие «базовая ставка» и ее применение к расчетам вероятности иногда - возможно, всегда - актуально. Какие статистические темы мог бы полезно изучить человек в моей ситуации, и какие материалы подойдут кому-то из моих специалистов? У …

2
Как я могу объединить апостериорные средства и достоверные интервалы после многократного вменения?
Я использовал множественное вменение для получения ряда завершенных наборов данных. Я использовал байесовские методы на каждом из законченных наборов данных, чтобы получить апостериорные распределения для параметра (случайный эффект). Как я могу объединить / объединить результаты для этого параметра? Больше контекста: Моя модель является иерархической в ​​смысле отдельных учеников (одно наблюдение …

3
Я получаю «скачкообразные» нагрузки в Rollapply PCA в R. Могу ли я это исправить?
У меня есть 10-дневные данные ежедневных возвратов по 28 различным валютам. Я хотел бы извлечь первый основной компонент, но вместо того, чтобы использовать PCA в течение всех 10 лет, я хочу перенести двухлетнее окно, потому что поведение валют меняется, и поэтому я хочу это отразить. Однако у меня есть серьезная …
20 r  pca 

6
PCA негауссовых данных
У меня есть пара быстрых вопросов о PCA: Предполагает ли PCA, что набор данных является гауссовским? Что происходит, когда я применяю PCA к нелинейным данным? Учитывая набор данных, процесс должен сначала нормализовать среднее значение, установить дисперсию 1, взять SVD, уменьшить ранг и, наконец, отобразить набор данных в новое пространство с …
20 pca  svd 

4
Работа с 0,1 значениями в бета-регрессии
У меня есть некоторые данные в [0,1], которые я хотел бы проанализировать с помощью бета-регрессии. Конечно, что-то нужно сделать, чтобы приспособить значения 0,1. Мне не нравится изменять данные, чтобы соответствовать модели. Кроме того, я не верю, что нулевая и 1 инфляция - это хорошая идея, потому что я считаю, что …

2
Моделирование временных рядов с учетом мощности и кросс-спектральных плотностей
У меня возникают проблемы при создании набора стационарных цветных временных рядов, учитывая их ковариационную матрицу (их спектральные плотности мощности (PSD) и спектральные плотности перекрестных мощностей (CSD)). Я знаю, что, учитывая два временных ряда и , я могу оценить их спектральные плотности мощности (PSD) и кросс-спектральные плотности (CSD), используя многие широко …

1
Вычисление интервалов прогнозирования для логистической регрессии
Я хотел бы понять, как генерировать интервалы прогнозирования для оценок логистической регрессии. Мне посоветовали следовать процедурам в Моделирующих двоичных данных Коллетта , 2-е издание, с.98-99. После реализации этой процедуры и сравнения ее с R predict.glm, я на самом деле думаю, что в этой книге показана процедура вычисления доверительных интервалов , …

6
«Полностью байесовский» против «байесовский»
Я изучал байесовскую статистику и часто читал в статьях «Мы принимаем байесовский подход» или что-то подобное. Я также заметил, реже: «Мы принимаем полностью байесовский подход» (мой акцент). Есть ли разница между этими подходами в каком-либо практическом или теоретическом смысле? FWIW, я использую пакет MCMCglmmв R на случай, если это уместно.
20 bayesian 

6
Изменение масштаба переменной на 0-100
Я построил индекс социального капитала с использованием методики PCA. Этот индекс содержит значения как положительные, так и отрицательные. Я хочу преобразовать / преобразовать этот индекс в масштаб 0-100, чтобы его было легко интерпретировать. Пожалуйста, предложите мне самый простой способ сделать это.

1
Ошибка в нормальном приближении к равномерному распределению суммы
Один наивный метод для аппроксимации нормального распределения состоит в том, чтобы сложить, возможно, 100100100 случайных величин IID, равномерно распределенных по [0,1][0,1][0,1] , затем пересчитать их и изменить масштаб, полагаясь на Центральную предельную теорему. ( Примечание : существуют более точные методы, такие как преобразование Бокса – Мюллера .) Сумма IID U(0,1)U(0,1)U(0,1)случайных …

2
Перекрестная проверка и эмпирический байесовский метод оценки гиперпараметров
Учитывая иерархическую модель , я хочу двухэтапный процесс, чтобы соответствовать модели. Сначала исправьте несколько гиперпараметров , а затем сделайте байесовский вывод по остальным параметрам . Для фиксации гиперпараметров я рассматриваю два варианта.θ ϕp ( x | ϕ , θ )п(Икс|φ,θ)p(x|\phi,\theta)θθ\thetaφφ\phi Используйте эмпирический байесовский анализ (EB) и максимизируйте предельное правдоподобие (объединяя …

1
Доверительный интервал вокруг соотношения двух пропорций
У меня есть две пропорции (например, рейтинг кликов (CTR) по ссылке в макете элемента управления и CTR по ссылке в экспериментальном макете), и я хочу рассчитать 95% доверительный интервал для отношения этих пропорций. Как мне это сделать? Я знаю, что могу использовать дельта-метод для расчета дисперсии этого отношения, но я …

2
AdaBoost менее или более склонен к переоснащению?
Я читал различные (казалось бы) противоречивые утверждения, независимо от того, являются ли AdaBoost (или другие методы повышения) менее или более склонными к переобучению по сравнению с другими методами обучения. Есть ли веские причины верить тому или иному? Если это зависит, от чего это зависит? По каким причинам AdaBoost менее / …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.