Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Сглаживание - когда его использовать, а когда нет?
В блоге Уильяма Бриггса есть довольно старая запись, в которой рассматриваются подводные камни сглаживания данных и передачи сглаженных данных в анализ. Ключевой аргумент, а именно: Если в момент безумия вы сглаживаете данные временных рядов и используете их в качестве входных данных для других анализов, вы резко увеличиваете вероятность одурачить себя! …

5
Какая хорошая книга о философии байесовского мышления?
Какая хорошая книга о байесовской философии, противопоставляющая субъективистов против объективистов, объясняющая представление о вероятности как состоянии знаний в байесовской статистике и т. Д.? Может быть, книга Сэвиджа? Сначала я думал, что Бергер (1986) может работать, но это не то, что я ищу. Поиск такой книги не совсем приводит к результатам, …

3
Почему статистика разрыва для k-средних предполагает один кластер, хотя, очевидно, их два?
Я использую K-средства для кластеризации своих данных и искал способ предложить «оптимальный» номер кластера. Статистика зазоров, кажется, является распространенным способом найти хороший номер кластера. По некоторым причинам он возвращает 1 в качестве оптимального номера кластера, но когда я смотрю на данные, становится очевидно, что есть 2 кластера: Вот как я …

2
P-значение в тесте с двумя хвостами с асимметричным нулевым распределением
Моя ситуация такова: я хочу с помощью исследования Монте-Карло сравнить значения двух разных тестов для статистической значимости оцениваемого параметра (ноль - «нет эффекта - параметр равен нулю», а подразумеваемая альтернатива - « параметр не ноль "). Тест A является стандартным «независимым t-тестом на равенство средних для двух выборок» с равными …

1
Расположение стрелок на биплоте PCA
Я ищу, чтобы реализовать биплот для анализа основных компонентов (PCA) в JavaScript. Мой вопрос, как мне определить координаты стрелок из выходных данных сингулярного векторного разложения (SVD) матрицы данных?U,V,DU,В,DU,V,D Вот пример биплота R: biplot(prcomp(iris[,1:4])) Я попытался найти его в статье в Википедии о биплоте, но это не очень полезно. Или правильно. …
18 pca  svd  biplot 

2
Распределение максимума двух коррелированных нормальных переменных
Скажем, у меня есть две стандартные нормальные случайные величины X1X1X_1 и X2X2X_2 , которые совместно нормальны с коэффициентом корреляции rrr . Какова функция распределения ?max(X1,X2)max(X1,X2)\max(X_1, X_2)

1
Что означает «зависимый» и «независимый» тесты в литературе по множественным сравнениям?
В литературе как по частоте появления ошибок (FWER), так и по частоте ложных обнаружений (FDR) конкретные методы контроля FWER или FDR считаются подходящими для зависимых или независимых тестов. Например, в статье 1979 года «Простая последовательная объективная процедура множественных испытаний» Холм писал, чтобы противопоставить свой метод повышения Шидака и метод контроля …

3
О точном тесте Фишера: какой тест был бы уместен, если бы женщина не знала количество чашек с молоком?
В известном эксперименте с дегустацией чая, проведенном РА Фишер, женщине сообщают, сколько существует чашек для молока / чая (4 на каждую из 8 чашек). Это учитывает фиксированное предельное общее предположение точного критерия Фишера. Я представлял себе этот тест с моим другом, но мысль поразила меня. Если женщина действительно может определить …

2
Скрытая марковская модель против модели перехода Маркова против модели состояния пространства…?
Для моей магистерской работы я работаю над разработкой статистической модели для переходов между различными состояниями, определяемыми серологическим статусом. Пока я не буду вдаваться в подробности этого контекста, так как мой вопрос носит более общий / теоретический характер. Во всяком случае, моя интуиция заключается в том, что я должен использовать скрытую …

1
Использование начальной загрузки под H0 для проведения теста на разницу двух средств: замена в группах или в объединенном образце
Предположим, у меня есть данные с двумя независимыми группами: g1.lengths <- c (112.64, 97.10, 84.18, 106.96, 98.42, 101.66) g2.lengths <- c (84.44, 82.10, 83.26, 81.02, 81.86, 86.80, 85.84, 97.08, 79.64, 83.32, 91.04, 85.92, 73.52, 85.58, 97.70, 89.72, 88.92, 103.72, 105.02, 99.48, 89.50, 81.74) group = rep (c ("g1", "g2"), c …

6
Как объяснить проверку гипотез для подростков менее чем за 10 минут?
Уже больше года я провожу один час урока "вкус к статистике". Каждый раз, когда ко мне приходит другая группа детей, я даю им урок. Тема занятия заключается в том, что мы проводим эксперимент, в котором 10 детей (которые любят пить кока-колу) получают две (без маркировки) чашки, одну с кока-колой и …

1
Слепой источник разделения выпуклой смеси?
Предположим, у меня есть независимых источников, и я наблюдаю выпуклых смесей: Х 1 , Х 2 , . , , , X н м Y 1NNnИкс1, X2, . , , , XNИкс1,Икс2,,,,,ИксNX_1, X_2, ..., X_nммmY1, , ,Yм= а11Икс1+ а12Икс2+ ⋯ + a1 нИксN= ам 1Икс1+ ам 2Икс2+ ⋯ + aм …
18 pca  ica 

5
Обнаружение изменений во временных рядах (пример R)
Я хотел бы обнаружить изменения в данных временных рядов, которые обычно имеют одинаковую форму. До сих пор я работал с changepointпакетом для R cpt.mean(), cpt.var()и cpt.meanvar()функций и. cpt.mean()с методом PELT хорошо работает, когда данные обычно остаются на одном уровне. Однако я также хотел бы обнаружить изменения во время спусков. Примером …

2
Почему
Последовательность оценок для параметра асимптотически нормальна, если . ( источник ) Затем мы называем асимптотической дисперсией . Если эта дисперсия равна границе Крамера-Рао , мы говорим, что оценка / последовательность асимптотически эффективна. θ √UNUnU_nθθ\thetaN--√( UN- θ ) → N( 0 , v )n(Un−θ)→N(0,v)\sqrt{n}(U_n - \theta) \to N(0,v)U nvvvUNUnU_n Вопрос: Почему …

2
Среднее из начальной загрузки выборки против статистики выборки
Скажем, у меня есть образец и образец начальной загрузки из этого образца для стастита (например, среднее значение). Как все мы знаем, эта самозагрузки образец оценивает на распределение выборки из оценки из статистики.χχ\chi Теперь, является ли среднее значение этой выборки начальной загрузки лучшей оценкой статистики популяции, чем статистика исходной выборки ? …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.