Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


3
Соответствие ANOVA после кластерного анализа k-средних
Уведомление после таблицы ANOVA после анализа K-средних указывает на то, что уровни значимости не следует рассматривать как критерий равных средних, поскольку кластерное решение было получено на основе евклидова расстояния для максимизации расстояния. Какой тест я должен использовать, чтобы показать, отличаются ли средства переменных кластеризации между кластерами? Я видел это предупреждение …
14 anova  k-means 

3
Разница между факторизационными машинами и матричной факторизацией?
Я сталкивался с термином «Машины факторизации» в рекомендательных системах. Я знаю, что такое матричная факторизация для рекомендательных систем, но никогда не слышала о факторизационных машинах. Так в чем же разница?

2
AIC, BIC и GCV: что лучше всего принимать решения в методах регрессии, о которых наказывают?
Мое общее понимание состоит в том, что AIC имеет дело с компромиссом между добротностью соответствия модели и сложностью модели. А яС= 2 k - 2 l n ( L )AяСзнак равно2К-2LN(L)AIC =2k -2ln(L) = количество параметров в моделиККk = вероятностьLLL Байесовский информационный критерий BIC тесно связан с AIC. AIC штрафует …

2
Использование вложенной перекрестной проверки
На странице Scikit Learn по выбору модели упоминается использование вложенной перекрестной проверки: >>> clf = GridSearchCV(estimator=svc, param_grid=dict(gamma=gammas), ... n_jobs=-1) >>> cross_validation.cross_val_score(clf, X_digits, y_digits) Два цикла перекрестной проверки выполняются параллельно: один с помощью оценщика GridSearchCV для установки гаммы, а другой с помощью cross_val_score для измерения эффективности прогнозирования оценщика. Полученные оценки являются …

2
Почему сферичность, диагностированная с помощью теста Бартлетта, означает, что PCA не подходит?
Я понимаю, что тест Бартлетта связан с определением, являются ли ваши выборки из групп с равными отклонениями. Если образцы взяты из популяций с одинаковыми отклонениями, то мы не можем отклонить нулевую гипотезу теста, и поэтому анализ основных компонентов неуместен. Я не уверен, где проблема в этой ситуации (с набором гомоскедастических …

3
R: Что я вижу на графиках частичной зависимости gbm и RandomForest?
На самом деле, я думал, что понял, что можно показать на графике частичной зависимости, но на очень простом гипотетическом примере я немного озадачился. В следующем фрагменте кода я генерирую три независимые переменные ( a , b , c ) и одну зависимую переменную ( y ), где c показывает тесную …


1
Пропускная способность ядра: правила Скотта против Сильвермана
Может ли кто-нибудь объяснить простым языком, в чем разница между эмпирическими правилами Скотта и Сильвермана для выбора пропускной способности? В частности, когда один лучше другого? Это связано с основным распределением? Количество образцов? PS Я имею в виду код в SciPy .

1
Процедура выбора eps и minPts для DBSCAN
DBSCAN - наиболее цитируемый алгоритм кластеризации, согласно некоторым литературным источникам, и он может найти кластеры произвольной формы на основе плотности. У него есть два параметра eps (как радиус окрестности) и minPts (как минимальные соседи, рассматривающие точку как точку ядра), которые, я считаю, сильно зависят от них. Есть ли какой-либо рутинный …

1
Есть ли интуитивная характеристика дистанционной корреляции?
Я смотрел на страницу Википедии для корреляции расстояний, где она, кажется, характеризуется тем, как ее можно рассчитать. В то время как я мог делать вычисления, я изо всех сил пытаюсь получить, какие меры корреляции расстояния и почему вычисления выглядят, как они делают. Есть ли (или многие) более интуитивная характеристика дистанционной …

4
Какие переменные объясняют, какие компоненты PCA, и наоборот?
Используя эти данные: head(USArrests) nrow(USArrests) Я могу сделать PCA следующим образом: plot(USArrests) otherPCA <- princomp(USArrests) Я могу получить новые компоненты в otherPCA$scores и доля дисперсии объясняется компонентами с summary(otherPCA) Но что, если я хочу знать, какие переменные в основном объясняются какими основными компонентами? И наоборот: например, ПК1 или ПК2 в …

4
Что просто подразумевается под сокращенной формой?
В эконометрике, что подразумевается под сокращенной формой? Кроме того, что люди ищут, когда говорят: «Я хотел бы видеть сокращенные оценки формы». Это было распространено на работе, а отдельные объяснения и поиски в Google носят слишком технический характер. Надеюсь, что кто-то может привести простой пример.

3
Где оценка плотности полезна?
Пройдя немного лаконичную математику, я думаю, что у меня есть небольшая интуиция оценки плотности ядра. Но я также знаю, что оценка многомерной плотности для более чем трех переменных может быть не очень хорошей идеей с точки зрения статистических свойств ее оценок. Итак, в каких ситуациях я должен оценивать, скажем, двумерную …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.