Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Является ли мультиколлинеарность неявной в категориальных переменных?
Я заметил, что во время работы с моделью многомерной регрессии наблюдался небольшой, но заметный эффект мультиколлинеарности, измеряемый коэффициентами инфляции дисперсии, в категориях категориальной переменной (конечно, после исключения эталонной категории). Например, скажем, у нас есть набор данных с непрерывной переменной y и одной номинальной категориальной переменной x, которая имеет k возможных …

1
randomForest и ошибка важности переменной?
Я не получаю разницу между rfobject$importanceи importance(rfobject)в столбце MeanDecreaseAccuracy. Пример: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > …

3
Выбор функций с использованием взаимной информации в Matlab
Я пытаюсь применить идею взаимной информации к выбору функций, как описано в этих примечаниях к лекции (на странице 5). Моя платформа - Matlab. Одна проблема, которую я нахожу при вычислении взаимной информации из эмпирических данных, состоит в том, что число всегда смещено вверх. Я нашел около 3 ~ 4 разных …

2
Простое приближение кумулятивного распределения Пуассона в длинном хвосте?
Я хочу определить емкость CCC таблицы так, чтобы она имела остаточные шансы менее 2−p2−p2^{-p} переполнить для данного p∈[40…120]p∈[40…120]p\in[40\dots 120] , предполагая, что число записей следует закону Пуассона с заданной ожидаемой величиной .E∈[103…1012]E∈[103…1012]E\in[10^3\dots 10^{12}] В идеале я хочу, чтобы наименьшее целое число было Cтаким, что 1-CDF[PoissonDistribution[E],C] < 2^-pдля заданного pи E; …


4
Редуцирующая регуляризация для стохастических матриц
Хорошо известно (например, в области измерения сжатия), что норма является «вызывающей разреженность» в том смысле, что если минимизировать функционал (для фиксированной матрицы и вектора ), для достаточно большого размера \ lambda> 0 , у многих вариантов A , \ vec {b} и \ lambda, вероятно, будет много точно нулевых записей …

1
Можно ли обучить модель P (Y | X) с помощью стохастического градиентного спуска из неидеальных выборок P (X) и iid выборок P (Y | X)?
При обучении параметризованной модели (например, для максимизации вероятности) посредством стохастического градиентного спуска на некотором наборе данных обычно предполагается, что обучающие выборки извлекаются из распределения обучающих данных. Таким образом, если цель состоит в том, чтобы смоделировать совместное распределение , то каждый обучающий образец должен быть взят из этого распределения.P(X,Y)P(X,Y)P(X,Y)(xi,yi)(xi,yi)(x_i,y_i) Если вместо …

2
Коэффициент экспоненциальной логистической регрессии отличается от отношения шансов
Насколько я понимаю, возведенное в степень значение бета из логистической регрессии - это отношение шансов этой переменной для зависимой переменной, представляющей интерес. Однако это значение не соответствует рассчитанному вручную коэффициенту шансов. Моя модель предсказывает задержку роста (показатель недоедания) с использованием, среди прочего, страховки. // Odds ratio from LR, being done …

2
Асимптотическое распределение статистики максимального порядка случайных нормалей IID
Есть ли распределение хорошего ограничения как п идет к \ infty , при условии , что они являются IID нормальных распределений с дисперсией \ Sigma ^ 2 .Макс ( Х1, X2, . , , , XN)Максимум(Икс1,Икс2,,,,,ИксN)\max( X_1,X_2,...,X_n) NNn∞∞\inftyσ2σ2\sigma^2 Это почти наверняка хорошо известная проблема с умным доказательством и хорошим решением, …

1
«Центральная предельная теорема» для взвешенной суммы коррелированных случайных величин
Я читаю газету, которая утверждает, что Икс^К= 1N--√ΣJ = 0N- 1ИксJе- я 2 πK J / N,Икс^Кзнак равно1NΣJзнак равно0N-1ИксJе-я2πКJ/N,\hat{X}_k=\frac{1}{\sqrt{N}}\sum_{j=0}^{N-1}X_je^{-i2\pi kj/N}, (то есть дискретное преобразование Фурье , DFT) CLT стремится к (комплексной) гауссовской случайной переменной. Тем не менее, я знаю, что это не так в целом. Прочитав этот (ошибочный) аргумент, я …

2
Гигантский эксцесс?
Я делаю некоторую описательную статистику ежедневных возвратов по фондовым индексам. Т.е. если и являются уровнями индекса в 1-й и 2-й день, соответственно, то - это возвращаемый мной результат (полностью стандартный в литературе).P 2 l o g e ( P 2п1P1P_1п2P2P_2л о ге( P2п1)loge(P2P1)log_e (\frac{P_2}{P_1}) Таким образом, эксцесс огромен в некоторых …

1
Вопросы об определении линейных смешанных моделей в R для данных повторных измерений с дополнительной структурой вложенности
Структура данных > str(data) 'data.frame': 6138 obs. of 10 variables: $ RT : int 484 391 422 516 563 531 406 500 516 578 ... $ ASCORE : num 5.1 4 3.8 2.6 2.7 6.5 4.9 2.9 2.6 7.2 ... $ HSCORE : num 6 2.1 7.9 1 6.9 8.9 …

4
Зачем использовать контрольные переменные в различиях?
У меня есть вопрос о подходе «различия в различиях» со следующим стандартным уравнением: где Treat - фиктивная переменная для группы лечения и post. y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u Теперь мой вопрос прост: почему в большинстве статей все еще используются дополнительные контрольные переменные? Я думал, что …

2
Учебник по выводу Метрополиса-Гастингса и Гиббса
У меня довольно хороший практический опыт работы с выборками Метрополиса-Гастингса и Гиббса, но я хочу получить лучшее математическое понимание этих алгоритмов. Какие есть хорошие учебники или статьи, которые доказывают правильность этих сэмплеров (больше алгоритмов также было бы здорово)?

1
О копенетической корреляции для кластеризации дендрограмм
Рассмотрим контекст кластеризации дендрограмм. Давайте назовем оригинальные различия расстояниями между людьми. После построения дендрограммы мы определяем копенетическое различие между двумя индивидами как расстояние между кластерами, к которым эти индивиды принадлежат. Некоторые люди считают, что корреляция между исходными различиями и копенетическими различиями (так называемая копенетическая корреляция ) является «индексом пригодности» классификации. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.