Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Распространены ли какие-либо процессы в природе совершенно нормально?
Много было сказано о важности нормальных распределений в природе. Многие измерения, такие как рост или вес, распределены примерно нормально. Но ни один из них не является абсолютно нормальным, насколько я понимаю. Учитывая, что нормальное распределение является одним из максимальных распределений энтропии , представляется вероятным, что природе должно «нравиться». Но, подумав, …

2
Выбор функций для проблем кластеризации
Я пытаюсь сгруппировать разные наборы данных, используя неконтролируемые алгоритмы (кластеризация). Проблема в том, что у меня много функций (~ 500) и небольшое количество дел (200-300). До сих пор я занимался только задачами классификации, для которых я всегда отмечал данные как обучающие наборы. Там я использовал некоторый критерий (то есть random.forest.importance …

3
Половина дискретной случайной величины?
Пусть XXX дискретная случайная величина принимает значения в NN\mathbb{N} . Я хотел бы наполовину эту переменную, то есть найти случайную переменную YYY такую ​​как: X=Y+Y∗X=Y+Y*X = Y + Y^* где является независимой копией .Y∗Y∗Y^*YYY Я называю этот процесс вдвое ; это выдуманная терминология. В литературе найден подходящий термин для этой …

1
Выбор оригинальной (?) Модели с k-кратным CV
При использовании k-кратного CV для выбора между регрессионными моделями я обычно вычисляю ошибку CV отдельно для каждой модели вместе со стандартной ошибкой SE, и выбираю простейшую модель в пределах 1 SE модели с наименьшей ошибкой CV (1 стандартное правило ошибки, см., например, здесь ). Однако недавно мне сказали, что таким …

1
Невозможно заставить эту сеть автоэнкодера функционировать должным образом (со сверточным и максимальным уровнями)
Автоэнкодерные сети кажутся более хитрыми, чем обычные классификаторы MLP сетей. После нескольких попыток использования лазаньи все, что я получаю в восстановленном выводе, в чем-то напоминает размытое усреднение всех изображений базы данных MNIST без различия того, что представляет собой входная цифра. Структура сетей, которую я выбрал, представляет собой следующие каскадные слои: …

1
Почему столбец пересечения в model.matrix заменяет первый фактор?
Я пытаюсь преобразовать столбец фактора в фиктивные переменные: str(cards$pointsBin) # Factor w/ 5 levels ".lte100",".lte150",..: 3 2 3 1 4 4 2 2 4 4 ... labels <- model.matrix(~ pointsBin, data=cards) head(labels) # (Intercept) pointsBin.lte150 pointsBin.lte200 pointsBin.lte250 pointsBin.lte300 # 741 1 0 0 0 0 # 407 1 1 0 …

3
Набор некоррелированных, но линейно зависимых переменных
Можно ли иметь набор из переменных, которые не коррелированы, но линейно зависимы?KKK т.е. и∑ K i = 1 a i x i = 0cor(xi,xj)=0cor(xi,xj)=0cor(x_i, x_j)=0∑Ki=1aixi=0∑i=1Kaixi=0 \sum_{i=1}^K a_ix_i=0 Если да, можете ли вы написать пример? РЕДАКТИРОВАТЬ: Из ответов следует, что это невозможно. По крайней мере, возможно ли, что где - это …

1
Линейная регрессия с ошибками Лапласа
Рассмотрим модель линейной регрессии: где , то есть Распределение Лапласа со средним значением и параметром масштаба являются взаимно независимыми. Рассмотрим оценку максимального правдоподобия неизвестного параметра : из которого \ hat {\ boldsymbol \ beta} _ {\ mathrm {ML}} = {\ arg \ min} _ {\ boldsymbol \ beta \ in …

1
Как рассчитать вероятность исхода этого извилистого механика броска костей?
Этот вопрос задает вопрос о вероятности успеха в ролевых играх. Тем не менее, вопрос и его ответы не охватывают некоторые сложности механики игры в кости. В частности, он вообще не распространяется на ошибки (один из возможных результатов). У игрока есть пул игральных костей, основанный на механике в игре, не имеющей …
9 dice 

1
Почему коэффициенты линейной и логистической регрессии нельзя оценить одним и тем же методом?
В книге по машинному обучению я прочитал, что параметры линейной регрессии могут быть оценены (среди других методов) градиентным спуском, в то время как параметры логистической регрессии обычно оцениваются с помощью оценки максимального правдоподобия. Можно ли объяснить новичку (мне), почему нам нужны разные методы для линейной / логистической регрессии. иначе почему …

3
Вращайте компоненты PCA, чтобы выровнять дисперсию в каждом компоненте
Я пытаюсь уменьшить размерность и шум набора данных, выполняя PCA для набора данных и выбрасывая последние несколько ПК. После этого я хочу использовать некоторые алгоритмы машинного обучения на оставшихся ПК, и поэтому я хочу нормализовать данные путем выравнивания дисперсии ПК, чтобы алгоритмы работали лучше. Один простой способ - просто нормализовать …

3
Что это за компромиссная дисперсия для коэффициентов регрессии и как ее получить?
В данной работе , ( байесовский вывод для Компоненты дисперсии , используя только Error Контрастов , Харвилл, 1974), автор утверждает ( у- Хβ)'ЧАС- 1( у- Хβ) = ( у- Хβ^)'ЧАС- 1( у- Хβ^) + ( β- β^)'( Х'ЧАС- 1Икс) ( β- β^)(Y-Иксβ)'ЧАС-1(Y-Иксβ)знак равно(Y-Иксβ^)'ЧАС-1(Y-Иксβ^)+(β-β^)'(Икс'ЧАС-1Икс)(β-β^)(y-X\beta)'H^{-1}(y-X\beta)=(y-X\hat\beta)'H^{-1}(y-X\hat\beta)+(\beta-\hat\beta)'(X'H^{-1}X)(\beta-\hat\beta) чтобы быть "хорошо известны отношения", для линейной …

1
Обновление байесовского фактора
Байесовский фактор определяется в байесовском тестировании гипотезы и выборе байесовской модели соотношением двух предельных правдоподобий: с учетом выборки iid и соответствующих плотностей выборки и , с соответствующими приорами и , для сравнения двух моделей используется байесовский фактор: книга Я в настоящее время рассматривает имеет странное утверждение , что выше Байеса …

1
Можем ли мы всегда переписать правильное перекошенное распределение в терминах композиции произвольного и симметричного распределения?
Рассмотрим дважды дифференцируемое и симметричное распределение . Теперь рассмотрим второе дважды дифференцируемое распределение перекосом в том смысле, что:FXFX\mathcal{F}_XFZFZ\mathcal{F}_Z (1)FX⪯cFZ.(1)FX⪯cFZ.(1)\quad\mathcal{F}_X\preceq_c\mathcal{F}_Z. где - выпуклый порядок van Zwet [0], так что эквивалентно:⪯c⪯c\preceq_c(1)(1)(1) (2)F−1ZFX(x) is convex ∀x∈R.(2)FZ−1FX(x) is convex ∀x∈R.(2)\quad F^{-1}_ZF_X(x)\text{ is convex $\forall x\in\mathbb{R}.$} Теперь рассмотрим третий дважды дифференцируемый дистрибутив удовлетворяющий:FYFY\mathcal{F}_Y (3)FY⪯cFZ.(3)FY⪯cFZ.(3)\quad\mathcal{F}_Y\preceq_c\mathcal{F}_Z. Мой …

3
Как я могу сказать, что в результатах PCA нет закономерностей?
У меня есть 1000+ выборок из 19 переменных. Моя цель состоит в том, чтобы предсказать двоичную переменную на основе других 18 переменных (двоичной и непрерывной). Я вполне уверен, что 6 из прогнозирующих переменных связаны с двоичным ответом, однако я хотел бы дополнительно проанализировать набор данных и найти другие ассоциации или …
9 pca 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.