Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Положительная корреляция и отрицательный знак коэффициента регрессора
Можно ли получить положительную корреляцию между регрессором и откликом ( +0,43) и, после этого, получить отрицательный коэффициент в подогнанной регрессионной модели для этого регрессора? Я не говорю об изменениях знака регрессора среди некоторых моделей. Знак коэффициента всегда остается. Могут ли остальные переменные подобранной модели влиять на изменение знака?

1
Взаимосвязь между количеством векторов поддержки и количеством функций
Я запустил SVM для данного набора данных и сделал следующее наблюдение: если я изменю количество функций для построения классификатора, число результирующих векторов поддержки также будет изменено. Я хотел бы знать, как объяснить такой сценарий.

1
Зачем использовать зарегистрированные переменные?
Возможно, это очень простой вопрос, но я, похоже, не смог найти на него убедительного ответа. Я надеюсь здесь, я могу. В настоящее время я читаю статьи в качестве подготовки к моей собственной магистерской диссертации. В настоящее время я читаю статью, в которой исследуется связь между твитами и особенностями фондового рынка. …

5
Байесовцы когда-либо утверждают, что есть случаи, в которых их подход обобщает / совпадает с подходом, основанным на частоте?
Неужели байесовцы когда-либо утверждают, что их подход обобщает подход, основанный на частоте, потому что можно использовать неинформативные априорные значения и, следовательно, можно восстановить типичную структуру модели частых лиц? Кто-нибудь может направить меня туда, где я могу прочитать об этом аргументе, если он действительно используется? РЕДАКТИРОВАТЬ: Этот вопрос, возможно, сформулирован не …

2
Проблема Беренса-Фишера
Есть ли хорошее опубликованное объяснительное изложение, с математическими подробностями, различных подходов, которые были приняты к проблеме Беренса-Фишера?

2
Спс и случайные леса
Для недавнего соревнования Kaggle я (вручную) определил 10 дополнительных функций для своего тренировочного набора, которые затем будут использоваться для обучения классификатора случайных лесов. Я решил запустить PCA в наборе данных с новыми функциями, чтобы увидеть, как они сравниваются друг с другом. Я обнаружил, что ~ 98% дисперсии несет первый компонент …

3
СВД матрицы с пропущенными значениями
Предположим, у меня есть матрица рекомендаций в стиле Netflix, и я хочу построить модель, которая предсказывает потенциальные будущие рейтинги фильмов для данного пользователя. Используя подход Саймона Фанка, можно было бы использовать стохастический градиентный спуск, чтобы минимизировать норму Фробениуса между полной матрицей и пошаговой * пользовательской матрицей в сочетании с термином …

2
Разница между поисковым и подтверждающим факторным анализом при определении независимости конструкции
Исследователи часто используют две меры, которые имеют очень похожие предметы, и утверждают, что они измеряют разные вещи (например, «я всегда волнуюсь, когда я рядом с машинами»; «я боюсь машин»). Назовем гипотетические меры «Мера страха перед автомобилем» и «Беспокойство от автомобильной шкалы». Я заинтересован в эмпирическом тестировании, если они действительно оценивают …

2
Как уменьшить количество элементов, используя факторный анализ, внутреннюю согласованность и теорию отклика элементов в сочетании?
Я нахожусь в процессе эмпирической разработки вопросника, и я буду использовать произвольные числа в этом примере для иллюстрации. Для контекста я разрабатываю психологическую анкету, нацеленную на оценку моделей мышления, которые обычно выявляются у людей с тревожными расстройствами. Элемент может выглядеть так: «Мне нужно проверять духовку несколько раз, потому что я …

4
Могу ли я использовать Z-показатель с искаженными и ненормальными данными? [закрыто]
Закрыто . Этот вопрос нуждается в деталях или ясности . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Добавьте детали и проясните проблему, отредактировав этот пост . Закрыто 5 лет назад . Я работал с некоторыми данными о времени цикла процесса и масштабированием с использованием стандартного z-показателя …

1
Что такое коррекция смещения? [закрыто]
Закрыто . Этот вопрос нуждается в деталях или ясности . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Добавьте детали и проясните проблему, отредактировав этот пост . Закрыто 4 года назад . Я видел много мест, где у них есть наборы данных ввода / вывода, где они …

2
Линейный дискриминантный анализ и правило Байеса: классификация
Какова связь между линейным дискриминантным анализом и правилом Байеса? Я понимаю, что LDA используется в классификации, пытаясь минимизировать соотношение внутри групповой дисперсии и между групповой дисперсией, но я не знаю, как в ней используется правило Байеса.

1
Построение кривой вероятности для логит-модели с несколькими предикторами
У меня есть следующая функция вероятности: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} где z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Моя модель выглядит Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} Это визуализируется с помощью кривой вероятности, которая выглядит так, как показано ниже. Я рассматриваю возможность добавления пары переменных к …

2
Логистический регрессионный анализ остатков
Этот вопрос довольно общий и многословный, но, пожалуйста, потерпите меня. В моем приложении у меня есть много наборов данных, каждый из которых состоит из ~ 20 000 точек данных с ~ 50 объектами и одной зависимой двоичной переменной. Я пытаюсь смоделировать наборы данных с помощью регуляризованной логистической регрессии (пакет R …

1
Как я могу оптимизировать вычислительную эффективность при многократной подгонке сложной модели к большому набору данных?
У меня проблемы с производительностью при использовании MCMCglmmпакета в R для запуска модели смешанных эффектов. Код выглядит так: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) В данных содержится около 20 000 наблюдений, которые сгруппированы примерно в 200 школах. Я удалил все неиспользуемые переменные из фрейма данных и …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.