Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Какой метод ядра дает наилучшие выходы вероятности?
Недавно я использовал масштабирование SVM-выходов Платта для оценки вероятностей событий по умолчанию. Похоже, более прямыми альтернативами являются «Логистическая регрессия ядра» (KLR) и связанная с ними «Машина вектора импорта». Кто-нибудь может сказать, какой метод ядра, дающий вероятностные результаты, является в настоящее время современным? Существует ли R-реализация KLR? Спасибо большое за помощь!

2
Хороший текст для пересчета?
Может ли группа рекомендовать хороший вводный текст / ресурс по применяемым методам повторной выборки? В частности, меня интересуют альтернативы классическим параметрическим тестам (например, t-тестам, ANOVA, ANCOVA) для сравнения групп, когда такие предположения, как нормальность, явно нарушаются. Пример типа проблемы, который я хотел бы изучить для лучшего решения, может включать что-то …

4
Как я могу оценить плотность нулевого параметра в R?
У меня есть набор данных с большим количеством нулей, который выглядит следующим образом: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Я хотел бы нарисовать линию для его плотности, но density()функция использует движущееся окно, которое вычисляет отрицательные значения х. lines(density(x), col = 'grey') Есть density(... from, to)аргументы, но они, похоже, только …
10 r  probability  kde 

5
Генерация случайных многомерных значений из эмпирических данных
Я работаю над функцией Монте-Карло для оценки нескольких активов с частично коррелированной доходностью. В настоящее время я просто генерирую ковариационную матрицу и подаю rmvnorm()функцию в R. (Генерирует коррелированные случайные значения.) Однако, глядя на распределение доходности актива, он обычно не распределяется. Это действительно вопрос, состоящий из двух частей: 1) Как я …
10 mcmc  monte-carlo  pdf 

2
Как рассчитать доверительные интервалы по коэффициентам регрессии в PLS?
Базовая модель PLS состоит в том, что заданная матрица и вектор связаны соотношением где - скрытая матрица , и - шумовые условия (сссуммируя центрированы).X n y X = T P ′ + E , y = T q ′ + f , T n × k E , f X …

3
Пакет R для объединения уровней факторов для обработки данных?
Хотите знать, сталкивался ли кто-нибудь с пакетом / функцией в R, которая объединит уровни фактора, доля всех уровней которого меньше некоторого порога? В частности, одним из первых шагов в подготовке данных, которые я выполняю, является объединение разреженных уровней факторов вместе (скажем, в уровень, называемый «Другой»), которые не составляют, по крайней …

3
Ресурсы для изучения регрессии ложных временных рядов
«Ложная регрессия» (в контексте временных рядов) и связанные с ней термины, такие как тесты единичного корня, - это то, о чем я много слышал, но никогда не понимал. Почему / когда это происходит интуитивно? (Я полагаю, что это когда ваши два временных ряда коинтегрированы, то есть некоторая линейная комбинация двух …

1
В R «glmnet» соответствует перехвату?
Я подгоняю линейную модель в R, используя glmnet. Исходная (не регуляризованная) модель была подогнана с использованием lmи не имела постоянного члена (т.е. она была в форме lm(y~0+x1+x2,data)). glmnetберет матрицу предикторов и вектор ответов. Я читал glmnetдокументацию и не могу найти упоминания о постоянном термине. Итак, есть ли способ попросить glmnetфорсировать …
10 r  regression  lasso 

4
Советы и рекомендации для начала статистического моделирования?
Я работаю в области интеллектуального анализа данных, и у меня было очень мало формального обучения статистике. В последнее время я читаю много работ, посвященных байесовским парадигмам для изучения и майнинга, что мне очень интересно. У меня вопрос (в нескольких частях), учитывая проблему, есть ли общие рамки, по которым можно построить …

1
Разница между GLS и SUR
Я читал некоторые из Обобщенных наименьших квадратов (GLS) и пытался связать их с моим основным эконометрическим фоном. Я помню, что в аспирантуре использовалась внешне не связанная регрессия (SUR), которая кажется чем-то похожей на GLS. Одна статья, на которую я наткнулся, даже назвала SUR «частным случаем» GLS. Но я все еще …

1
Перевести R на C ++ (в конце концов с Rcpp) [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Я хотел бы научиться использовать Rcpp . Я просмотрел документы на веб-сайте пакета CRAN, но я чувствую, что работа …
10 r  c++ 

2
Тест хи-квадрат на равенство распределений: сколько нулей он терпит?
Я сравниваю две группы мутантов, каждая из которых может иметь только один из 21 различных фенотипов. Я хотел бы посмотреть, одинаково ли распределение этих результатов между двумя группами. Я нашел онлайн-тест, который вычисляет «критерий хи-квадрат для равенства распределений» и дает мне некоторые правдоподобные результаты. Тем не менее, в этой таблице …

1
Кластерный анализ с последующим дискриминантным анализом
Каково обоснование, если таковое имеется, использования Дискриминантного анализа (DA) на результатах алгоритма кластеризации, такого как k-средних, как я вижу это время от времени в литературе (по существу, о клинических подтипах психических расстройств)? Как правило, не рекомендуется проверять групповые различия по переменным, которые использовались во время построения кластера, поскольку они поддерживают …

3
Как работать с недвоичными категориальными переменными в логистической регрессии (SPSS)
Я должен сделать бинарную логистическую регрессию с большим количеством независимых переменных. Большинство из них являются двоичными, но некоторые из категориальных переменных имеют более двух уровней. Как лучше всего справиться с такими переменными? Например, для переменной с тремя возможными значениями я предполагаю, что необходимо создать две фиктивные переменные. Затем, в пошаговой …

2
Когда использовать (не) параметрический критерий предположения о гомоскедастичности?
Если проверяется предположение о гомоскедастичности, то доступны параметрический (критерий Бартлетта однородности отклонений bartlett.test) и непараметрический (критерий Фигнера-Киллина однородности отклонений fligner.test). Как сказать, какой использовать? Должно ли это зависеть, например, от нормальности данных?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.