Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Методы ротации факторов (варимакс, облимин и т. Д.) - что означают имена и что делают методы?
Факторный анализ имеет несколько методов ротации, таких как варимакс, квартимакс, эквамакс, промакс, облимин и т. Д. Я не могу найти какую-либо информацию, которая связывает их имена с их фактическими математическими или статистическими действиями. Почему это называется "Equa-Max" или "Quti-Max"? Как вращаются оси или матрицы, чтобы они имели такое название? К …

3
Ресурсы для Прерванного анализа временных рядов в R
Я довольно плохо знаком с R. Я попытался прочитать анализ временных рядов и уже закончил Анализ временных рядов Шамвея и Стоффера и его приложения, 3-е издание , Отличное прогнозирование Хиндмана : принципы и практика Использование R Аврил Коглан для анализа временных рядов А. Ян Маклеод и др. Анализ временных рядов …
12 r  time-series 

2
Оптимизация машины опорных векторов с помощью квадратичного программирования
Я пытаюсь понять процесс обучения линейной поддержки векторной машины . Я понимаю, что свойства SMV позволяют оптимизировать их гораздо быстрее, чем с помощью решателя квадратичного программирования, но в целях обучения я хотел бы посмотреть, как это работает. Учебные данные set.seed(2015) df <- data.frame(X1=c(rnorm(5), rnorm(5)+5), X2=c(rnorm(5), rnorm(5)+3), Y=c(rep(1,5), rep(-1, 5))) df …
12 r  svm  optimization 

3
Нелинейность перед конечным слоем Softmax в сверточной нейронной сети
Я изучаю и пытаюсь реализовать сверточные нейронные сети, но я полагаю, что этот вопрос относится к многослойным персептронам в целом. Выходные нейроны в моей сети представляют активацию каждого класса: самый активный нейрон соответствует предсказанному классу для данного входа. Чтобы учесть стоимость кросс-энтропии для обучения, я добавляю слой softmax в конце …

3
Как обрабатывать значения NA в методе усадки (лассо) с использованием glmnet
Я использую "glmnet" для регрессии лассо в GWAS. Некоторые варианты и отдельные лица имеют пропущенные значения, и кажется, что glmnet не может обработать пропущенные значения. Есть ли решение для этого? или есть другой пакет, который может обрабатывать пропущенные значения в регрессии Лассо? Вот мои сценарии. > library(glmnet) > geno6<-read.table("c6sigCnt.geno") > …

1
Как понять, что MLE дисперсии смещен в распределении Гаусса?
Я читаю PRML, и я не понимаю картину. Не могли бы вы дать несколько советов, чтобы понять картину и почему MLE дисперсии в распределении Гаусса смещены? формула 1.55: формула 1.56 σ 2 M L E =1μMLE=1N∑n=1NxnμMLE=1N∑n=1Nxn \mu_{MLE}=\frac{1}{N} \sum_{n=1}^N x_n σ2MLE=1N∑n=1N(xn−μMLE)2σMLE2=1N∑n=1N(xn−μMLE)2 \sigma_{MLE}^2=\frac{1}{N}\sum_{n=1}^{N}(x_n-\mu_{MLE})^2

1
Средняя средняя точность против среднего взаимного ранга
Я пытаюсь понять, когда уместно использовать MAP и когда следует использовать MRR. Я нашел эту презентацию, в которой говорится, что MRR лучше всего использовать, когда число релевантных результатов меньше 5, а лучше всего, когда оно равно 1. В других случаях MAP подходит. У меня есть два вопроса: Я не очень …

1
Почему нам нужен график трассировки для результатов MCMC
Я читаю исследовательские работы с использованием методов MCMC, и я вижу, что большинство из них содержат графики. Зачем нам нужны трассировки участков в цепочке Монте-Карло Маркова? На что указывает трассировка параметров?

3
Как мне справиться с несуществующими или отсутствующими данными?
Я попробовал метод прогнозирования и хочу проверить, является ли мой метод правильным или нет. Мое исследование сравнивает различные виды взаимных фондов. Я хочу использовать индекс GCC в качестве ориентира для одного из них, но проблема в том, что индекс GCC остановился в сентябре 2011 года, а мое исследование проводится с …

2
Точное определение меры Deviance в пакете glmnet с перекрестной проверкой?
Для моего текущего исследования я использую метод Лассо через пакет glmnet в R для биномиальной зависимой переменной. В glmnet оптимальная лямбда определяется путем перекрестной проверки, и полученные модели можно сравнивать с различными показателями, например, ошибочной классификацией или отклонением. Мой вопрос: как именно определяется девиация в glmnet? Как рассчитывается? (В соответствующей …

3
Вывод регуляризованной функции стоимости линейной регрессии на курс Coursera Machine Learning
Я взял курс Эндрю Нг «Машинное обучение» через Coursera несколько месяцев назад, не обращая внимания на большую часть математики / дериваций и вместо этого сосредоточившись на практической реализации. С тех пор я начал возвращаться к изучению основополагающей теории и пересмотрел некоторые лекции профессора Нга. Я читал его лекцию «Регулярная линейная …

1
Тест на значимость, основанный на точности / отзыв / F1
Можно ли провести тест значимости, основанный исключительно на показателях точности / отзыва / F1? Например, если вы столкнулись с двумя системами в документе, для которых сообщается только P / R / F1 (в одном наборе данных и т. Д.), Можете ли вы затем выполнить тест статистической значимости? Если да, то …

1
Присвоить веса переменным в кластерном анализе
Я хочу назначить разные веса переменным в моем кластерном анализе, но моя программа (Stata), похоже, не имеет возможности для этого, поэтому мне нужно сделать это вручную. Представьте себе 4 переменные A, B, C, D. Веса для этих переменных должны быть w(A)=50% w(B)=25% w(C)=10% w(D)=15% Мне интересно, действительно ли один из …
12 clustering  stata 

3
Обнаружение выброса в очень маленьких наборах
Мне нужно получить как можно более точное значение яркости в основном стабильного источника света, учитывая двенадцать значений яркости образца. Датчик неидеален, и свет может иногда «мерцать» ярче или темнее, что можно игнорировать, отсюда моя потребность в обнаружении выбросов (я думаю?). Я немного ознакомился с различными подходами здесь и не могу …

2
Коэффициент корреляции для недихотомической номинальной переменной и порядковой или числовой переменной
Я уже прочитал все страницы на этом сайте, пытаясь найти ответ на мою проблему, но, похоже, никто не подходит мне ... Сначала я объясню вам, с какими данными я работаю ... Допустим, у меня есть вектор-массив с несколькими названиями городов, по одному для каждого из 300 пользователей. У меня также …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.