Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Требуется ли ICA для запуска PCA в первую очередь?
Я просмотрел документ на основе заявления о том, что применение PCA перед применением ICA (с использованием пакета fastICA). У меня вопрос, требует ли ICA (fastICA) сначала запуск PCA? В этой статье упоминается, что ... также утверждается, что предварительное применение PCA повышает производительность ICA за счет (1) отбрасывания небольших конечных собственных …

2
ЭМ алгоритм Практика Задача
Это практическая проблема для промежуточного экзамена. Проблема в примере алгоритма EM. У меня проблемы с частью (е). Я перечисляю части (a) - (e) для завершения и в случае, если я допустил ошибку ранее. Пусть - независимые экспоненциальные случайные величины со скоростью . К сожалению, фактические значения не наблюдаются, и мы …

4
Неортогональная техника, аналогичная PCA
Предположим, у меня есть набор точечных данных 2D, и я хочу определить направления всех локальных максимумов дисперсии в данных, например: PCA не помогает в этой ситуации, так как это ортогональное разложение и, следовательно, не может обнаружить обе линии, которые я указал синим цветом, скорее его вывод может выглядеть так, как …

1
Почему корреляция остатков не имеет значения при тестировании на нормальность?
Когда (то есть Y происходит из модели линейной регрессии), ε ∼ N ( 0 , σ 2 I )Y= A X+ εY=AX+εY = AX + \varepsilonYYY И в этом случае невязок е 1 , ... , е п коррелируют и ненезависимыми. Но когда мы делаем регрессионную диагностику и хотим проверить …

2
Анализ выживаемости, когда ковариаты недоступны для цензурированных данных
Я смотрю на время, необходимое судьям для принятия решений. Каждый судья оценивает количество заявителей и может одобрить или не одобрить заявку. Дело завершается, когда судья представляет свой отчет, который может быть через некоторое время после слушания. В конце периода исследования ряд дел все еще оставался открытым. Я хочу оценить среднее …
9 survival 

4
Как сделать многомерное машинное обучение? (прогнозирование нескольких зависимых переменных)
Я пытаюсь предсказать группы предметов, которые кто-то купит ... то есть у меня есть несколько коллинеарных зависимых переменных. Вместо того, чтобы строить 7 или около того независимых моделей, чтобы предсказать вероятность того, что кто-то купит каждый из 7 предметов, а затем объединить результаты, какие методы я должен рассмотреть, чтобы иметь …


3
Выбор k узлов в регрессионном сглаживающем сплайне, эквивалентном k категориальным переменным?
Я работаю над моделью прогнозируемой стоимости, в которой возраст пациента (целое число, измеренное в годах) является одной из переменных предиктора. Сильная нелинейная связь между возрастом и риском пребывания в больнице очевидна: Я рассматриваю сглаженный сплайн сглаживания регрессии для возраста пациента. Согласно «Элементам статистического обучения» (Hastie et al, 2009, p. 151), …

2
Может ли узкий доверительный интервал вокруг незначительного эффекта свидетельствовать об отсутствии?
Очевидно, ошибочно полагать, что отказ от отклонения нулевого значения подразумевает, что нулевое значение истинно. Но в случае , когда нуль не отвергается и соответствующий доверительный интервал (ДИ) узок и вокруг 0, делает это не дает доказательства для нуля? Я придерживаюсь двух соображений: да, на практике это послужит доказательством того, что …

4
Что такое «строго положительное распределение»?
Я читаю «Причинность» Иудеи Перл (второе издание 2009 года), а в разделе 1.1.5 «Условная независимость и графоиды» он заявляет: Ниже приведен (частичный) список свойств, удовлетворяемых условным условием независимости (X_ || _Y | Z). Симметрия: (X_ || _ Y | Z) ==> (Y_ || _X | Z). Разложение: (X_ || _ …

1
Когда правильное правило оценки является лучшей оценкой обобщения в условиях классификации?
Типичный подход к решению проблемы классификации состоит в том, чтобы идентифицировать класс моделей-кандидатов, а затем выполнить выбор модели с использованием некоторой процедуры, такой как перекрестная проверка. Обычно выбирается модель с наивысшей точностью или некоторая связанная функция, которая кодирует информацию о проблеме, например FβFβ\text{F}_\beta . Предполагая, что конечной целью является создание …

1
Почему функциональная форма 1-го этапа в 2SLS не важна?
В сегодняшней презентации спикер выступил с вышеуказанным заявлением. Он сказал, что даже если первая стадия будет неверно определена, оценки коэффициентов второй стадии все равно будут действительны. Будучи скромным аспирантом, я не мог попросить объяснений, поэтому теперь я просил вашей помощи!

2
Определение точки переключения с вероятностным программированием (pymc)
В настоящее время я читаю "книгу" вероятностного программирования и байесовских методов для хакеров . Я прочитал несколько глав, и я думал о первой главе, где первый пример с pymc состоит из обнаружения точки ведьмы в текстовых сообщениях. В этом примере случайная величина, указывающая, когда происходит точка переключения, указывается с помощью …

3
Если ,
Предположим следующее: Пусть Zi=min{ki,Xi},i=1,...,nZi=min{ki,Xi},i=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n . Также Xi∼U[ai,bi],ai,bi>0Xi∼U[ai,bi],ai,bi>0X_i \sim U[a_i, b_i], \; a_i, b_i >0 . Кроме того, Кя= сaя+ ( 1 - с )bя,0 < с < 1kязнак равносaя+(1-с)бя,0<с<1k_i = ca_i + (1-c)b_i,\;\; 0 k_i) = 1- \Pr(X_i \le k_i) = 1 - кя- аябя- ая= …

2
Байесовский анализ таблиц сопряженности: как описать величину эффекта
Я работаю с примерами из анализа Крушке « Байесовский анализ данных» , в частности, с использованием экспоненциального ANOVA Пуассона в гл. 22, который он представляет в качестве альтернативы частым тестам хи-квадрат независимости для таблиц непредвиденных обстоятельств. Я вижу, как мы получаем информацию о взаимодействиях, которые происходят более или менее часто, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.