Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Допустимо ли иметь только два (или менее) элемента (переменных), загруженных фактором факторного анализа?
У меня есть набор из 20 переменных, которые я проанализировал с помощью факторного анализа в SPSS. Для целей исследования мне необходимо разработать 6 факторов. SPSS показал, что 8 переменных (из 20) были загружены с низким весом или были загружены одинаково по нескольким факторам, поэтому я удалил их. Оставшиеся 12 переменных …

3
Сумма биномиальных и пуассоновских случайных величин
Если у нас есть две независимые случайные величины и , какова функция вероятности массы ?X 2 ∼ P o i s ( λ ) X 1 + X 2X1∼Binom(n,p)X1∼Binom(n,p)X_1 \sim \mathrm{Binom}(n,p)X2∼Pois(λ)X2∼Pois(λ)X_2 \sim \mathrm{Pois}(\lambda)X1+X2X1+X2X_1 + X_2 NB Это не домашняя работа для меня.

2
Графики в регрессионном разрыве дизайна в «Stata» или «R»
Lee и Lemieux (стр. 31, 2009) предлагают исследователю представить графики при выполнении анализа разрыва непрерывности регрессии (RDD). Они предлагают следующую процедуру: «... для некоторой полосы пропускания и для некоторого числа бинов и слева и справа от значения отсечки, соответственно, идея состоит в том, чтобы построить бины ( , ], для …

3
Как вы представляете двоичные результаты в сравнении с непрерывным предиктором?
У меня есть некоторые данные, которые мне нужно визуализировать, и я не уверен, как лучше это сделать. У меня есть некоторый набор базовых предметов с соответствующими частотами и результатами . Теперь мне нужно показать, насколько хорошо мой метод «находит» (то есть, 1-результат) низкочастотные элементы. Первоначально у меня была только ось …

3
Полиномиальная модель Дирихле с гиперприорным распределением по параметрам концентрации
Я постараюсь описать имеющуюся проблему как можно более общей. Я моделирую наблюдения как категориальное распределение с вектором вероятности параметра тета. Затем я предполагаю, что вектор параметров тета следует предварительному распределению Дирихле с параметрами .α1,α2,…,αkα1,α2,…,αk\alpha_1,\alpha_2,\ldots,\alpha_k Можно ли также наложить гиперприорное распределение по параметрам ? Должно ли это быть многомерное распределение, такое …

3
Выбор количества основных компонентов для сохранения
Один из методов, который мне предложили, - это посмотреть на график осыпей и проверить наличие «локтя», чтобы определить правильное количество ПК для использования. Но если график не ясен, есть ли у R расчет для определения числа? fit <- princomp(mydata, cor=TRUE)
10 r  pca 

3
Когда использовать надежные стандартные ошибки в пуассоновской регрессии?
Я использую модель регрессии Пуассона для данных подсчета и мне интересно, есть ли причины не использовать надежную стандартную ошибку для оценок параметров? Я особенно обеспокоен тем, что некоторые из моих оценок без робастных не значимы (например, р = 0,13), но с робастными являются значимыми (р <0,01). В SAS это доступно …

1
При заданном наборе точек в двухмерном пространстве, как может функционировать одно решение по проектированию для SVM?
Может кто-нибудь объяснить мне, как можно разработать функцию решения SVM? Или укажите мне на ресурс, который обсуждает конкретный пример. РЕДАКТИРОВАТЬ Для приведенного ниже примера я вижу, что уравнение X2=1.5X2=1.5X_2 = 1.5 разделяет классы с максимальным запасом. Но как мне отрегулировать веса и написать уравнения для гиперплоскостей в следующем виде. H1:w0+w1x1+w2x2≥1H2:w0+w1x1+w2x2≤−1forYi=+1forYi=−1.H1:w0+w1x1+w2x2≥1forYi=+1H2:w0+w1x1+w2x2≤−1forYi=−1.\begin{array}{ll} …
10 svm 

1
R и EViews различия в оценках AR (1)
Основная проблема : я не могу получить аналогичные оценки параметров с EViews и R. По причинам, которые я сам не знаю, мне нужно оценить параметры для определенных данных, используя EViews. Это делается путем выбора опции NLS (нелинейные наименьшие квадраты) и использования следующей формулы:indep_var c dep_var ar(1) EViews утверждает, что они …

2
Какие преимущества предлагают «внутренне изученные остатки» по сравнению с необработанными расчетными остатками с точки зрения диагностики потенциальных влиятельных точек данных?
Причина, по которой я спрашиваю об этом, заключается в том, что кажется, что внутренне изученные остатки имеют ту же структуру, что и необработанные расчетные остатки. Было бы здорово, если бы кто-то мог предложить объяснение.
10 residuals 

2
Имеет ли место многомерная центральная предельная теорема (ЦПТ), когда переменные демонстрируют совершенную одновременную зависимость?
Название подводит итог моего вопроса, но для ясности рассмотрим следующий простой пример. Пусть Икся∽я я дN( 0 , 1 )Икся∽яяdN(0,1)X_i \overset{iid}{\backsim} \mathcal{N}(0, 1) , я = 1 , . , , , нязнак равно1,,,,,Ni = 1, ..., n . Определите: SN= 1NΣя = 1NИксяSNзнак равно1NΣязнак равно1NИкся\begin{equation} S_n = \frac{1}{n} \sum_{i=1}^n …

3
Какова связь между методами, такими как сопоставление и статистическое управление переменными?
Часто в научных статьях, которые вы читаете, исследователи контролировали определенные переменные. Это можно сделать такими методами, как сопоставление, блокировка и т. Д. Но я всегда думал, что контроль переменных был чем-то статистическим, измеряя несколько переменных, которые могли бы повлиять, и выполняя некоторый статистический анализ тех, которые могли быть выполнены как …

3
Модельное предложение для регрессии Кокса с зависимыми от времени ковариатами
Я моделирую влияние беременности на исход болезни (мертвый жив). Приблизительно 40% пациентов забеременели после постановки диагноза, но в разные моменты времени. До сих пор я делал графики КМ, показывающие явный защитный эффект беременности на выживаемость, а также обычную модель Кокса - однако они были смоделированы с использованием только дихотомической переменной …
10 survival 

1
Как интерпретировать коэффициенты многомерной смешанной модели в lme4 без общего перехвата?
Я пытаюсь вписать многомерную (то есть множественную реакцию) смешанную модель R. Помимо ASReml-rи SabreRпакетов (которые требуют внешнего программного обеспечения), то кажется , что это возможно только в MCMCglmm. В документе, который сопровождает MCMCglmmпакет (стр. 6), Джаррод Хэдфилд описывает процесс подгонки такой модели, например, преобразования нескольких переменных ответа в одну переменную …

2
Иерархические модели для множественных сравнений - контекст с несколькими результатами
Я только что (пере) читал книгу Гелмана « Почему нам (обычно) не нужно беспокоиться о множественных сравнениях» . В частности, в разделе «Множественные результаты и другие проблемы» упоминается использование иерархической модели для ситуаций, когда существует несколько связанных показателей одного и того же человека / подразделения в разное время / условия. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.