Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как разделить r-квадрат между переменными предиктора в множественной регрессии?
Я только что прочитал статью, в которой авторы провели множественную регрессию с двумя предикторами. Общее значение r-квадрата составило 0,65. Они предоставили таблицу, которая делит r-квадрат между двумя предикторами. Стол выглядел так: rsquared beta df pvalue whole model 0.65 NA 2, 9 0.008 predictor 1 0.38 1.01 1, 10 0.002 predictor …

3
Разложение Холецкого против собственного для рисования образцов из многомерного нормального распределения
Я хотел бы нарисовать образец x∼N(0,Σ)x∼N(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right) . Википедия предлагает использовать либо разложение Холецкого, либо Собственное , то есть или Σ=D1DT1Σ=D1D1T \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T Σ = Q Λ QTΣзнак равноQΛQT \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T И, следовательно, образец может быть получен через: или где х = D1vИксзнак равноD1v \mathbf{x} …

1
Почему контроль FDR менее строг, чем контроль FWER?
Я читал, что контроль FDR менее строг, чем контроль FWER, например, в Википедии : Процедуры контроля FDR обеспечивают менее строгий контроль над ложным обнаружением по сравнению с процедурами семейной частоты ошибок (FWER) (такими как коррекция Бонферрони). Это увеличивает мощность за счет увеличения частоты ошибок типа I, то есть отвергает нулевую …

2
Путаница с расширенным тестом Дики Фуллера
Я работаю над набором данных electricityдоступны в R пакете TSA. Моя цель состоит в том, чтобы выяснить, arimaподойдет ли модель для этих данных и в конечном итоге соответствовать ей. Итак, я поступил следующим образом: 1-й: нанесите временной ряд, который получился, если бы следующий график: 2-й: я хотел взять журнал electricityдля …

3
Проверьте, соответствуют ли переменные тому же распределению
Если вы хотите проверить, соответствуют ли две переменные одному и тому же распределению, было бы неплохо просто отсортировать обе переменные, а затем проверить их соотношение? Если оно высокое (не менее 0,9?), То переменные, скорее всего, происходят из одного и того же распределения. Под распределением здесь я имею в виду «нормальный», …

2
R Язык, в чем разница между rnorm и runif [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 лет назад . В чем разница между функциями rnormи runifв R?
16 r 

2
Интуитивное объяснение периодичности в цепях Маркова
Может кто-нибудь объяснить мне интуитивно, что такое периодичность цепи Маркова? Это определяется следующим образом: Для всех штатов iii в SSS didid_i = gcd{n∈N|p(n)ii>0}=1{n∈N|pii(n)>0}=1\{n \in \mathbb{N} | p_{ii}^{(n)} > 0\} =1 Спасибо за ваши усилия!

2
Остатки Пирсона
Вопрос новичка об остатке Пирсона в контексте теста хи-квадрат на соответствие формы: Помимо статистики теста, chisq.testфункция R сообщает об остатке Пирсона: (obs - exp) / sqrt(exp) Я понимаю, почему смотреть на необработанную разницу между наблюдаемыми и ожидаемыми значениями не так информативно, так как меньшая выборка приведет к меньшей разнице. Однако …

1
Вопрос о том, как нормализовать коэффициент регрессии
Не уверен, что слово «нормализация» - это правильное слово, но я постараюсь сделать все возможное, чтобы проиллюстрировать то, что я пытаюсь спросить. Здесь используется оценка наименьших квадратов. Предположим, у вас есть y = β 0 + β 1 x 1y=β0+β1x1y=\beta_0+\beta_1x_1 , вы можете центрировать его вокруг среднего значения y = …

1
Верхние границы плотности связки?
Фреш-Хёфдинг верхней границы относится к функции распределения копулы и задается C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. Есть ли подобные (в том смысле , что оно зависит от предельных плотностей) до верхней границы для плотности копулы c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) вместо CDF? Любая ссылка будет принята с благодарностью.

1
Правильная техника начальной загрузки для кластерных данных?
У меня есть вопрос относительно правильной методики начальной загрузки для использования с данными, где присутствует сильная кластеризация. Мне было поручено оценить многомерную модель прогнозирования смешанных эффектов для данных страховых требований путем оценки текущей базовой модели на более поздних данных о претензиях, чтобы определить, насколько хорошо модель прогнозирует, какие эпизоды медицинской …

2
Наблюдаемая информационная матрица является последовательной оценкой ожидаемой информационной матрицы?
Я пытаюсь доказать, что наблюдаемая информационная матрица, оцененная по слабо непротиворечивой оценке максимального правдоподобия (MLE), является слабо непротиворечивой оценкой ожидаемой информационной матрицы. Это широко цитируемый результат, но никто не дает ссылку или доказательство (я исчерпал, я думаю, первые 20 страниц результатов Google и мои учебники статистики)! Используя слабо согласованную последовательность …

1
Критерии для установки ширины STL s.window
Используется Rдля выполнения разложения STL, s.windowуправляет тем, насколько быстро может изменяться сезонный компонент. Малые значения позволяют более быстрые изменения. Установка сезонного окна равной бесконечности равносильна тому, что сезонный компонент должен быть периодическим (т. Е. Идентичным по годам). Мои вопросы: 121212s.window Есть ли связь между этим и частотой временного ряда?

2
учебные подходы для сильно несбалансированного набора данных
У меня очень несбалансированный набор тестовых данных. Положительный набор состоит из 100 случаев, а отрицательный - 1500 случаев. Что касается обучения, у меня больше кандидатов: в наборе положительных тренировок 1200 случаев, а в наборе отрицательных - 12000 случаев. Для такого сценария у меня есть несколько вариантов: 1) Использование взвешенного SVM …

1
Распределение с м кумулянтом, заданным ?
Есть ли какая-нибудь информация о распределении, й кумулянт которого равен ? Генерирующая функция кумулянта имеет вид Я столкнулся с этим как с ограничивающим распределением некоторых случайных переменных, но я не смог найти никакой информации по нему.NNn1N1N\frac 1 nκ ( t ) = ∫10ет х- 1Икс dх .κ(T)знак равно∫01еTИкс-1Икс dИкс, \kappa(t) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.