Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Эффективный размер выборки для последующего вывода из выборки MCMC
При получении образцов MCMC для определения конкретного параметра, каковы хорошие ориентиры для минимального количества эффективных образцов, к которым следует стремиться? И меняется ли этот совет по мере того, как модель становится более или менее сложной?

1
AIC / BIC: для скольких параметров нужна перестановка?
Допустим, у меня проблема с выбором модели, и я пытаюсь использовать AIC или BIC для оценки моделей. Это просто для моделей, которые имеют некоторое число вещественных параметров.kkk Однако что, если одна из наших моделей (например, модель Мэллова ) имеет перестановку плюс некоторые вещественно-значимые параметры вместо просто вещественно-значимых параметров? Я все …

2
Для случайной матрицы разве SVD не должен вообще ничего объяснять? Что я делаю неправильно?
Если бы я построил двумерную матрицу, состоящую полностью из случайных данных, я ожидал бы, что компоненты PCA и SVD по существу ничего не объясняют. Вместо этого кажется, что первый столбец SVD, кажется, объясняет 75% данных. Как это может быть? Что я делаю неправильно? Вот сюжет: Вот код R: set.seed(1) rm(list=ls()) …
13 r  pca  svd 

2
Как далеко зайдет самообучение?
Я никогда не участвовал в официальных или структурированных курсах анализа данных или машинного обучения (кроме недавних онлайн-предложений) и узнал большую часть того, что я знаю, читая и пробуя что-то. Я знаю, что далеко от возможности устроиться на работу. Мой вопрос не в том, что лучше ( например, в этом вопросе …

1
Методы анализа соотношений
Я ищу советы и комментарии, которые касаются анализа соотношений и ставок. В области, в которой я работаю, анализ коэффициентов, в частности, широко распространен, но я прочитал несколько статей, которые предполагают, что это может быть проблематично, я думаю о: Кронмаль, Ричард А. 1993. Ложная корреляция и ошибка стандарта соотношения вновь. Журнал …

1
Алгебра LDA. Различающая способность Фишера переменной и линейный дискриминантный анализ
По-видимому, Анализ Фишера направлен на одновременное максимальное разделение между классами, одновременно сводя к минимуму дисперсию внутри класса. Следовательно, полезная мера степени различения переменной определяется диагональной величиной: Bii/WiiBii/WiiB_{ii}/W_{ii} . http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html Я понимаю , что размер ( p x p) из С ( Б ) и В-класса ( W ) матрицы задается …

3
СПС по многомерным текстовым данным до классификации случайных лесов?
Имеет ли смысл делать PCA перед проведением рандомизации леса? Я имею дело с многомерными текстовыми данными, и я хочу сделать сокращение возможностей, чтобы помочь избежать проклятия размерности, но разве Случайные Леса уже к некоторому уменьшению размеров уже?

4
Работа со связями, весами и голосованием в кНН
Я программирую алгоритм kNN и хотел бы знать следующее: Тай-брейки: Что произойдет, если в голосовании большинства нет явного победителя? Например, все k ближайших соседей принадлежат к разным классам, или для k = 4 есть 2 соседа из класса A и 2 соседа из класса B? Что происходит, если невозможно точно …

2
Пуассон против логистической регрессии
У меня есть когорта пациентов с разной продолжительностью наблюдения. Пока что я не обращаю внимания на временной аспект, и мне просто нужно смоделировать бинарный исход - болезнь / нет болезни. Я обычно делаю логистическую регрессию в этих исследованиях, но другой мой коллега спросил, будет ли регрессия Пуассона такой же уместной. …

2
Var (X) известно, как рассчитать Var (1 / X)?
Если у меня есть только , как я могу вычислить ?V a r ( 1)Var(X)Var(X)\mathrm{Var}(X)Var(1X)Var(1X)\mathrm{Var}(\frac{1}{X}) У меня нет никакой информации о распределении , поэтому я не могу использовать преобразование, или любые другие методы , которые используют распределение вероятностей .XXXXXXX


2
Как мне интерпретировать пробитную модель в Stata?
Я не уверен, как интерпретировать эту пробитную регрессию, которую я использовал для Stata. Данные по утверждению ссуды, а white - фиктивная переменная, которая = 1, если человек был белым, и = 0, если человек не был. Любая помощь о том, как читать это будет принята с благодарностью. То, что я …

2
Существует ли пакет R для продольных двоичных откликов с непрерывным временем?
bildПакет , кажется, превосходный пакет для последовательных бинарных ответов. Но это на дискретное время. Я хотел бы указать плавную функцию времени для связи отношения шансов текущего отклика Y с двоичными откликами, измеренными в более ранние времена, или, по крайней мере, марковской версией первого порядка этого. Я считаю, что это называется …

1
Особенности построения и нормализации в машинном обучении
Допустим, я хочу создать классификатор логистики для фильма М. Мои особенности будут примерно такими, как возраст человека, пол, род занятий, местоположение. Так что тренировочный набор будет примерно таким: Возраст Пол Род занятий Расположение Нравится (1) / Не нравится (0) 23 M Software США 1 24 F Doctor UK 0 и …

2
Числовые решатели для стохастических дифференциальных уравнений в R: есть ли?
Я ищу общий, чистый и быстрый (т. Е. Использующий подпрограммы C ++) R-пакет для имитации путей из неоднородной нелинейной диффузии типа (1) с использованием схемы Эйлера-Маруямы, схемы Мильштейна (или любой другой). Это предназначено для встраивания в больший код оценки и поэтому заслуживает оптимизации. dИксT= ф( θ , т , ХT)dт …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.