Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Сравнение логистических коэффициентов на моделях с различными зависимыми переменными?
Это дополнительный вопрос из того, который я задал пару дней назад . Я чувствую, что это ставит другой взгляд на проблему, поэтому перечислил новый вопрос. Вопрос в том, могу ли я сравнить величину коэффициентов по моделям с различными зависимыми переменными? Например, на одном примере скажем, что я хочу знать, является …

3
Лучший способ поставить две гистограммы в одном масштабе?
Допустим, у меня есть два распределения, которые я хочу сравнить в деталях, то есть таким образом, чтобы форма, масштаб и сдвиг были легко видны. Хороший способ сделать это - построить гистограмму для каждого распределения, поместить их в один и тот же масштаб Х и сложить одну под другой. При этом, …

2
Методы объединения / сокращения категорий в порядковых или номинальных данных?
Я изо всех сил пытаюсь найти метод для уменьшения количества категорий в номинальных или порядковых данных. Например, предположим, что я хочу построить регрессионную модель на наборе данных, который имеет ряд номинальных и порядковых факторов. Несмотря на то, что у меня нет проблем с этим шагом, я часто сталкиваюсь с ситуациями, …

6
Быстрые способы в R получить первую строку фрейма данных, сгруппированного по идентификатору [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Иногда мне нужно получить только первую строку набора данных, сгруппированную по идентификатору, как при получении возраста и пола, когда …
14 r  dataset  aggregation  plyr 

4
Могу ли я изменить распределение предложений в MH MCMC с произвольным обходом, не затрагивая марковианство?
Случайная прогулка Метрополис-Хаситингс с симметричным предложением q(x|y)=g(|y−x|)q(x|y)=g(|y−x|)q(x|y)= g(|y-x|) обладает свойством вероятности принятия P(accept y)=min{1,f(y)/f(x)}P(accept y)=min{1,f(y)/f(x)}P(accept\ y) = \min\{1, f(y)/f(x)\} не зависит от предложения g(⋅)g(⋅)g(\cdot) . Означает ли это, что я могу изменить g(⋅)g(⋅)g(\cdot) как функцию предыдущей производительности цепочки, не влияя на марковитость цепочки? Особый интерес для меня представляет корректировка масштабирования …

3
Изучение веса на машине Больцмана
Я пытаюсь понять, как работают машины Больцмана, но я не совсем уверен, как узнать вес, и не смог найти четкого описания. Правильно ли следующее? (Кроме того, ссылки на любые хорошие машинные объяснения Больцмана также были бы хорошими.) У нас есть набор видимых единиц (например, соответствующих черно-белых пикселей на изображении) и …

1
Какова ожидаемая стоимость модифицированного распределения Дирихле? (проблема интеграции)
Легко получить случайную переменную с распределением Дирихле, используя гамма-переменные с тем же параметром масштаба. Если: Xi∼Gamma(αi,β)Xi∼Gamma(αi,β) X_i \sim \text{Gamma}(\alpha_i, \beta) Потом: (X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn)(X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn) \left(\frac{X_1}{\sum_j X_j},\; \ldots\; , \frac{X_n}{\sum_j X_j}\right) \sim \text{Dirichlet}(\alpha_1,\;\ldots\;,\alpha_n) Проблема Что происходит, если параметры шкалы не равны? Xi∼Gamma(αi,βi)Xi∼Gamma(αi,βi) X_i \sim \text{Gamma}(\alpha_i, \beta_i) Тогда каково распределение этой переменной? (X1∑jXj,…,Xn∑jXj)∼?(X1∑jXj,…,Xn∑jXj)∼? \left(\frac{X_1}{\sum_j …

2
Вычисление p-значения из произвольного распределения
Надеюсь, это не глупый вопрос. Допустим, у меня есть произвольное непрерывное распределение. У меня также есть статистика, и я хотел бы использовать это произвольное распределение, чтобы получить p-значение для этой статистики. Я понимаю, что в R это легко сделать, если ваш дистрибутив соответствует одному из встроенных, как будто это нормально. …

4
Ресурсы для обучения использованию (/ созданию) динамической (/ интерактивной) статистической визуализации
Я хотел бы узнать немного больше об интерактивной визуализации данных (масштабирование, наведение, чистка, отображение точек и так далее). Буду рад любому: Учебное пособие / руководство / книга (?) / Видео о том, как использовать такие методы для статистического исследования. Указатели на хорошие / интересные интерактивные пакеты data-viz (в R и …

3
Допустимо ли анализировать данные обнаружения сигналов без использования метрик, полученных из теории обнаружения сигналов?
Эксперимент по обнаружению сигнала обычно представляет наблюдателю (или диагностической системе) либо сигнал, либо несигнал, и его просят сообщить, считают ли они представленный объект сигналом или не сигналом. Такие эксперименты дают данные, которые заполняют матрицу 2x2: Теория обнаружения сигнала представляет такие данные как представление сценария, в котором решение "сигнал / не …

2
Вменяемая ступенчатая регрессия?
Предположим, я хочу построить двоичный классификатор. У меня есть несколько тысяч функций и только несколько десятков образцов. Исходя из знания предметной области, у меня есть веские основания полагать, что метка класса может быть точно предсказана с использованием всего лишь нескольких функций, но я не знаю, какие из них. Я также …

3
Удаление факторов из таблицы ANOVA с 3 путями
В недавней статье я установил трехсторонние модели с фиксированными эффектами. Поскольку один из факторов не был значимым (p> 0,1), я удалил его и переосмыслил модель с двумя фиксированными эффектами и взаимодействием. У меня только что были комментарии судей, чтобы процитировать: Это время не было значимым фактором, поскольку трехфакторный ANOVA сам …

2
Интерпретация вывода drop1 в R
В R drop1команда выводит что-то аккуратное. Эти две команды должны получить какой-то вывод: example(step)#-> swiss drop1(lm1, test="F") Моя выглядит так: > drop1(lm1, test="F") Single term deletions Model: Fertility ~ Agriculture + Examination + Education + Catholic + Infant.Mortality Df Sum of Sq RSS AIC F value Pr(F) <none> 2105.0 190.69 …

5
Код MCMC обратимого перехода (Matlab или R)
Кто-нибудь знает какой-нибудь хорошо написанный код (в Matlab или R) для обратимого перехода MCMC? Желательно простое демонстрационное приложение для комплимента работ по теме, что было бы полезно для понимания процесса.
14 r  matlab  references  mcmc 

4
Существуют ли асимптотики третьего порядка?
Большинство асимптотических результатов в статистике доказывают, что при оценка (такая как MLE) сходится к нормальному распределению, основанному на разложении функции правдоподобия Тейлора второго порядка. Я полагаю, что в байесовской литературе есть аналогичный результат, «Байесовская центральная предельная теорема», которая показывает, что апостериорный апостериор сходится к нормали при n → ∞n→∞n→∞n \rightarrow …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.