Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Могут ли (должны?) Методы регуляризации использоваться в модели случайных эффектов?
Под методами регуляризации я имею в виду лассо, ребристую регрессию, эластичную сеть и тому подобное. Рассмотрим прогностическую модель данных здравоохранения, содержащую демографические и диагностические данные, где прогнозируется продолжительность пребывания в стационаре. Для некоторых людей есть несколько наблюдений LOS (то есть, более одного эпизода IP) в течение базового периода времени, которые …

2
Как лучше всего визуализировать эффекты категорий и их распространенность в логистической регрессии?
Мне нужно представить информацию об основных предикторах голосов кандидата, используя данные опроса общественного мнения. Я выполнил логистическую регрессию, используя все переменные, которые меня интересуют, но я не могу найти хороший способ представить эту информацию. Мой клиент заботится не только о размере эффекта, но и о взаимодействии между размером эффекта и …

3
Каково соотношение равномерного и нормального распределения?
Пусть следует равномерному распределению, а - нормальному распределению. Что можно сказать о ? Есть ли для этого дистрибутив?Y XИксXXYYYИксYXY\frac X Y Я нашел соотношение двух нормалей со средним нулем Коши.

1
Распределение отношения зависимых хи-квадрат случайных величин
Предположим, что где независимы.X=X1+X2+⋯+XnX=X1+X2+⋯+Xn X = X_1 + X_2+\cdots+ X_n Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim N(0,\sigma^2) Мой вопрос, что делает распределение Z=X2X21+X22+⋯+X2nZ=X2X12+X22+⋯+Xn2 Z = \frac{X^2}{X_1^2 + X_2^2 + \cdots + X_n^2} следовать? Отсюда я знаю, что отношение двух хи-квадрат случайных величин, выраженных как соответствует распределению бета-версий. Я думаю , что это предполагает независимость …

3
Подгонка многоуровневых моделей к сложным данным обследования в R
Я ищу совет о том, как анализировать сложные данные опросов с помощью многоуровневых моделей в R. Я использовал этот surveyпакет для взвешивания неравных вероятностей выбора в одноуровневых моделях, но этот пакет не имеет функций для многоуровневого моделирования. lme4Пакет отлично подходит для многоуровневого моделирования, но это не так , что я …

1
Всегда ли существует каноническая функция связи для обобщенной линейной модели (GLM)?
В GLM предполагается скаляр YYY и θθ\theta для базового распределения с pdf еY( у| θ,τ) = ч ( у, т) опыт( θ у- A ( θ )d( τ))fY(y|θ,τ)=h(y,τ)exp⁡(θy−A(θ)d(τ))f_Y(y | \theta, \tau) = h(y,\tau) \exp{\left(\frac{\theta y - A(\theta)}{d(\tau)} \right)} Можно показать, чтоμ=E(Y)=A′(θ)μ=E⁡(Y)=A′(θ) \mu = \operatorname{E}(Y) = A'(\theta). Если функция связиg(⋅)g(⋅)g(\cdot)удовлетворяет следующему:g(μ)=θ=X′βg(μ)=θ=X′βg(\mu)=\theta …

3
Доверительный интервал для перекрестной проверки точности классификации
Я работаю над проблемой классификации, которая вычисляет показатель сходства между двумя входными рентгеновскими изображениями. Если изображения принадлежат одному человеку (метка «справа»), будет рассчитана более высокая метрика; входные изображения двух разных людей (метка «неправильно») приведут к снижению показателя. Я использовал стратифицированную 10-кратную перекрестную проверку для вычисления вероятности ошибочной классификации. Мой текущий …

1
Маргинальная модель против модели случайных эффектов - как выбрать между ними? Совет для дилетанта
При поиске любой информации о маргинальной модели и модели случайных эффектов и о том, как выбирать между ними, я нашел некоторую информацию, но это было более или менее математическое абстрактное объяснение (как, например, здесь: https: //stats.stackexchange .com / a / 68753/38080 ). Где-то я обнаружил, что наблюдаются существенные различия между …

1
Геометрическая интерпретация оценки максимального правдоподобия
Я читал книгу Франклина М. Фишера «Проблема идентификации в эконометрике », и меня смутило то, что он демонстрирует идентификацию путем визуализации функции правдоподобия. Проблема может быть упрощена как: Для регрессии , где , и - параметры. Предположим, что имеет коэффициент равный единице. Тогда функция правдоподобия в пространстве будет иметь гребень …

1
Тест Фридмана против теста Уилкоксона
Я пытаюсь оценить производительность алгоритма классификации машинного обучения под наблюдением. Наблюдения делятся на номинальные классы (2 на данный момент, однако я хотел бы обобщить это для многоклассовых проблем), составленные из 99 субъектов. Один из вопросов, на которые я бы хотел ответить, - если алгоритм демонстрирует существенную разницу в точности классификации …

1
Выборочное распределение радиуса 2D нормального распределения
Двустороннее нормальное распределение со средним и ковариационной матрицей Σ можно переписать в полярных координатах с радиусом r и углом θ . Мой вопрос: Что такое распределение выборки г , то есть расстояния от точки х до расчетного центра ˉ х с учетом ковариационной матрицы образца S ?μμ\muΣΣ\Sigmaрrrθθ\thetaр^r^\hat{r}ИксxxИкс¯x¯\bar{x}SSS Фон: Истинное расстояние …

1
Поскольку бета-дистрибутив по форме похож на бином, зачем нам бета-дистрибутив?
Похоже, что биномиальное распределение очень похоже по форме на бета-распределение, и что я могу повторно параметризовать константы в любом файле PDF, чтобы они выглядели одинаково. Итак, зачем нам бета-дистрибутив? Это для определенной цели? Благодаря!

2
Является ли ожидание таким же, как среднее?
Я делаю ML в моем университете, и профессор упомянул термин «ожидание» (E), в то время как он пытался объяснить нам некоторые вещи о гауссовских процессах. Но по тому, как он это объяснил, я понял, что E - это то же самое, что и среднее значение μ. Я правильно понял? Если …

1
Как вы проверяете эргодичность случайных процессов по пути (-ам) выборки?
Как вы проверяете эргодичность стационарных случайных процессов в широком смысле по его выборочному пути? Можем ли мы проверить эргодичность по одному пути выборки? Или нам нужно несколько примеров путей? Один из мотивов проверки эргодичности - это временные ряды, чтобы вы могли безопасно использовать среднее значение пути выборки во времени в …

2
Сглаживание лапласа и дирихле приора
В статье Википедии о сглаживании Лапласа (или аддитивном сглаживании) сказано, что с байесовской точки зрения это соответствует ожидаемому значению апостериорного распределения с использованием симметричного распределения Дирихле с параметром в качестве предшествующего значения.αα\alpha Я озадачен тем, как это на самом деле правда. Может ли кто-нибудь помочь мне понять, как эти две …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.