Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Предполагает ли предположение о нормальных ошибках, что Y также является нормальным?
Если я не ошибаюсь, предполагается, что в линейной модели распределение отклика имеет систематический компонент и случайный компонент. Термин ошибки фиксирует случайную составляющую. Следовательно, если мы предположим, что термин ошибки нормально распределен, не означает ли это, что ответ также нормально распределен? Я думаю, что это так, но тогда утверждения, подобные приведенному …

1
Как бороться с чрезмерной дисперсией в пуассоновской регрессии: квази-правдоподобие, отрицательный биномиальный GLM или случайный эффект на уровне субъекта?
Я натолкнулся на три предложения по поводу чрезмерной дисперсии в переменной отклика Пуассона и стартовой модели с фиксированными эффектами: Используйте квази-модель; Используйте отрицательный биномиальный GLM; Используйте смешанную модель со случайным эффектом на уровне объекта. Но какой на самом деле выбрать и почему? Есть ли какой-то фактический критерий среди них?

1
Доказать связь между расстоянием Махаланобиса и кредитным плечом?
Я видел формулы в Википедии. которые касаются расстояния Махаланобиса и плеча: Расстояние Махаланобиса тесно связано со статистикой кредитного плеча , но имеет другой масштаб: D ^ 2 = (N - 1) (h - \ tfrac {1} {N}).hhhD2=(N−1)(h−1N).D2=(N−1)(h−1N).D^2 = (N - 1)(h - \tfrac{1}{N}). В связанной статье Википедия описывает hhh в …

2
Плюсы и минусы лог-ссылки в сравнении с идентификационной ссылкой для регрессии Пуассона
Я выполняю регрессию Пуассона с конечной целью сравнения (и взятия разности) предсказанного среднего значения между двумя уровнями фактора в моей модели: , удерживая другие модельные ковариаты (которые являются двоичными) постоянными. Мне было интересно, если кто-нибудь может дать несколько практических советов о том, когда использовать ссылку на журнал, а не ссылку …

2
Регрессия, когда каждая точка имеет свою собственную неопределенность как по и по
Я сделал измерений двух переменных и . Они оба имеют известные неопределенности и связанные с ними. Я хочу найти связь между и . Как мне это сделать?x y σ x σ y x ynnnxxxyyyσxσx\sigma_xσyσy\sigma_yxxxyyy РЕДАКТИРОВАТЬ : каждый имеет различные связанные с ним, и то же самое с .σ x , …

2
Когда подходит логистическая регрессия?
В настоящее время я учу себя, как делать классификацию, и, в частности, я смотрю на три метода: опорные векторные машины, нейронные сети и логистическая регрессия. Я пытаюсь понять, почему логистическая регрессия будет лучше, чем две другие. Исходя из моего понимания логистической регрессии, идея состоит в том, чтобы подогнать логистическую функцию …

1
Каков наиболее подходящий способ преобразования пропорций, когда они являются независимой переменной?
Я думал, что понял эту проблему, но теперь я не так уверен, и я хотел бы проверить с другими, прежде чем продолжить. У меня есть две переменные, Xи Y. Yявляется отношением, и оно не ограничено 0 и 1 и обычно нормально распределено. Xявляется пропорцией, и он ограничен 0 и 1 …

1
PDF квадрата стандартной нормальной случайной величины [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 4 года назад . У меня есть эта проблема, где я должен найти PDF . Все, что я знаю, это то, что имеет …

2
Ожидание максимума переменных iid Gumbel
Я продолжаю читать в экономических журналах о конкретном результате, используемом в случайных полезных моделях. Одна из версий результата: if Gumbel ( , то:ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, μ,1),∀iμ,1),∀i\mu, 1), \forall i E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), где γ≈0.52277γ≈0.52277\gamma \approx 0.52277 - постоянная Эйлера- Машерони . Я …

2
Различные определения AIC
Из Википедии есть определение информационного критерия Акаике (AIC) как , где - число параметров, а \ log L - логарифмическая вероятность модели.k log LAIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkkжурналLlog⁡L\log L Тем не менее, наша эконометрика отмечает в уважаемом университете, что А яС= журнал( σ^2) + 2 ⋅ кTAIC=log⁡(σ^2)+2⋅kT …

2
Плохо обусловленная ковариационная матрица в регрессии ГП для байесовской оптимизации
Предпосылки и проблемы Я использую Гауссовские процессы (GP) для регрессии и последующей байесовской оптимизации (BO). Для регрессии я использую пакет gpml для MATLAB с несколькими пользовательскими модификациями, но проблема общая. Общеизвестно, что когда два входных тренинга находятся слишком близко к входному пространству, ковариационная матрица может стать неположительной (на этом сайте …

2
Сумма рейтинговых баллов по сравнению с оценочными факторными баллами?
Мне было бы интересно получить предложения о том, когда использовать « факторные баллы » над простой суммой баллов при построении шкал. Т.е. «уточненные» над «неочищенными» методами оценки фактора. Из DiStefano et al. (2009; pdf ), акцент добавлен: Существует два основных класса методов вычисления коэффициента: уточненный и не уточненный. Не уточненные …

3
Почему важно проводить различие между «линейной» и «нелинейной» регрессией?
Какова важность различия между линейными и нелинейными моделями? Вопрос Нелинейная и обобщенная линейная модель: как вы относитесь к логистической, пуассоновской и т. Д. Регрессии? и его ответ был чрезвычайно полезным разъяснением линейности / нелинейности обобщенных линейных моделей. Кажется критически важным отличить линейные от нелинейных моделей, но мне не понятно почему? …

2
Действительно ли теорема Слуцкого остается в силе, когда две последовательности сходятся к невырожденной случайной величине?
Я запутался в некоторых деталях о теореме Слуцкого : Пусть , - две последовательности скалярных / векторных / матричных случайных элементов.{Xn}{Xn}\{X_n\}{Yn}{Yn}\{Y_n\} Если сходится по распределению к случайному элементу а сходится по вероятности к константе , то при условии, что обратим, где обозначает сходимость в распределении.XnXnX_nXXXYnYnY_ncccXn+Yn XnYn Xn/Yn →d X+c→d cX→d …

1
Специальное распределение вероятностей
Если - это распределение вероятностей с ненулевыми значениями на , для какого типа (типов) существует константа такая, что для всех ?p(x)p(x)p(x)[0,+∞)[0,+∞)[0,+\infty)p(x)p(x)p(x)c>0c>0c\gt 0∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^20<ϵ<10<ϵ<10\lt\epsilon\lt 1 Вышеуказанное неравенство на самом деле является дивергенцией Кульбака-Лейблера между распределением и его сжатой версией . Я обнаружил, что это неравенство справедливо для распределений …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.