Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как интерпретировать результаты, когда гребень и лассо по отдельности работают хорошо, но дают разные коэффициенты
Я использую регрессионную модель с Лассо и Риджем (для прогнозирования дискретной переменной результата в диапазоне от 0 до 5). Перед запуском модели я использую SelectKBestметод, scikit-learnчтобы уменьшить набор функций с 250 до 25 . Без первоначального выбора признаков и Лассо, и Ридж уступают более низким показателям точности [что может быть …

2
Среднее геометрическое является объективной оценкой среднего, непрерывное распределение которого?
Существует ли какое-либо непрерывное распределение, выражаемое в замкнутой форме, среднее значение которого таково, что среднее геометрическое для выборок является объективной оценкой для этого среднего значения? Обновление: я только что понял, что мои образцы должны быть положительными (иначе геометрическое среднее может не существовать), поэтому, возможно, непрерывный - не то слово. Как …

1
Вариационный вывод на простом английском
Посмотрев видео на YouTube, я чувствую, что не могу точно определить, что такое вариационный вывод. Я могу следовать процедурам, пока смотрю видео лекции об этом. Но сложно определить, что на самом деле. Надеюсь услышать об этом.

2
Чтение сюжетов типа «ящик с усами»: возможно ли выявить существенные различия между группами?
Предположим, что мы смотрим на этот сюжет с рамками и усами: Между четвергом и пятницей, я думаю, большинство согласится с тем, что, похоже, существенная разница во времени сна. Это статистически обоснованная гипотеза? Можем ли мы заметить существенные различия из-за того, что ни один из диапазонов внутреннего квартиля не перекрывается между …

2
Если вы не можете сделать это ортогонально, сделайте это необработанно (полиномиальная регрессия)
При выполнении полиномиальной регрессии для на люди иногда используют необработанные полиномы, иногда ортогональные полиномы. Но когда они используют то, что кажется совершенно произвольным.YYYИксИксX Здесь и здесь используются сырые полиномы. Но здесь и здесь ортогональные полиномы, кажется, дают правильные результаты. Что, как, почему ?! В противоположность этому, когда вы узнаете о …

6
Основные ссылки на MCMC для Байесовской статистики
Я ищу некоторые статьи или книги с практическими и теоретическими примерами об основных MCMC для байесовской статистики (с R). Я никогда не изучал симуляцию, и поэтому я ищу "основную" информацию. Можете ли вы дать мне несколько рекомендаций или советов?

1
Обобщающие оценки на SVM
Меня интересуют теоретические результаты для обобщающей способности машин опорных векторов, например, оценки вероятности ошибки классификации и размерности Вапника-Червоненкиса (VC) этих машин. Однако, читая литературу, у меня сложилось впечатление, что некоторые похожие повторяющиеся результаты имеют тенденцию незначительно отличаться от автора к автору, особенно в отношении технических условий, необходимых для выполнения определенной …

2
Контролируемое обучение с неопределенными данными?
Существует ли существующая методология применения контролируемой модели обучения к неопределенному набору данных? Например, скажем, у нас есть набор данных с классами A и B: +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | 50% | | 3 | 1 | B …

2
Если усадка применяется умным способом, всегда ли она работает лучше для более эффективных оценщиков?
Предположим, у меня есть два оценщика и которые являются согласованными оценками одного и того же параметра и такого, что с в смысле psd. Таким образом, асимптотически более эффективен, чем . Эти две оценки основаны на различных функциях потерь. β 2β0√βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0V1≤V2 β 1 β 2n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 …

1
Обратная проблема дня рождения: ни одна пара из 1 миллиона иностранцев не разделяет день рождения; какова их продолжительность года?
Предположим, планета с очень очень длинным годом дней. На вечеринке в комнате 1 миллион пришельцев, и ни у кого нет дня рождения. Что можно сделать из размера ?NNNNNNN (Этот более компактный вопрос заменяет этот плохо сформулированный. )

1
Логистическая регрессия для данных из распределений Пуассона
Из некоторых заметок машинного обучения, говорящих о некоторых дискриминационных методах классификации, в частности о логистической регрессии, где у - метка класса (0 или 1), а х - данные, говорится, что: если x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0) и x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 \sim \mathrm{Poisson}(λ_1) , то p(y|x)p(y|x)p(y|x) будет логистическим. Почему это правда?

2
Пространственное представление состояний ARMA (p, q) из Гамильтона
Я читал главу 13 Гамильтона, и у него есть следующее представление пространства состояний для ARMA (p, q). Пусть Затем процесс ARMA (p, q) выглядит следующим образом: \ begin {align} y_t - \ mu & = \ phi_1 (y_ {t-1} - \ mu) + \ phi_2 (y_ {t-2} - \ mu) …

2
Что происходит с отношением правдоподобия, когда все больше и больше данных собирается?
Пусть еff , граммgg и часhh быть плотность и предположим, что Икся∼ чxi∼hx_i \sim h , i ∈ Ni∈Ni \in \mathbb{N} . Что происходит с отношением правдоподобия Πя = 1Nе( хя)грамм( хя)∏i=1nf(xi)g(xi) \prod_{i=1}^n \frac{f(x_i)}{g(x_i)} приn → ∞n→∞n \rightarrow \infty? (Это сходится? К чему?) Например, мы можем предположить, что ч = …

3
Контрпримеры, где Медиана находится за пределами [Mode-Mean]
Эта статья выше моей лиги, но в ней говорится о теме, которая меня интересует, о связи между средним, модой и медианой. Это говорит: Широко распространено мнение, что медиана унимодального распределения «обычно» между средним и модой. Однако это не всегда так ... Мой вопрос : может ли кто-нибудь привести примеры непрерывных …
11 mean  median  mode 

2
Как начать строить регрессионную модель, когда наиболее сильно ассоциированный предиктор является двоичным
У меня есть набор данных, содержащий 365 наблюдений трех переменных, а именно pm, tempи rain. Теперь я хочу проверить поведение pmв ответ на изменения в двух других переменных. Мои переменные: pm10 = Ответ (зависимый) temp = предиктор (независимый) rain = предиктор (независимый) Ниже приведена корреляционная матрица для моих данных: > …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.