Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Сравнение сглаживающих сплайнов и лессов для сглаживания?
Я хочу лучше понять плюсы / минусы использования лёсса или сглаживающих сплайнов для сглаживания некоторой кривой. Другой вариант моего вопроса - есть ли способ построить сглаживающий сплайн так, чтобы он давал те же результаты, что и при использовании лёсса. Любая ссылка или понимание приветствуются.

3
Интерпретация графика невязок и подгоночных значений из регрессии Пуассона
Я пытаюсь согласовать данные с GLM (регрессия Пуассона) в R. Когда я построил графики остатков и подгоночных значений, график создал несколько (почти линейных с небольшой вогнутой кривой) «линий». Что это значит? library(faraway) modl <- glm(doctorco ~ sex + age + agesq + income + levyplus + freepoor + freerepa + …


3
Доверительный интервал для дисперсии с учетом одного наблюдения
Это проблема из «7-й Колмогоровской студенческой олимпиады по теории вероятностей»: Учитывая одно наблюдение из распределения с неизвестными обоими параметрами, задайте доверительный интервал для с уровнем достоверности не менее 99%.Нормальный ( μ , σ 2 ) σ 2XXXNormal(μ,σ2)Normal⁡(μ,σ2)\operatorname{Normal}(\mu,\sigma^2)σ2σ2\sigma^2 Мне кажется, что это должно быть невозможно. У меня есть решение, но я …

6
Каковы хорошие методы визуализации данных для сравнения распределений?
Я пишу свою кандидатскую диссертацию, и я понял, что чрезмерно полагаюсь на коробочные графики, чтобы сравнивать распределения. Какие еще альтернативы вам нравятся для решения этой задачи? Я также хотел бы спросить, знаете ли вы какой-либо другой ресурс, как галерею R, в котором я могу вдохновить себя различными идеями по визуализации …

4
Ziliak (2011) выступает против использования p-значений и упоминает некоторые альтернативы; кто они такие?
В недавней статье, обсуждающей недостатки использования p-значения для статистического вывода, под названием «Matrixx v. Siracusano and Student v. Fisher Статистическая значимость в испытании» (DOI: 10.1111 / j.1740-9713.2011.00511.x), Стивен Т. Зиляк выступает против использования р-значений. В заключительных параграфах он говорит: Данные это единственное, что мы уже знаем, и наверняка. То, что …

7
Например, почему пол обычно кодируется 0/1, а не 1/2?
Я понимаю логику кодирования для анализа данных. Мой вопрос ниже касается использования определенного кода. Есть ли причина, по которой пол часто кодируется как 0 для женщин и 1 для мужчин? Почему эта кодировка считается «стандартной»? Сравните это с Женский = 1 и Мужской = 2. Есть ли проблема с этим …

5
Зачем использовать метод Монте-Карло вместо простой сетки?
при интеграции функции или в сложном моделировании я видел, что метод Монте-Карло широко используется. Я спрашиваю себя, почему нельзя создать сетку точек, чтобы интегрировать функцию вместо рисования случайных точек. Не приведет ли это к более точным результатам?


1
Построение доверительных интервалов на основе вероятности профиля
В моих элементарных статистических данных , конечно, я узнал , как построить 95% доверительный интервал , например , как математическое ожидание, , на основе асимптотической нормальности для «больших» размеров выборок. Помимо методов передискретизации (таких как начальная загрузка), существует еще один подход, основанный на «вероятности профиля» . Может ли кто-нибудь объяснить …

2
Когда я * не * должен использовать функцию R NLM для MLE?
Я наткнулся на пару руководств, предлагающих использовать Rs nlm для оценки максимального правдоподобия. Но ни один из них (включая документацию R ) не дает большого теоретического руководства о том, когда использовать или не использовать функцию. Насколько я могу судить, nlm просто делает градиентный спуск по методике Ньютона. Существуют ли принципы, …


2
Является ли PCA нестабильным при мультиколлинеарности?
Я знаю, что в ситуации регрессии, если у вас есть набор сильно коррелированных переменных, это обычно «плохо» из-за нестабильности оценочных коэффициентов (дисперсия движется к бесконечности, так как детерминант движется к нулю). Мой вопрос заключается в том, сохраняется ли эта «плохость» в ситуации PCA. Не становятся ли коэффициенты / нагрузки / …

4
Решение проблемы неопределенности модели
Мне было интересно, как байесовцы в сообществе CrossValidated рассматривают проблему неопределенности модели и как они предпочитают с ней бороться? Я постараюсь изложить свой вопрос в двух частях: Насколько важно (по вашему опыту / мнению) иметь дело с неопределенностью модели? Я не нашел ни одной статьи, посвященной этой проблеме, в сообществе …

2
Общая линейная модель против обобщенной линейной модели (с функцией тождественной связи?)
Это мой первый пост, поэтому, пожалуйста, будьте спокойны, если я не соблюдаю некоторые стандарты! Я искал свой вопрос, и ничего не пришло. Мой вопрос касается в основном практических различий между общим линейным моделированием (GLM) и обобщенным линейным моделированием (GZLM). В моем случае это будет несколько непрерывных переменных в качестве ковариат …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.