Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Оценка байесовских параметров или проверка байесовских гипотез?
Похоже, что в байесовском сообществе продолжаются дебаты о том, следует ли нам проводить оценку байесовских параметров или проверку байесовских гипотез. Мне интересно узнать мнение по этому поводу. Каковы относительные сильные и слабые стороны этих подходов? В каких контекстах один более подходящий, чем другой? Должны ли мы проводить как оценку параметров, …

1
Расчет доверительных интервалов для режима?
Я ищу ссылки для расчета доверительных интервалов для режима (в целом). Начальная загрузка может показаться естественным первым выбором, но, как обсуждал Романо (1988), стандартная загрузка завершается неудачно для режима и не предоставляет какого-либо простого решения. Что-то изменилось с тех пор, как эта статья? Каков наилучший способ расчета доверительных интервалов для …

1
Термины «отрезанный» и «отрезанный» о функциях ACF, PACF
Я пытаюсь понять смысл отрезания и хвоста на графике временных рядов ACF и PACF. Что означает «Отрезать после задержки»? Это по поводу лимита? Что значит «Хвосты»? В приведенном выше примере книги, которую я использую для изучения, говорят, что это процесс AR. Но я не могу понять значения слов "отрубается" и …

3
Диапазон значений асимметрии и эксцесса для нормального распределения
Я хочу знать, каков диапазон значений асимметрии и эксцесса, для которых данные считаются нормально распределенными. Я прочитал много аргументов, и в основном я получил смешанные ответы. Некоторые говорят, что асимметрия и для эксцесса является приемлемым диапазоном для нормального распределения. Некоторые говорят для асимметрии является приемлемым диапазоном. Я нашел подробное обсуждение …

2
Понимание Gelman & Carlin «За пределами расчета мощности:…» (2014)
Я читаю Gelman & Carlin «Помимо вычислений мощности: оценка ошибок типа S (знак) и типа M (величина)» (2014). Я пытаюсь понять основную идею, основной путь, но я в замешательстве. Может ли кто-нибудь помочь мне понять сущность? Бумага идет примерно так (если я правильно понял). Статистические исследования по психологии часто страдают …

2
Какова вероятность розыгрыша четверки, если из колоды 52 взято 20 карт?
Вчера мы с соседями играли в карточные игры, и кто-то задал этот вопрос. Мы пытались решить проблему, но мы не могли понять это. Этим утром я проснулся и все еще не знаю, как это решить. Не могли бы вы помочь мне?

3
Надежность подобранной кривой?
Я хотел бы оценить неопределенность или надежность подобранной кривой. Я намеренно не называю точную математическую величину, которую ищу, потому что не знаю, что это. Здесь (энергия) является зависимой переменной (отклик), а V (объем) является независимой переменной. Я хотел бы найти кривую энергии-объема, E ( V ) , некоторого материала. Поэтому …

4
Что является более подходящим способом создания выносного набора: удалить некоторые предметы или удалить некоторые наблюдения от каждого предмета?
У меня есть набор данных с 26 функциями и 31000 строк. Это набор данных из 38 предметов. Это для биометрической системы. Поэтому я хочу иметь возможность определять предметы. Чтобы иметь набор для тестирования, я знаю, что должен удалить некоторые значения. Так что лучше делать и почему? (а) оставить 30 предметов …

1
Почему большой выбор K понижает мою оценку перекрестной проверки?
Играя с набором данных Boston Housing Dat и RandomForestRegressor(с параметрами по умолчанию) в scikit-learn, я заметил кое-что странное: средний балл перекрестной проверки уменьшился, когда я увеличил число сгибов выше 10. Моя стратегия перекрестной проверки была следующей: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... где num_cvsбыл изменен. …

2
Центральная предельная теорема доказательство без использования характеристических функций
Есть ли доказательство того, что CLT не использует характеристические функции, более простой метод? Может быть, методы Тихомирова или Штейна? Что-то самодостаточное, что вы можете объяснить студенту университета (первый курс по математике или физике) и занимает меньше одной страницы?

1
Выбор модели Mclust
Пакет R mclustиспользует BIC в качестве критерия выбора модели кластера. Насколько я понимаю, модель с самым низким BIC следует выбирать среди других моделей (если вы заботитесь только о BIC). Однако, когда значения BIC все отрицательные, по Mclustумолчанию используется модель с самым высоким значением BIC. Мое общее понимание от различных испытаний …

4
Сумма независимых логнормальных случайных величин оказывается логнормальной?
Я пытаюсь понять, почему сумма двух (или более) логнормальных случайных величин приближается к логнормальному распределению при увеличении количества наблюдений. Я посмотрел онлайн и не нашел никаких результатов, касающихся этого. Ясно, что если и Y являются независимыми логнормальными переменными, то по свойствам экспонент и гауссовских случайных величин X \ times Y …

3
Каковы преимущества экспоненциального генератора случайных чисел, использующего метод Аренса и Дитера (1972), а не обратным преобразованием?
Мой вопрос вдохновлен встроенным экспоненциальным генератором случайных чисел R , функцией rexp(). При попытке генерировать экспоненциально распределенные случайные числа многие учебники рекомендуют метод обратного преобразования, описанный на этой странице Википедии . Я знаю, что есть другие методы для решения этой задачи. В частности, исходный код R использует алгоритм, изложенный в …

2
Разве неправильно использовать ANOVA вместо t-критерия для сравнения двух средних?
У меня есть распределение зарплат, и я хочу сравнить разницу в средствах для мужчин и женщин. Я знаю, что есть T-тест студента для сравнения двух средств, но после предложения ANOVA я получил некоторую критику, говоря, что ANOVA предназначен для сравнения более чем двух средств. Что (если что-то) неправильно в использовании …

3
Должен ли я использовать смещение для моего Poisson GLM?
Я провожу исследование, чтобы посмотреть на различия в плотности и богатстве видов рыб при использовании двух разных методов подводной визуальной переписи. Мои данные изначально были данными подсчета, но затем они обычно меняются на плотность рыбы, но я все же решил использовать Poisson GLM, что, я надеюсь, правильно. model1 <- glm(g_den …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.