Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
U-тест Манна-Уитни: доверительный интервал для величины эффекта
Согласно Fritz, Моррис, и Ричлер (2011; смотри ниже), может быть вычислено как размер эффекта для Манна-Уитни U-тест с использованием формулы Это удобно мне, как я сообщить и в других случаях. Я хотел бы сообщить доверительный интервал для в дополнение к измерению величины эффекта.rrrr=zN−−√r=zN r = \frac{z}{\sqrt N} rrrrrr Вот мои …

3
Почему асимптотическая относительная эффективность теста Уилкоксона
Хорошо известно, что асимптотическая относительная эффективность (ARE) критерия Уилкоксона со знаком ранга равна 3π≈0.9553π≈0.955\frac{3}{\pi} \approx 0.955по сравнению стстудента , если данные получены из нормально распределенной популяции. Это верно как для базового теста с одним образцом, так и для варианта с двумя независимыми образцами (Уилкоксон-Манн-Уитни U). Это также АР теста Крускала-Уоллиса …

1
R: проверить нормальность остатков линейной модели - какие остатки использовать
Я хотел бы сделать W-тест Шапиро Уилка и тест Колмогорова-Смирнова на невязках линейной модели, чтобы проверить на нормальность. Мне было просто интересно, какие остатки следует использовать для этого - необработанные остатки, остатки Пирсона, студентизированные остатки или стандартизированные остатки? Для теста W Шапиро-Уилка кажется, что результаты для неочищенных и остатков Пирсона …

5
Как я могу снять временные ряды?
Как я могу снять временные ряды? Можно ли просто взять первое различие и запустить тест Дики Фуллера, и если он стационарный, у нас все хорошо? В Интернете я также обнаружил, что могу рассчитывать временные ряды, выполняя это в Stata: reg lncredit time predict u_lncredit, residuals twoway line u_lncredit time dfuller …

1
Неверный вывод, когда наблюдения не являются независимыми
Из элементарной статистики я узнал, что с общей линейной моделью, чтобы выводы были достоверными, наблюдения должны быть независимыми. Когда происходит кластеризация, независимость может больше не сохраняться, приводя к неверному выводу, если это не учитывается. Одним из способов учета такой кластеризации является использование смешанных моделей. Я хотел бы найти примерный набор …

5
Как я могу лучше всего справиться с эффектами маркеров с разными уровнями щедрости в оценке студенческих работ?
Около 600 студентов имеют оценку по обширной части оценки, которая, как можно предположить, имеет хорошую надежность / достоверность. Оценка оценивается из 100, и это тест с множественным выбором, отмеченный компьютером. У этих 600 студентов также есть оценка по второму, второстепенному, экзамену. В этой второй части оценки они разделены на 11 …

2
Пример противоречивой оценки максимального правдоподобия
Я читаю комментарий к статье, и автор заявляет, что иногда, даже если оценки (найденные по ОД или максимальному квазиликтуализму) могут быть непоследовательными, сила отношения правдоподобия или теста отношения квази-правдоподобия все еще может сходиться к 1, поскольку число наблюдаемых данных стремится к бесконечности (непротиворечивость теста). Как и когда это происходит? Вы …

1
Почему бы не всегда использовать ансамблевое обучение?
Мне кажется, что ансамблевое обучение всегда даст лучшую прогностическую эффективность, чем с одной гипотезой обучения. Итак, почему бы нам не использовать их все время? Я думаю, возможно, из-за вычислительных ограничений? (даже тогда мы используем слабые предикторы, поэтому я не знаю).

2
С помощью пакета каретки можно ли получить матрицы путаницы для конкретных пороговых значений?
Я получил модель логистической регрессии (через train) для бинарного ответа, и я получил логистическую матрицу спутанности через confusionMatrixв caret. Это дает мне путаницу в логистической модели, хотя я не уверен, какой порог используется для ее получения. Как получить матрицу путаницы для определенных пороговых значений, используя confusionMatrixin caret?

1
Как проверить, следует ли распределение степенному закону?
У меня есть данные о том, сколько пользователей публикуют сколько вопросов. Например, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... Это означает, что 2 пользователя разместили по 100 вопросов, 9 пользователей - по 10 вопросов и т. Д. Итак, как я могу определить, UserCount, QuestionCountследует ли распределение степенному …


2
Есть ли причина не использовать ортогональные многочлены при подборе регрессий?
В общем, мне интересно, если там когда-либо лучше не использовать ортогональные полиномы при подборе регрессии с переменными более высокого порядка. В частности, мне интересно с использованием R: Если poly()с raw = FALSEпроизводит то же значение, что и подогнанного poly()с raw = TRUE, и polyс raw = FALSEрешаете некоторые из проблем …

1
Почему R's lm () возвращает оценки коэффициентов, отличные от моего учебника?
Фон Я пытаюсь понять первый пример в курсе по подгонке моделей (так что это может показаться до смешного простым). Я сделал вычисления вручную, и они соответствуют примеру, но когда я повторяю их в R, коэффициенты модели отключены. Я думал, что разница может быть связана с тем, что в учебнике используется …
13 r  regression  self-study  lm 

4
Чем перекрестная проверка отличается от отслеживания данных?
Я только что закончил «Введение в статистическое обучение» . Я задавался вопросом, отличается ли использование перекрестной проверки для нахождения наилучших параметров настройки для различных методов машинного обучения от отслеживания данных? Мы неоднократно проверяем, какое значение параметра настройки дает лучший прогнозирующий результат в тестовом наборе. Что, если параметр настройки, к которому …

2
Дискретная равномерная случайная величина (?), Принимающая все рациональные значения в замкнутом интервале
У меня только что была (интеллектуальная) паническая атака. Непрерывная случайная величина, которая следует за униформой на отрезке : удобно знакомая статистическая концепция. U(a,b)U(a,b)U(a,b) Непрерывный равномерный Р., имеющий поддержку над расширенными реалами (половиной или целым): не собственно Р., а базовая байесовская концепция неправильного априорного, полезного и применимого. Дискретная униформа, принимающая конечное …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.