Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Является ли регрессия x на y явно лучше, чем y на x в этом случае?
Прибор, используемый для измерения уровня глюкозы в крови человека, контролируется на случайной выборке из 10 человек. Уровни также измеряются с использованием очень точной лабораторной процедуры. Мера инструмента обозначается х. Мера лабораторной процедуры обозначается у. Я лично считаю, что y на x более правильное, потому что намерение состоит в том, чтобы …

3
Взвешенная обобщенная регрессия в BUGS, JAGS
В R«предварительном весе» мы можем glmрегрессировать через параметр весов . Например: glm.D93 <- glm(counts ~ outcome + treatment, family = poisson(), weights=w) Как это можно сделать в JAGSили BUGSмодели? Я нашел некоторые документы, обсуждающие это, но ни один из них не дает пример. Меня интересуют в основном примеры Пуассона и …

2
Почему трудно учитывать неопределенность в случайных эффектах при прогнозировании по смешанным моделям?
В R-sig-ME есть несколько потоков о получении доверительных интервалов для прогнозов с использованием lme4и nlmeв R. Например, здесь и здесь, в 2010 году, включая некоторые комментарии Дугалса Бейтса, одного из авторов обоих пакетов. Я стесняюсь цитировать его дословно, так как боюсь, что их вырвут из контекста, но в любом случае …

3
Должен ли выбор функций выполняться только для данных обучения (или всех данных)?
Должен ли выбор функций выполняться только для данных обучения (или всех данных)? Я прошел через некоторые обсуждения и документы, такие как Guyon (2003) и Singhi and Liu (2006) , но все еще не был уверен в правильном ответе. Моя экспериментальная установка выглядит следующим образом: Набор данных: 50 здоровых контрольных пациентов …

2
Добавление случайного эффекта влияет на оценки коэффициентов
Меня всегда учили, что случайные эффекты влияют только на дисперсию (ошибку), а фиксированные эффекты влияют только на среднее значение. Но я нашел пример, где случайные эффекты влияют и на среднее значение - оценку коэффициента: require(nlme) set.seed(128) n <- 100 k <- 5 cat <- as.factor(rep(1:k, each = n)) cat_i <- …

3
Сокращение размеров всегда теряет некоторую информацию?
Как видно из названия, всегда ли уменьшение размеров теряет некоторую информацию? Рассмотрим для примера PCA. Если у меня очень мало данных, я бы предположил, что может быть найдена «лучшая кодировка» (это как-то связано с рангом данных?), И ничего не будет потеряно.

4
Сходимость весов нейронной сети
Я попал в ситуацию, когда веса моей нейронной сети не сходятся даже после 500 итераций. Моя нейронная сеть содержит 1 входной слой, 1 скрытый слой и 1 выходной слой. Это около 230 узлов на входном слое, 9 узлов на скрытом слое и 1 выходной узел на выходном слое. Я хотел …

2
Исследование матрицы рассеяния для многих переменных
Я анализирую набор данных со многими параметрами (скажем, 50-200), и мне интересно посмотреть на связи между переменными (например, с точки зрения диаграмм рассеяния с 2 переменными или гистограмм 2d). Однако для этого количества параметров кажется невозможным нарисовать массив графиков 200х200 (если я не распечатал его и не повесил на стену). …

1
Сравнение распределений производительности обобщения
Скажем, у меня есть два метода обучения для задачи классификации , и , и что я оцениваю их эффективность обобщения с помощью чего-то вроде повторной перекрестной проверки или начальной загрузки. Из этого процесса я получаю распределение оценок и для каждого метода по всем этим повторениям (например, распределение значений ROC AUC …

1
Корректировка значения p для локальной статистики Морана I (LISA)
Я работаю с некоторым исследовательским пространственным анализом в R с использованием пакета spdep. Я наткнулся на вариант настройки p- значений локальных показателей пространственной ассоциации (LISA), рассчитанных с помощью localmoranфункции. Согласно документам он нацелен на: ... корректировка значения вероятности для нескольких тестов. Далее в документации p.adjustSPя читал, что доступны следующие варианты: …

1
Что делает неравенство Хеффдинга важной статистической концепцией?
В своем блоге Ларри Вассерман опубликовал пост о том, что он планировал освещать в курсе прошлой осенью. Он отмечает, что отказывается от некоторых классических тем в пользу более современных проблем. Одна тема, которую он упоминает, - это неравенство Хоффдинга. Что делает этот результат особенно важным для студентов и практиков?

3
Каковы статистические причины определения индекса ИМТ как вес / рост
Возможно, на этот вопрос есть ответ в медицине, но есть ли статистические причины, по которым индекс ИМТ рассчитывается как ? Почему бы, например, просто ? Моя первая идея заключается в том, что это как-то связано с квадратичной регрессией.weight/height2weight/height2\text{weight}/\text{height}^2weight/heightweight/height\text{weight}/\text{height} Выборка реальных данных (200 человек с весом, ростом, возрастом и полом): structure(list(Age …

3
Многоуровневая модель против отдельных моделей для каждого уровня
Каковы преимущества и недостатки использования отдельных моделей по сравнению с многоуровневым моделированием? В частности, предположим, что в ходе исследования были изучены пациенты, размещенные в рамках практики врачей, расположенных в разных странах. Каковы преимущества / недостатки использования отдельных моделей для каждой страны по сравнению с трехуровневой вложенной моделью?

1
Исследование устойчивости логистической регрессии к нарушению линейности логита
Я провожу логистическую регрессию с бинарным исходом (старт и не старт). Все мои предикторы - это либо непрерывные, либо дихотомические переменные. Используя подход Бокса-Тидвелла, один из моих непрерывных предикторов потенциально нарушает предположение о линейности логита. В статистике соответствия качества нет никаких признаков того, что подбор проблематичен. Впоследствии я снова запустил …

3
Прогнозирование функции плотности
Я делаю некоторые исследования о прогнозировании временных рядов функций плотности вероятности. Мы стремимся прогнозировать PDF с учетом исторически наблюдаемого (обычно оценочного) PDF. Метод прогнозирования, который мы разрабатываем, довольно хорошо работает в симуляционных исследованиях. Однако мне нужен числовой пример из реальных приложений, чтобы проиллюстрировать наш метод дальше. Итак, есть ли подходящие …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.