Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Результаты регрессии хребта отличаются при использовании lm.ridge и glmnet
Я применил некоторые данные, чтобы найти лучшее решение переменных регрессионной модели с использованием регрессии гребня в R. Я использовал lm.ridgeи glmnet(когда alpha=0), но результаты сильно отличаются, особенно когда lambda=0. Предполагается, что оба оценщика параметров имеют одинаковые значения. Итак, в чем здесь проблема? наилучшие пожелания

1
Документ о выполнении проверки гипотез на основе результатов другого теста
Хорошо известно, что выбор статистического теста на основе результатов другого статистического теста проблематичен, поскольку значения p трудно или невозможно интерпретировать (например, выбор статистического теста на основе результатов другого (например, нормальности) ) , Тем не менее, это все еще стандартная практика во многих приложениях и, как правило, не замечается и не …

5
Вероятность того, что непрерывная случайная величина принимает фиксированную точку
Я нахожусь во вводном классе статистики, в котором функция плотности вероятности для непрерывных случайных величин была определена как . Я понимаю, что интеграл от но я не могу исправить это своей интуицией непрерывной случайной величины. Скажем, X является случайной величиной, равной количеству минут от времени t, когда поезд прибывает. Как …

1
Для каких распределений некоррелированность подразумевает независимость?
Проверенное временем напоминание в статистике «некоррелированность не означает независимость». Обычно это напоминание дополняется психологически успокаивающим (и с научной точки зрения правильным) утверждением «когда, тем не менее, две переменные совместно распределены нормально , тогда некоррелированность подразумевает независимость». Я могу увеличить количество счастливых исключений с одного до двух: когда две переменные распределены …

1
Оценка наклона прямой части сигмовидной кривой
Я получил эту задачу и был поставлен в тупик. Коллега попросил меня оценить и следующего графика: х л о ж е гИксу р р е гxupperx_{upper}Иксл о ж е гxlowerx_{lower} Кривая на самом деле является кумулятивным распределением, а х является своего рода измерениями. Ему интересно знать, каковы соответствующие значения на …

1
Интервал прогнозирования = вероятный интервал?
Мне интересно, если интервал прогнозирования и вероятный интервал оценивают одно и то же. Например, при линейной регрессии, когда вы оцениваете интервал прогнозирования подобранных значений, вы оцениваете пределов интервала, в котором вы ожидаете, что ваше значение упадет. В противоположность доверительному интервалу вы фокусируете внимание не на параметре распределения, таком как среднее …

2
Надежна ли рандомизация с небольшими выборками?
Джером Корнфилд написал: Одним из лучших плодов фишерианской революции была идея рандомизации, и статистики, согласившиеся с несколькими другими моментами, по крайней мере согласились с этим. Но, несмотря на это согласие и несмотря на широкое использование процедур рандомизированного распределения в клинических и других формах экспериментов, его логический статус, то есть точная …

1
Гиперприорная плотность для иерархической модели Гамма-Пуассона
В иерархической модели данных где на практике типичным является выбор значений ( , что среднее значение и дисперсия гамма-распределения примерно соответствуют среднему значению и дисперсии данных (например, Clayton and Kaldor, 1987 "Эмпирические байесовские оценки стандартизированных по возрасту относительных рисков для картирования заболеваний", " Биометрия" ). Очевидно, что это только специальное …

1
Понимание вывода начальной загрузки, выполненной в R (tsboot, MannKendall)
У меня есть вопрос, касающийся интерпретации вызова tsboot в R. Я проверил документацию как Kendall, так и загрузочного пакета, но я не умнее, чем раньше. Когда я запускаю бутстрап, используя, например, пример из пакета Kendall, где статистикой теста является тау Кендалла: library(Kendall) # Annual precipitation entire Great Lakes # The …
11 r  bootstrap 

2
Как работает «ступенчатая регрессия»?
Я использовал следующий код R, чтобы соответствовать пробитной модели: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') Я хочу знать, что делает stepwiseи backward/forwardделает именно и как выбрать переменные?

2
Как программы типа BUGS / JAGS автоматически определяют условные распределения для выборки Гиббса?
Похоже, что полные условия часто довольно трудно получить, но программы, такие как JAGS и BUGS, получают их автоматически. Может кто-нибудь объяснить, как они алгоритмически генерируют полные условия для любой произвольной спецификации модели?

2
Как получить объединенные p-значения в тестах, выполненных в нескольких вмененных наборах данных?
Используя Amelia в R, я получил несколько вмененных наборов данных. После этого я выполнил повторный тест в SPSS. Теперь я хочу объединить результаты испытаний. Я знаю, что могу использовать правила Рубина (реализованные через любой пакет множественного вменения в R) для объединения средств и стандартных ошибок, но как мне объединить p-значения? …

1
Усреднение точности и отзыв при использовании перекрестной проверки
Я выполнил классификацию с использованием нескольких классификаторов для данных, помеченных для двух классов, и использовал пятикратную перекрестную проверку. Для каждого сгиба я вычислял tp, tn, fp и fn. Затем я рассчитал точность, точность, отзыв и F-показатель для каждого теста. Мой вопрос заключается в том, что, когда я хочу усреднить результаты, …

4
Как выбрать количество деревьев в обобщенной регрессионной модели?
Есть ли стратегия выбора количества деревьев в GBM? В частности, ntreesаргумент в R«S gbmфункции. Я не понимаю, почему вы не должны устанавливать ntreesмаксимально разумное значение. Я заметил, что большее количество деревьев явно уменьшает изменчивость результатов от нескольких GBM. Я не думаю, что большое количество деревьев приведет к переоснащению. есть идеи?

2
В каких настройках доверительные интервалы не улучшатся с увеличением размера выборки?
В сообщении в блоге я обнаружил, что «Я полагаю, что WG Cochrane первым указал (примерно 1970-е годы), что при доверительных интервалах в условиях наблюдений малые размеры выборки приводят к лучшему охвату при достаточно больших выборках, обеспечивающих практически нулевое покрытие! Теперь я предполагаю, что ширина CI должна приближаться к 0 с …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.