Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
AR (1) процесс с гетероскедастическими ошибками измерения
1. Проблема У меня есть некоторые измерения переменного ytyty_t , где t=1,2,..,nt=1,2,..,Nt=1,2,..,n , для которого у меня есть распределение fyt(yt)fyt(yt)f_{y_t}(y_t) полученное с помощью MCMC, которое для простоты я предполагаю, что это гауссиан среднего μtμt\mu_t и дисперсии σ2tσt2\sigma_t^2 . У меня есть физическая модель для этих наблюдений, скажем, g(t)g(t)g(t) , но …

3
Нужен алгоритм для вычисления относительной вероятности того, что данные являются выборкой из нормального и логнормального распределения
Допустим, у вас есть набор значений, и вы хотите знать, более ли вероятно, что они были выбраны из гауссова (нормального) распределения или из логнормального распределения? Конечно, в идеале вы должны были бы что-то знать о населении или об источниках экспериментальной ошибки, поэтому имели бы дополнительную информацию, полезную для ответа на …

1
С k-кратной перекрестной проверкой, усредняете ли вы все моделей для построения окончательной модели?
При выполнении перекрестной проверки в k-кратном размере я понимаю, что вы получаете метрики точности, указывая все сгибы, кроме одного, на один сгиб и делаете прогнозы, а затем повторяете этот процесс раз. Затем вы можете запустить метрики точности для всех ваших экземпляров (точность, отзыв,% классифицированы правильно), которые должны быть такими же, …

1
Расчет ICC для случайных эффектов логистической регрессии
Я использую модель логистической регрессии в форме: lmer(response~1+(1|site), family=binomial, REML = FALSE) Обычно я рассчитываю ICC на основе перехвата и остаточных отклонений, но сводка модели не включает остаточное отклонение. Как мне рассчитать это?

3
Когда подходит z-преобразование Фишера?
Я хочу проверить выборочную корреляцию на значимость, используя p-значения, то естьrrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. Я понял, что могу использовать z-преобразование Фишера для вычисления zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) и найти значение р по p=2P(Z>zobs)p=2P(Z>zobs)p = 2P\left(Z>z_{obs}\right) используя стандартное нормальное распределение. Мой вопрос: насколько велико должно быть чтобы …

4
Боксплотный эквивалент для дистрибутивов с тяжелыми хвостами?
Для приблизительно нормально распределенных данных коробочные диаграммы - отличный способ быстро визуализировать медиану и распространение данных, а также присутствие любых выбросов. Однако для распределений с более тяжелыми хвостами многие точки показаны как выбросы, поскольку выбросы определяются как находящиеся вне фиксированного коэффициента IQR, и это, конечно, происходит намного чаще с распределениями …

4
Является ли какое-либо количественное свойство населения «параметром»?
Я относительно знаком с различием между терминами статистика и параметр. Я вижу статистику как значение, полученное от применения функции к образцу данных. Однако большинство примеров параметров относятся к определению параметрического распределения. Типичным примером является среднее значение и стандартное отклонение для параметризации нормального распределения или коэффициентов и дисперсии ошибок для параметризации …

2
Линейная и нелинейная регрессия
У меня есть набор значений и которые теоретически связаны экспоненциально:xxxyyy y=axby=axby = ax^b Одним из способов получения коэффициентов является применение натуральных логарифмов с обеих сторон и подгонка линейной модели: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Другой способ получить это - использовать нелинейную регрессию, учитывая …

3
Выбор статистического теста на основе результатов другого (например, нормальность)
Итак, я слышал, что было сказано, что не стоит выбирать один статистический тест на основе результатов другого. Это кажется странным для меня, хотя. Например, люди часто предпочитают использовать непараметрический тест, когда какой-то другой тест предполагает, что остатки обычно не распределяются. Этот подход кажется довольно широко принятым, но, похоже, не согласуется …

1
При построении регрессионной модели с использованием отдельных наборов моделирования / валидации уместно ли «рециркулировать» данные валидации?
Предположим, у меня есть 80/20 раскол между наблюдениями моделирования / валидации. Я приспособил модель к набору данных моделирования, и меня устраивает ошибка, которую я вижу в наборе данных проверки. Прежде чем развернуть мою модель для оценки будущих наблюдений, уместно ли объединить валидацию с данными моделирования, чтобы получить обновленные оценки параметров …

1
Случайный лес и прогноз
Я пытаюсь понять, как работает Random Forest. У меня есть представление о том, как строятся деревья, но я не могу понять, как Random Forest делает прогнозы на выборке из сумки. Может ли кто-нибудь дать мне простое объяснение, пожалуйста? :)

1
Структурные уравнения: как задать эффекты взаимодействия в пакете R lavaan
Я использую R-пакет Lavaan для оценки модели структурного уравнения. Допустим, модель состоит из 1 эндогенной манифестной переменной с 1 скрытой и 2 манифестными объясняющими переменными: group = {0,1} attitude1 = latent,scale age = respondent's age Тогда желаемая модель лавы (не работает): model <- ' attitude1 =~ att1 + att2 + …
13 r  interaction  sem  lavaan 

1
Стандартизированная зависимая переменная в группе в моделях данных панели?
Имеет ли смысл стандартизация зависимой переменной в идентифицирующей группе? В следующем рабочем документе (замедление вырубки лесов в Legal Amazon; цены или политика ?, pdf ) используется стандартизированная зависимая переменная для анализа влияния общих изменений политики в Бразилии на вырубку лесов. Стандартизация осуществляется следующим образом: Yn e wя т= Yя т- …

4
Соответствие показателя склонности данным панели
У меня есть продольные данные о людях, и некоторые из них подвергались лечению, а другие - нет. Все люди находятся в выборке от рождения до 18 лет, и лечение происходит в каком-то возрасте между этими интервалами. Возраст лечения может отличаться в разных случаях. Используя сопоставление баллов предрасположенности, я хотел бы …

2
Когда регистрировать / расширять ваши переменные при использовании моделей с произвольным лесом?
Я делаю регрессию, используя случайные леса для прогнозирования цен на основе нескольких атрибутов. Код написан на Python с использованием Scikit-learn. Как вы решаете, должны ли вы преобразовывать свои переменные, используя exp/ logперед тем, как использовать их для соответствия регрессионной модели? Обязательно ли это при использовании ансамблевого подхода, такого как Random …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.