Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Моделирование сходимости по вероятности к константе
Асимптотические результаты не могут быть подтверждены компьютерным моделированием, потому что они являются утверждениями, включающими понятие бесконечности. Но мы должны иметь возможность почувствовать, что вещи действительно идут так, как нам подсказывает теория. Рассмотрим теоретический результат Итn → ∞п( | XN| >ϵ)=0,ε > 0ИтN→∞п(|ИксN|>ε)знак равно0,ε>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 где ИксNИксNX_n …

1
Какова взаимосвязь между показателями надежности шкалы (альфа Кронбаха и т. Д.) И нагрузками компонентов / факторов?
Допустим, у меня есть набор данных с оценками по множеству пунктов вопросника, которые теоретически состоят из меньшего числа шкал, как в исследовании психологии. Я знаю, что общий подход здесь состоит в том, чтобы проверять надежность весов, используя альфа-версию Кронбаха или что-то подобное, затем агрегировать элементы в весах, чтобы сформировать оценки …

3
K-кратная или удерживающая перекрестная проверка для регрессии гребня с использованием R
Я работаю над перекрестной проверкой прогноза моих данных с 200 субъектами и 1000 переменных. Меня интересует регрессия гребня, поскольку число переменных (которые я хочу использовать) больше, чем количество выборок. Поэтому я хочу использовать оценки усадки. Ниже приведены примеры данных: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) …

2
Как найти оптимальные значения параметров настройки в бустинге деревьев?
Я понимаю, что в модели деревьев повышения есть 3 параметра настройки, т.е. количество деревьев (количество итераций) параметр усадки количество разбиений (размер каждого составляющего дерева) У меня вопрос: для каждого из параметров настройки, как мне найти его оптимальное значение? А какой метод? Обратите внимание: параметр усадки и параметр количества деревьев работают …

1
анова тип III тест для GLMM
Я подгоняю glmerмодель в lme4пакете R. Я ищу таблицу anova с показанным в ней значением p, но я не могу найти пакет, который подходит ей. Возможно ли сделать это в R? Модель, которая мне подходит, имеет форму: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

1
Как glmnet справляется с избыточной дисперсией?
У меня есть вопрос о том, как смоделировать текст поверх данных подсчета, в частности, как я могу использовать эту lassoтехнику для сокращения возможностей. Скажем, у меня есть N онлайн статей и количество просмотров страниц для каждой статьи. Я извлек 1-грамм и 2-грамм для каждой статьи, и я хотел провести регрессию …

4
Помогите интерпретировать сюжет взаимодействия?
У меня проблемы с интерпретацией графиков взаимодействия, когда есть взаимодействие между двумя независимыми переменными. Следующие графики с этого сайта: Здесь и - независимые переменные, а - зависимая переменная.B D VAAABBBDVDVDV Вопрос: есть взаимодействие и основной эффект , но нет основного эффектаBAAABBB Я могу видеть , что чем выше значение , …

1
Власть в протеомике?
Гранты часто требуют анализа мощности для поддержки предложенного размера выборки. В протеомике (и большей части -омики) есть 100–1000 функций / переменных, измеренных на 10 образцах (возможно, 100 с, но маловероятно). Кроме того, известно, что некоторые из этих единиц измерения (например, спектральные числа белков) обычно не распределены, и поэтому мы будем …

5
Логистическая регрессия на больших данных
У меня есть набор данных около 5000 функций. Для этих данных я сначала использовал тест Chi Square для выбора функции; после этого я получил около 1500 переменных, которые показали связь значимости с переменной отклика. Теперь мне нужно приспособить логистическую регрессию к этому. Я использую пакет glmulti для R (пакет glmulti …

1
Почему нельзя обобщить критерий Колмогорова-Смирнова на 2 или более измерения?
Вопрос говорит обо всем. Я читал, что нельзя обобщить KS до измерения, равного или большего, чем два , и что известные реализации, подобные этой в Числовых Рецептах , просто неверны. Не могли бы вы объяснить, почему это так?

1
Какой дистрибутив использовать для моделирования времени чтения веб-страницы?
У меня есть функция, которая возвращает среднее время ожидания для веб-пользователя. Таким образом, он дает среднее время, в течение которого средний пользователь может оставаться на веб-странице, учитывая длину веб-ресурса в словах. Я хочу использовать эту функцию (и итоговое среднее значение) в сочетании с дистрибутивом для моделирования «среднего веб-пользователя», просматривающего Интернет. …

1
Модель линейной регрессии, которая лучше всего подходит для данных с ошибками
Я ищу алгоритм линейной регрессии, который наиболее подходит для данных, чья независимая переменная (x) имеет постоянную ошибку измерения, а зависимая переменная (y) имеет ошибку, зависящую от сигнала. Изображение выше иллюстрирует мой вопрос.

2
Оценка параметров с помощью обобщенных линейных моделей
По умолчанию, когда мы используем glmфункцию в R, она использует метод итеративно перевешиваемых наименьших квадратов (IWLS), чтобы найти оценку максимального правдоподобия параметров. Теперь у меня есть два вопроса. Гарантируют ли оценки IWLS глобальный максимум функции правдоподобия? Основываясь на последнем слайде в этой презентации, я думаю, что нет! Я просто хотел …

2
Почему остатки Пирсона из отрицательной биномиальной регрессии меньше, чем из пуассоновской регрессии?
У меня есть эти данные: set.seed(1) predictor <- rnorm(20) set.seed(1) counts <- c(sample(1:1000, 20)) df <- data.frame(counts, predictor) Я провел пуассоновскую регрессию poisson_counts <- glm(counts ~ predictor, data = df, family = "poisson") И отрицательная биноминальная регрессия: require(MASS) nb_counts <- glm.nb(counts ~ predictor, data = df) Затем я рассчитал для …

3
Как включить
Я хочу включить термин ИксИксx и его квадрат Икс2Икс2x^2 (переменные предиктора) в регрессию, потому что я предполагаю, что низкие значения ИксИксx положительно влияют на зависимую переменную, а высокие значения оказывают отрицательное влияние. Икс2Икс2x^2 должен захватить эффект более высоких значений. Поэтому я ожидаю, что коэффициент ИксИксx будет положительным, а коэффициент Икс2Икс2x^2 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.