Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Какова вероятность того, что букмекерская контора неправильно оценивает шансы на футбольные матчи?
Английская футбольная команда играет серию матчей против разных противников различной способности. Букмекерская контора предлагает шансы на каждый матч относительно того, будет ли это домашняя победа, выездная победа или ничья. В течение сезона команда провела матчей и сыграла вничью из них, что больше, чем можно было ожидать из шансов.nnnkkk Какова вероятность …

4
Аналитическое решение для оценки коэффициента линейной регрессии
Я пытаюсь понять матричные обозначения и работаю с векторами и матрицами. Сейчас я хотел бы понять , как вектор коэффициентов оценки & betaβ^β^\hat{\beta} в множественной регрессии вычисляется. Основное уравнение, кажется, ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. Теперь, как бы я решил для вектораββ\beta здесь? редактировать : Подожди, я застрял. Я …

1
Есть ли название для этого типа начальной загрузки?
Рассмотрим эксперимент с несколькими участниками, каждый из которых измерен несколько раз в двух условиях. Модель смешанных эффектов может быть сформулирована (используя синтаксис lme4 ) как: fit = lmer( formula = measure ~ (1|participant) + condition ) Теперь, скажем, я хочу создать доверительные интервалы для предсказаний этой модели. Я думаю, что …

1
Есть ли простой способ объединить две модели glm в R?
У меня есть две модели логистической регрессии в R, сделанные с glm(). Они оба используют одни и те же переменные, но были созданы с использованием разных подмножеств матрицы. Есть ли простой способ получить среднюю модель, которая дает средние значения коэффициентов, а затем использовать ее с функцией предиката ()? [извините, если …

3
Неверно ли дрожать перед выполнением теста Уилкоксона?
Я написал скрипт для проверки данных, используя wilcox.test, но когда я получил результаты, все значения p были равны 1. На некоторых веб-сайтах я читал, что перед тестированием данных можно использовать джиттер (чтобы избежать связей, как они сказали), Я сделал это, и теперь у меня есть приемлемый результат. Это неправильно делать …
9 r  nonparametric  ties 

3
Корреляция Спирмена или Пирсона со шкалами Лайкерта, в которых линейность и гомоскедастичность могут быть нарушены
Я хочу провести корреляции по ряду измерений, где использовались шкалы Лайкерта. Глядя на диаграммы рассеяния, кажется, что предположения о линейности и гомоскедастичности, возможно, были нарушены. Учитывая, что, как представляется, существуют некоторые споры вокруг порядкового уровня рейтинга, приближающегося к масштабированию уровня интервала, я должен быть осторожен и использовать Rho Спирмена, а …

1
Как построить квадраты для точечных процессов, которые сильно различаются по частоте?
Я хочу выполнить анализ числа квадратов для нескольких точечных процессов (или одного отмеченного точечного процесса), чтобы затем применить некоторые методы уменьшения размерности. Метки не распределяются одинаково, то есть некоторые метки появляются довольно часто, а некоторые довольно редко. Таким образом, я не могу просто разделить свое 2D-пространство на регулярную сетку, потому …

1
Дискретные функции: доверительный интервал покрытия?
Как рассчитать покрытие дискретного интервала? Что я умею делать: Если бы у меня была непрерывная модель, я мог бы определить 95% доверительный интервал для каждого из моих прогнозируемых значений, а затем посмотреть, как часто фактические значения были в пределах доверительного интервала. Я мог бы обнаружить, что только в 88% случаев …

4
Рекомендации по численной оптимизации для статистиков
Я ищу надежную ссылку (или ссылки) на методы числовой оптимизации, предназначенные для статистиков, то есть они применили бы эти методы к некоторым стандартным выводным задачам (например, MAP / MLE в распространенных моделях). Такие вещи, как градиентный спуск (прямой и стохастический), ЭМ и его побочные эффекты / обобщения, моделируемый отжиг и …

4
Для чего используется стандартная ошибка?
Я использую учебник, который я нашел, и вычерчиваю средние значения вместе со стандартными ошибками, чтобы показать мои данные. Но у меня проблема с обсуждением результатов. Мой график такой, как показано ниже: некоторые стандартные ошибки (показанные в виде панели ошибок) сильно различаются, а некоторые очень близки к нулю.

2
Как найти отношения между различными типами событий (определяется их 2D-местоположением)?
У меня есть набор данных событий, которые произошли за тот же период времени. Каждое событие имеет тип (есть несколько разных типов, меньше десяти) и местоположение, представленное в виде 2D-точки. Я хотел бы проверить, есть ли какая-либо корреляция между типами событий, или между типом и местоположением. Например, может быть, события типа …

2
Можно ли использовать ядро ​​PCA для выбора функций?
Можно ли использовать анализ основных компонентов ядра (kPCA) для скрытого семантического индексирования (LSI) таким же образом, как используется PCA? Я выполняю LSI в R с использованием prcompфункции PCA и извлекаю функции с самыми высокими нагрузками из первых компонентов. Таким образом, я получаю функции, описывающие компонент лучше всего.ККk Я пытался использовать …

6
Какое хорошее, общее название для графика вещей по времени дня?
Мы создаем график, показывающий трафик по времени суток за определенный период. Таким образом, ось Y - это трафик, ось X - полночь, 1:00, 2:00 и т. Д. Это также могут быть дни недели. Какое общее название для этого типа диаграммы? Я придумал "диаграмму цикла". Это стандарт? Есть один? Обновить: Просто …

3
Положительное стабильное распределение в R
Положительные стабильные распределения описываются четырьмя параметрами: параметром асимметрии , параметром масштаба , параметром местоположения и т. Д. называемый индексный параметр . Когда равен нулю, распределение симметрично относительно , когда оно положительное (соответственно отрицательное), распределение смещается вправо (соответственно налево) Стабильные распределения допускают жирные хвосты, когда уменьшается.σ > 0 μ ∈ ( …

2
Как мне интерпретировать результаты теста Бреуша-Пагана?
В Rможно выполнить тест Бреуша-языческий для гетероскедастичности с помощью ncvTestфункции carпакета. Тест Брейша – Пэгана - это тип теста хи-квадрат. Как мне интерпретировать эти результаты: > require(car) > set.seed(100) > x1 = runif(100, -1, 1) > x2 = runif(100, -1, 1) > ncvTest(lm(x1 ~ x2)) Non-constant Variance Score Test Variance …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.