Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Классификаторы машинного обучения Big-O или сложности
Чтобы оценить производительность нового алгоритма классификатора, я пытаюсь сравнить точность и сложность (большое в обучении и классификации). Из машинного обучения: обзор Я получаю полный список контролируемых классификаторов, а также таблицу точности между алгоритмами и 44 задачи тестирования из репозитория данных UCI . Тем не менее, я не могу найти обзор, …

1
Как Карл Пирсон придумал статистику хи-квадрат?
Как Пирсон придумал следующую статистику хи-квадрат Пирсона в 1900 году? что K∼χ2K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} K∼χ2K∼χ2 K \sim \chi^2 Имел ли он в виду хи-квадрат и разрабатывал метрику (подход снизу вверх), или он придумывал статистику и позже доказывал, что она следует распределению хи-квадрат (сверху вниз)?KKK Я хочу знать, …

3
Как рассчитать перекрытие между эмпирическими плотностями вероятности?
Я ищу метод для расчета области перекрытия между двумя оценками плотности ядра в R, как мера сходства между двумя выборками. Чтобы уточнить, в следующем примере мне нужно было бы количественно определить площадь области пурпурного перекрытия: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) …

1
В чем разница между коэффициентами регрессии и коэффициентами частичной регрессии?
Я прочитал в Abdi (2003), что Когда независимые переменные попарно ортогональны, влияние каждой из них на регрессию оценивается путем вычисления наклона регрессии между этой независимой переменной и зависимой переменной. В этом случае (т. Е. Ортогональность IV) коэффициенты частичной регрессии равны коэффициентам регрессии. Во всех остальных случаях коэффициент регрессии будет отличаться …

1
Функции стоимости для контекстных бандитов
Я использую vowpal wabbit для решения проблемы контекстуального бандита . Я показываю рекламу пользователям, и у меня есть достаточно информации о контексте, в котором показывается реклама (например, кто такой пользователь, на каком сайте он находится и т. Д.). Похоже, это довольно классическая контекстная проблема бандитов, описанная Джоном Лэнгфордом . В …

3
Обучение, тестирование, валидация в задачах анализа выживания
Я просматривал различные темы здесь, но не думаю, что на мой точный вопрос дан ответ. У меня есть набор данных из ~ 50 000 студентов и их время для отсева. Я собираюсь выполнить пропорциональную регрессию рисков с большим количеством потенциальных ковариат. Я также собираюсь провести логистическую регрессию по отсеву / …

2
Распределение свертки квадратов нормальных и хи-квадрат переменных?
Следующая проблема возникла недавно при анализе данных. Если случайная величина X следует нормальному распределению, а Y следует распределению χ2nχn2\chi^2_n (с n dof), как распределяется Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2 ? До сих пор я придумал ПРВ Y2Y2Y^2 : ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& \frac{\partial F(\sqrt{x})}{\partial x} \\ &=& \left( \int_0^{\sqrt{x}} \frac{t^{n/2-1}\cdot e^{-t/2}}{2^{n/2}\Gamma(n/2)} …

3
Лучшее программное обеспечение для визуализации данных с открытым исходным кодом для использования с PowerPoint
Какое программное обеспечение для визуализации данных с открытым исходным кодом является лучшим? Мне требуется следующее: Может импортировать данные из Microsoft Excel (импорт данных из баз данных Oracle тоже был бы хорош, но это не обязательно). Графики, созданные с помощью программного обеспечения, могут быть экспортированы в Microsoft PowerPoint (копирование и вставка …

1
Проверка на разницу между двумя эмпирическими дискретными распределениями
У меня есть тестовые данные, где у меня есть несколько больших выборок из дискретных распределений, которые я использую в качестве эмпирических распределений. Я хочу проверить, действительно ли дистрибутивы отличаются и какова разница в тех дистрибутивах, которые на самом деле отличаются. Поскольку они являются дискретными распределениями, я понимаю, что критерий Колмогорова-Смирнова …

1
Можно ли рекомендовать книгу Бернхэма-Андерсона о многомодельном выводе?
В связи с недавним изменением статистики выбора модели по умолчанию в пакете прогноза R с AIC на AICc, мне любопытно, действительно ли последнее применимо везде, где первое. У меня есть ряд вопросов на этот счет, и вот первый. Я знаю, что заменять AIC на AICc везде - это то, что …

4
С точки зрения байесовской вероятности, почему 95% доверительный интервал не содержит истинного параметра с 95% вероятностью?
Со страницы Википедии о доверительных интервалах : ... если доверительные интервалы построены по многим отдельным анализам данных повторных (и, возможно, различных) экспериментов, доля таких интервалов, которые содержат истинное значение параметра, будет соответствовать уровню достоверности ... И с той же страницы: Доверительный интервал не предсказывает, что истинное значение параметра имеет конкретную …

3
Оценивая в задаче купонного взыскателя
В одном из вариантов проблемы сборщика купонов вы не знаете количество купонов и должны определить это на основе данных. Я буду называть это проблемой печенья с предсказанием: Принимая во внимание неизвестное количество отдельных сообщений cookie состояния удачи , оцените , отбирая по одному печенье cookie и посчитав, сколько раз каждое …

1
Проверка отношения правдоподобия - lmer R - Не вложенные модели
В настоящее время я рассматриваю некоторые работы и наткнулся на следующее, что мне кажется неправильным. Две смешанные модели установлены (в R), используя lmer. Модели не являются вложенными и сравниваются с помощью тестов отношения правдоподобия. Короче, вот воспроизводимый пример того, что у меня есть: set.seed(105) Resp = rnorm(100) A = factor(rep(1:5,each=20)) …

1
Как извлечь случайные выборки из непараметрического оценочного распределения?
У меня есть выборка из 100 точек, которые являются непрерывными и одномерными. Я оценил его непараметрическую плотность, используя методы ядра. Как я могу получить случайные выборки из этого предполагаемого распределения?

3
Можно ли восстановить нормальное распределение по размеру выборки, а также по минимальным и максимальным значениям? Я могу использовать среднюю точку для прокси среднего
Я знаю, что это может быть немного странно, статистически, но это моя проблема. У меня много данных о диапазоне, то есть минимальный, максимальный и размер выборки переменной. Для некоторых из этих данных у меня также есть среднее, но не много. Я хочу сравнить эти диапазоны друг с другом, чтобы количественно …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.