Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Почему связи непросты в непараметрической статистике?
Мой непараметрический текст, Практическая непараметрическая статистика , часто дает четкие формулы для ожиданий, отклонений, статистики тестов и т. П., Но содержит предостережение о том, что это работает, только если мы игнорируем связи. При расчете U-статистики Манна-Уитни рекомендуется отбрасывать связанные пары при сравнении, какая больше. Я понимаю, что эти связи мало …

4
Расчет AUPR в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 7 месяцев назад . Легко найти область вычисления пакета в ROC, но есть ли пакет, который вычисляет площадь под кривой точного возврата?

2
Может ли кто-то пролить свет на линейные и нелинейные смешанные эффекты?
Я собираюсь погрузиться в изучение R, и мой учебный проект повлечет за собой применение регрессии со смешанными или случайными эффектами к набору данных для разработки прогностического уравнения. Я разделяю озабоченность автора в этом посте Как выбрать библиотеку nlme или lme4 R для моделей со смешанными эффектами? задаваясь вопросом, является ли …

3
Оценка численности населения по частоте выборки дубликатов и уникальных
Есть веб-сервис, где я могу запросить информацию о случайном предмете. Для каждого запроса каждый элемент имеет равные шансы на возврат. Я могу продолжать запрашивать предметы и записывать количество дубликатов и уникальных. Как я могу использовать эти данные для оценки общего количества товаров?

1
Получение общей (в пределах класса + между классами) матрицы рассеяния
Я возился с методами PCA и LDA, и я застрял в какой-то момент, у меня такое ощущение, что это так просто, что я не вижу этого. Матрицы рассеяния внутри класса ( ) и между классами ( S B ) определяются как:SWSWS_WSBSBS_B SW=∑i=1C∑t=1N(xit−μi)(xit−μi)TSW=∑i=1C∑t=1N(xti−μi)(xti−μi)T S_W = \sum_{i=1}^C\sum_{t=1}^N(x_t^i - \mu_i)(x_t^i - \mu_i)^T SB=∑i=1CN(μi−μ)(μi−μ)TSB=∑i=1CN(μi−μ)(μi−μ)T …


2
Модель для оценки плотности населения
База данных (население, площадь, форма) может быть использована для отображения плотности населения путем назначения постоянной величины населения / площади для каждой фигуры (которая является многоугольником, таким как блок переписи, участок, округ, штат и т. Д.). Однако популяции обычно не равномерно распределены по своим полигонам. Дасиметрическое отображение - это процесс уточнения …

2
Объяснить корректировку модели на простом английском
Читая о методах и результатах статистического анализа, особенно в эпидемиологии, я очень часто слышу о корректировке или контроле моделей. Как бы вы объяснили не статистику цель этого? Как вы интерпретируете свои результаты после контроля определенной переменной? Небольшой проход в Stata или R, или указатель на один онлайн, станет настоящим украшением.

1
Как определить размер выборки, необходимый для повторного измерения ANOVA?
Мне нужна помощь по повторному измерению ANOVA. Мы изучаем влияние некоторых вмешательств на снижение частоты инфицирования кровотоком (BSI) в некоторых отделениях. Мы планируем собирать информацию о скорости BSI ежемесячно, сначала 12 месяцев без вмешательства, а затем 12 месяцев с вмешательством. Мы думаем о проведении временного ряда или повторного измерения ANOVA, …

5
Смещение к натуральным числам в случае наименьших квадратов
Почему мы стремимся минимизировать, x^2а не минимизировать |x|^1.95или |x|^2.05. Есть ли причины, по которым число должно быть ровно двумя, или это просто соглашение, которое имеет преимущество в упрощении математики?

1
Как энтропия зависит от местоположения и масштаба?
Энтропии непрерывного распределения с функцией плотности fff определяются как негатив ожидания log(f),log⁡(f),\log(f), и , следовательно , равны ЧАСе= - ∫∞- ∞журнал( ф( х ) ) е( х ) д х .Hf=−∫−∞∞log⁡(f(x))f(x)dx.H_f = -\int_{-\infty}^{\infty} \log(f(x)) f(x)\mathrm{d}x. Мы также говорим, что любая случайная величина ИксXX , распределение которой имеет плотность еff имеет …

3
Где находится бомба: как оценить вероятность, исходя из общего количества строк и столбцов?
Этот вопрос вдохновлен мини-игрой от Pokemon Soulsilver: Представьте, что в этой области 5х6 спрятано 15 бомб (РЕДАКТИРОВАТЬ: максимум 1 бомба / клетка): Теперь, как бы вы оценили вероятность найти бомбу на определенном поле, учитывая итоги строки / столбца? Если вы посмотрите на столбец 5 (всего бомб = 5), то вы …

3
Как я могу подогнать сплайн к данным, которые содержат значения и 1/2 производные?
У меня есть набор данных, который содержит, скажем, некоторые измерения для положения, скорости и ускорения. Все приходят от одного и того же «бега». Я мог бы построить линейную систему и подогнать полином для всех этих измерений. Но могу ли я сделать то же самое со сплайнами? Что такое способ «R»? …

5
Случайный лес и алгоритм дерева решений
Случайный лес - это набор деревьев решений, следующих концепции бэгинга. Когда мы переходим от одного дерева решений к следующему дереву решений, то как информация, полученная с помощью последнего дерева решений, переходит к следующему? Потому что, насколько я понимаю, нет ничего лучше обученной модели, которая создается для каждого дерева решений и …

1
Существует ли байесовская интерпретация для REML?
Доступна ли байесовская интерпретация REML? На мой взгляд, REML имеет сильное сходство с так называемыми эмпирическими процедурами байесовской оценки, и мне интересно, была ли продемонстрирована какая-то асимптотическая эквивалентность (скажем, при некотором подходящем классе приоров). Как эмпирические байесовские, так и REML выглядят как «скомпрометированные» подходы к оценке, предпринятые, например, с учетом …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.