Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Вывести отклонение от бокса
Мне было интересно, как вывести дисперсию переменной, используя коробочный график. Возможно ли, по крайней мере, сделать вывод, если две переменные имеют одинаковую дисперсию, наблюдая их блокпост?
12 variance  boxplot 

1
Если распределение тестовой статистики является бимодальным, означает ли p-значение что-либо?
Р-значение определяется вероятностью получения тест-статистики, по крайней мере, такой же экстремальной, как и наблюдаемая, при условии, что нулевая гипотеза верна. Другими словами, P(X≥t|H0)P(X≥t|H0)P( X \ge t | H_0 ) Но что если тест-статистика является бимодальной по распределению? означает ли p-значение что-либо в этом контексте? Например, я собираюсь смоделировать некоторые бимодальные …


1
Клоппер-Пирсон для нематематиков
Мне было интересно, если кто-нибудь может объяснить мне интуицию за пределами Клоппера-Пирсона CI для пропорций. Насколько я знаю, каждый CI включает в себя дисперсию. Однако для пропорций, даже если моя пропорция равна 0 или 1 (0% или 100%), CI Клоппера-Пирсона можно рассчитать. Я попытался взглянуть на формулы, и я понимаю, …

4
Оценка плотности ядра с учетом неопределенностей
При визуализации одномерных данных обычно используется метод оценки плотности ядра для учета неправильно выбранных ширин. Если в моем одномерном наборе данных есть погрешности измерения, существует ли стандартный способ включения этой информации? Например (и простите, если мое понимание наивно), KDE сворачивает гауссовский профиль с дельта-функциями наблюдений. Это Gaussian ядро разделяется между …

2
Выявление бесполезных вопросов из анкеты
Я разрабатываю анкету. Для повышения его надежности и достоверности я хочу использовать статистические методы. Я хочу исключить вопросы, ответы на которые всегда одинаковы. Это означает, что почти все участники дали одинаковые ответы на эти вопросы. Теперь мои вопросы: Какой технический термин для таких бесполезных вопросов, ответы на которые всегда одинаковы, …

1
Не можете найти подходящую модель для подсчета данных со смешанными эффектами - ZINB или что-то еще?
У меня есть очень маленький набор данных о численности одиночной пчелы, который мне трудно анализировать. Это данные подсчета, и почти все подсчеты находятся в одной обработке, а большинство нулей в другой обработке. Есть также пара очень высоких значений (по одному на двух из шести сайтов), поэтому распределение подсчетов имеет очень …

4
Можете ли вы сравнить различные методы кластеризации в наборе данных без какой-либо базовой правды путем перекрестной проверки?
В настоящее время я пытаюсь проанализировать набор данных текстового документа, который не имеет основательной правды. Мне сказали, что вы можете использовать k-кратную перекрестную проверку для сравнения различных методов кластеризации. Однако примеры, которые я видел в прошлом, используют основную правду. Есть ли способ использовать средства K-Fold в этом наборе данных для …

1
Ягодная инверсия
У меня есть большие совокупные рыночные данные о продажах вина в США, и я хотел бы оценить спрос на некоторые высококачественные вина. Эти доли рынка были в основном получены из случайной полезной модели вида где включает в себя наблюдаемые характеристики продукта, обозначает цены продукта, - ненаблюдаемые характеристики продукта, которые влияют …

2
Статистика пиццы для масс
Короткая запись на сайте NY Times содержит факты и цифры потребления пиццы в Соединенных Штатах. Меня интересует, как статистика используется (или злоупотребляется) для предоставления информации широкой аудитории, и на основе представленной статистики возникло несколько вопросов: Если 1 из 8 американцев будет есть пиццу сегодня, значит ли это, что средний американец …

1
Рассчитать логарифмическое правдоподобие «вручную» для обобщенной нелинейной регрессии наименьших квадратов (nlme)
Я пытаюсь вычислить логарифмическую вероятность для обобщенной нелинейной регрессии наименьших квадратов для функции оптимизированной с помощью функция в пакете R , используя ковариационную матрицу дисперсии, генерируемую расстояниями на филогенетическом дереве, предполагающем броуновское движение ( из пакета). Следующий воспроизводимый код R подходит для модели gnls с использованием данных x, y и …

3
Как преобразовать лептокуротическое распределение в нормальное состояние?
Предположим, у меня есть лептокуртическая переменная, которую я хотел бы преобразовать в нормальное состояние. Какие преобразования могут выполнить эту задачу? Мне хорошо известно, что преобразование данных может быть не всегда желательным, но в качестве академической цели, предположим, что я хочу «вбить» данные в нормальное русло. Кроме того, как видно из …

4
Допущения остаточного распределения регрессии
Почему необходимо сделать предположение о распределении ошибок, т.е. ϵ i ∼ N ( 0 , σ 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , с .ϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) Почему бы не написать у я ~ Н ( Х β , сг 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , с ,yi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim …

1
Информация вне матрицы для логистической регрессии
Мне ясно и хорошо объяснено на нескольких сайтах, какую информацию дают значения на диагонали матрицы шляп для линейной регрессии. Шляпная матрица модели логистической регрессии мне менее понятна. Идентична ли она той информации, которую вы получаете из шляпной матрицы, применяя линейную регрессию? Это определение шляпной матрицы, которую я нашел в другой …

5
Как эксцесс распределения связан с геометрией функции плотности?
Куртоз - это измерение пика и плоскостности распределения. Функция плотности распределения, если она существует, может рассматриваться как кривая и имеет геометрические особенности (такие как кривизна, выпуклость, ...), связанные с ее формой. Поэтому мне интересно, связан ли эксцесс распределения с некоторыми геометрическими особенностями функции плотности, которые могут объяснить геометрический смысл эксцесса?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.