Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как развить интуицию для условной вероятности?
В видео-лекциях из Гарвардского журнала « Статистика 110: вероятность», которые можно найти в iTunes и YouTube, я столкнулся с этой проблемой. Я попытался обобщить это здесь: Предположим, нам дают случайную двухкарточную комбинацию из стандартной колоды. Какова вероятность того, что обе карты являются тузами, если у нас есть хотя бы один …

1
Должен ли я использовать t-тест для сильно искаженных данных? Научное доказательство, пожалуйста?
У меня есть образцы из сильно искаженного (похожего на экспоненциальный дистрибутив) набора данных об участии пользователей (например, количество постов), которые имеют разные размеры (но не менее 200), и я хочу сравнить их среднее значение. Для этого я использую непарные t-тесты с двумя образцами (и t-тесты с коэффициентом Уэлча, когда образцы …

2
Как подобрать модель смеси для кластеризации
У меня есть две переменные - X и Y, и мне нужно сделать кластер максимальным (и оптимальным) = 5. Давайте идеальный график переменных выглядит следующим образом: Я хотел бы сделать 5 кластеров из этого. Что-то вроде этого: Таким образом, я думаю, что это смешанная модель с 5 кластерами. Каждый кластер …

2
Вывод нормализующего преобразования для GLM
\newcommand{\E}{\mathbb{E}} Как нормализует преобразование A ( ⋅ ) = ∫ d uВ 1 / 3 ( μ )A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} для экспоненциального семейства получен? Более конкретно : я пытался следовать расширительному эскизу Тэйлор на странице 3, слайд- здесь , но есть несколько вопросов. С ИксXX из экспоненциального семейства, преобразованием ч …

2
P-значения, равные 0 в тесте перестановки
У меня есть два набора данных, и я хотел бы знать, значительно ли они различаются или нет (это происходит из « Две группы существенно различаются? Тест для использования »). Я решил использовать тест перестановки, выполнив в R следующее: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna <- …

4
Насколько странно кластер авиационных происшествий?
Оригинальный вопрос (25.07.14): Имеет ли смысл эта цитата из новостных СМИ или есть лучший статистический способ просмотра потока недавних авиационных происшествий? Однако Барнетт также обращает внимание на теорию распределения Пуассона, которая подразумевает, что короткие интервалы между авариями на самом деле более вероятны, чем длинные. «Предположим, что в среднем происходит один …

1
Регрессия в настройке
Я пытаюсь понять, следует ли использовать регрессию гребня , LASSO , регрессию главных компонентов (PCR) или частичные наименьшие квадраты (PLS) в ситуации, когда имеется большое количество переменных / признаков ( ) и меньшее количество выборок ( ) и моя цель - прогноз.ппpп < рN<пn nр > 10 нп>10Np>10n Переменные ( …

1
Имеет ли смысл проводить односторонний тест Колмогорова-Смирнова?
Имеет ли смысл и возможно ли выполнить односторонний тест KS? Какой будет нулевая гипотеза такого теста? Или тест KS по своей сути является двусторонним тестом? Мне был бы полезен ответ, который помог мне понять распределение D (я работаю через статью Масси 1951 года и нахожу описание сложным, например, и - …

3
Мое распределение нормальное; Тест Колмогорова-Смирнова не согласен
У меня проблема с нормальностью некоторых данных, которые у меня есть: я выполнил тест Колмогорова, который говорит, что он ненормален с p = .0000, я не понимаю: асимметрия моего распределения = -. 497, и эксцесс = -0,024 Вот график моего распространения, который выглядит очень нормально ... (У меня есть три …

3
Прогнозирование дисперсии гетероскедастических данных
Я пытаюсь сделать регрессию на гетероскедастических данных, где я пытаюсь предсказать отклонения ошибки, а также средние значения в терминах линейной модели. Что-то вроде этого: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} Словом, данные состоят из повторных измерений при различных значениях и . Я …

3
Предложения по обучению с учетом затрат в крайне несбалансированной среде
У меня есть набор данных с несколькими миллионами строк и ~ 100 столбцов. Я хотел бы обнаружить около 1% примеров в наборе данных, которые относятся к общему классу. У меня есть ограничение минимальной точности, но из-за очень асимметричной стоимости я не слишком заинтересован в каком-либо конкретном отзыве (пока у меня …

1
Тезаурус для статистики и терминов машинного обучения
Существует ли справочный тезаурус для статистики и терминов машинного обучения? Я знаю, что статьи в Википедии часто содержат синонимы, но я хотел бы иметь простой тезаурус, через который я мог бы легко пройти (вместо полной энциклопедии), чтобы убедиться, что я знаю весь жаргон.

2
Хребетная регрессия - байесовская интерпретация
Я слышал, что регрессия гребня может быть получена как среднее значение апостериорного распределения, если адекватно выбран априор. Является ли интуиция тем, что ограничения, установленные ранее для коэффициентов регрессии (например, стандартные нормальные распределения около 0), идентичны / заменяют штраф, установленный для квадрата размера коэффициентов? Должен ли априор быть гауссовым, чтобы эта …

1
Что значит объяснить дисперсию?
В частности, мне интересно, почему у нас есть концепция множественного R (которую я могу понять как корреляция между наблюдаемыми и прогнозируемыми оценками при множественной регрессии), а затем отдельное понятие R-квадрат, представляющее собой просто квадрат или R. Мне сообщили, что R-квадрат - это объясненное изменение в процентах, а R - нет, …

1
Уменьшение Джини и примеси Джини у детей
Я работаю над критерием важности функции Джини для случайного леса. Следовательно, мне нужно рассчитать уменьшение Джини примеси в узле. Вот как я это делаю, что приводит к конфликту с определением, предполагающим, что я где-то ошибаюсь ... :) Для бинарного дерева и с учетом вероятностей левого и правого потомков я могу …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.