Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
статистический тест, чтобы увидеть, является ли связь линейной или нелинейной
У меня есть пример данных, установленных следующим образом: Volume <- seq(1,20,0.1) var1 <- 100 x2 <- 1000000 x3 <- 30 x4 = sqrt(x2/pi) H = x3 - Volume r = (x4*H)/(H + Volume) Power = (var1*x2)/(100*(pi*Volume/3)*(x4*x4 + x4*r + r*r)) Power <- jitter(Power, factor = 1, amount = 0.1) plot(Volume,Power) …

2
Показатель эффективности классификатора, который сочетает в себе чувствительность и специфичность?
У меня есть данные с двумя классами, для которых я выполняю классификацию, используя несколько классификаторов. И наборы данных хорошо сбалансированы. Оценивая работу классификаторов, я должен учитывать, насколько точен классификатор при определении не только истинных положительных моментов, но и истинных отрицательных. Поэтому, если я использую точность, и если классификатор смещен в …

3
Рекомендации для начинающего учителя (Введение в биостатистику)
Этой осенью я преподаю свой первый класс (Введение в биостатистику). У кого-нибудь есть предложения по обучению статистике лучше? Возможно, какой-нибудь пример, который вы хотели бы использовать своему первому учителю? Я использую Принципы биостатистики Пагано и Говро. РЕДАКТИРОВАТЬ ДЕТАЛИ Этот класс представляет собой онлайн-класс, который проводится два раза в неделю по …

1
Хорошие, полезные и характерные эксперименты для (оптимального) статистического планирования экспериментов
Существует больше явлений, к которым может быть применен экспериментальный дизайн, чем альтернативных допустимых стратегий проектирования. Это должно быть правдой, хотя есть много способов правильно спланировать эксперимент. Каковы лучшие «проблемы», которые действительно демонстрируют ценность и нюанс для различных типов оптимального дизайна экспериментов? (A, D, E, C, V, фи, ....) Можете ли …

5
Как измерить производительность классификатора, когда почти 100% меток класса принадлежат одному классу?
В моих данных, у меня есть переменная класса, обозначенная как . Значения переменных этого класса: (двоичные). Почти все наблюдения равны 0 (близко к 100%, точнее 97%). Я хотел бы провести тест производительности на разных классификационных моделях (это может быть точность). Чего я боюсь, так это того, что если у меня …

2
Путаница, связанная с выборкой Гиббса
Я наткнулся на эту статью, где говорится, что в выборке Гиббса принимается каждый образец. Я немного смущен. Как получится, если каждый принятый образец сходится к стационарному распределению. В общем Алгоритм Метрополиса мы принимаем как min (1, p (x *) / p (x)), где x * - точка выборки. Я предполагаю, …

1
Использование процентилей в качестве предикторов - хорошая идея?
Я думаю о проблеме, которая заключается в прогнозировании журнала (расходов) клиента с использованием линейной регрессии. Я рассматриваю, какие функции использовать в качестве входных данных, и задаюсь вопросом, будет ли нормально использовать процентиль переменной в качестве входных данных. Например, я мог бы использовать доход компаний в качестве входных данных. Мне интересно, …

1
R / Caret: обучающие и тестовые наборы против перекрестной проверки?
Это может быть, возможно, глупый вопрос, но при создании модели с каретой и использовании чего-то вроде LOOCVили (даже более точно) LGOCV, какая польза от разделения данных на наборы обучающих и тестовых наборов, если это, по сути, шаг перекрестной проверки в любом случае? Я прочитал некоторые из связанных вопросов, и они …

2
Добавление весов для сильно искаженных наборов данных в логистической регрессии
Я использую стандартную версию логистической регрессии для подгонки моих входных переменных к двоичным выходным переменным. Однако в моей задаче отрицательные выходы (0 с) намного превосходят положительные (1 с). Соотношение составляет 20: 1. Поэтому, когда я обучаю классификатор, кажется, что даже функции, которые настоятельно предполагают возможность положительного результата, все еще имеют …

3
LDA против персептрона
Я пытаюсь понять, как LDA «вписывается» в другие контролируемые методы обучения. Я уже прочитал некоторые из сообщений LDA-esque здесь о LDA. Я уже знаком с персептроном, но сейчас изучаю LDA. Как LDA «вписывается» в семейство контролируемых алгоритмов обучения? Каковы могут быть его недостатки по сравнению с этими другими методами, и …

2
AIC, ошибка anova: модели не все соответствуют одному и тому же количеству наблюдений, модели не все соответствуют одному и тому же размеру набора данных
У меня есть такие модели: require(nlme) set.seed(123) n <- 100 k <- 5 cat <- as.factor(rep(1:k, n)) cat_i <- 1:k # intercept per kategorie x <- rep(1:n, each = k) sigma <- 0.2 alpha <- 0.001 y <- cat_i[cat] + alpha * x + rnorm(n*k, 0, sigma) plot(x, y) m1 …
9 r  mixed-model  aic 

1
Термин взаимодействия с использованием центрированных переменных иерархического регрессионного анализа? Какие переменные мы должны центрировать?
Я провожу анализ иерархической регрессии, и у меня есть несколько небольших сомнений: Мы вычисляем член взаимодействия, используя центрированные переменные? Нужно ли центрировать ВСЕ непрерывные переменные, которые есть в наборе данных, кроме зависимой переменной? Когда мы должны регистрировать некоторые переменные (потому что их sd намного выше их среднего значения), мы тогда …

4
Если у меня много положительных, незначительных результатов, могу ли я проверить «хотя бы
Допустим, я провел одну и ту же регрессию для 100 разных людей по отдельности. Мои коэффициенты интереса положительны (и весьма отличаются друг от друга), но статистически незначимы во всех 100 результатах (скажем, каждое значение p = 0,11). Есть ли способ объединить эти p-значения, чтобы сделать вывод, что «по меньшей мере …

2
Как лучше всего обрабатывать подсчета в мета-анализе?
Я провожу мета-анализ величин эффекта d в R с использованием пакета metafor. d представляет различия в показателях памяти между пациентами и здоровыми. Однако в некоторых исследованиях сообщается только о подсчетах интересующей меры d (например, несколько разных показателей памяти или оценки трех отдельных блоков тестирования памяти). Пожалуйста, смотрите следующий фиктивный набор …

2
Как единообразный априор приводит к одинаковым оценкам по максимальной вероятности и моде апостериорного?
Я изучаю различные методы оценки по точкам и читаю, что при использовании оценок MAP и ML, когда мы используем «единообразный априор», оценки идентичны. Может ли кто-нибудь объяснить, что такое «равномерный» априор, и привести несколько (простых) примеров, когда оценки MAP и ML будут одинаковыми?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.