Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как выбрать хорошую рабочую точку из точных кривых отзыва?
Существует ли какой-либо стандартный метод определения «оптимальной» рабочей точки на кривой точного возврата ? (то есть, определение точки на кривой, которая предлагает хороший компромисс между точностью и отзывом) благодаря

3
Как сгенерировать равномерно распределенные точки в шаре 3-го блока?
Я разместил предыдущий вопрос , это связано, но я думаю, что лучше начать другую тему. На этот раз мне интересно, как создать равномерно распределенные точки внутри сферы 3-х единиц и как проверить распределение визуально и статистически? Я не вижу размещенных там стратегий, которые можно напрямую перенести на эту ситуацию.

2
Как обрабатывать несуществующие (не пропущенные) данные?
Я никогда не нашел ни одного хорошего текста или примеров того, как обрабатывать «несуществующие» данные для входов в какой-либо классификатор. Я много читал о пропущенных данных, но что можно сделать с данными, которые не могут или не существуют в отношении многомерных входных данных. Я понимаю, что это очень сложный вопрос, …

1
Среднеквадратичное значение против среднего абсолютного отклонения?
И Root Mean Square и Среднее абсолютное отклонение , кажется , как меры по величине изменчивости (особенно , когда переменные являются анолитом и -ve). Каковы правила большого пальца, чтобы выбрать один из них над другим?

1
Анализ мощности для анализа выживания
Если я предполагаю, что генная сигнатура идентифицирует субъектов с более низким риском рецидива, то есть снижение на 0,5 (коэффициент риска 0,5) частоты событий у 20% населения, и я намерен использовать образцы из ретроспективного когортного исследования. размер выборки необходимо скорректировать на неравные числа в двух гипотетических группах? Например, используя Collett, D: …

2
Использование пуассоновской регрессии для непрерывных данных?
Можно ли использовать распределение Пуассона для анализа как непрерывных, так и дискретных данных? У меня есть несколько наборов данных, в которых переменные ответа являются непрерывными, но напоминают распределение Пуассона, а не нормальное распределение. Однако распределение Пуассона является дискретным распределением и обычно связано с числами или счетами.

1
Прогнозирование процессов с длинной памятью
Я работаю с процессом с двумя состояниями с в дляИксTИксTx_t{ 1 , - 1 }{1,-1}\{1, -1\}t = 1 , 2 , …Tзнак равно1,2,...t = 1, 2, \ldots Функция автокорреляции указывает на процесс с длинной памятью, т. Е. Отображает затухание степенного закона с показателем степени <1. Вы можете смоделировать аналогичные ряды …

2
Прогнозы на 1 шаг вперед с пакетом dynlm R
Я установил модель с несколькими независимыми переменными, одна из которых - задержка зависимой переменной, используя пакет dynlm. Предполагая, что у меня есть прогнозы на 1 шаг вперед для моих независимых переменных, как мне получить прогнозы на 1 шаг вперед для моих зависимых переменных? Вот пример: library(dynlm) y<-arima.sim(model=list(ar=c(.9)),n=10) #Create AR(1) dependant …

3
Интерпретация значений p, полученных с помощью критерия Левена или Бартлетта для однородности дисперсий
Я провел тест Левена и Бартлетта по группам данных из одного из моих экспериментов, чтобы подтвердить, что я не нарушаю допущение ANOVA об однородности дисперсий. Я хотел бы уточнить у вас, ребята, что я не делаю неправильных предположений, если вы не возражаете: D Значение p, возвращаемое обоими этими тестами, является …

6
Прогнозирование после запуска функции mlogit в R
Вот что я хочу сделать, но, похоже, нет predictспособа для mlogit. Любые идеи? library(mlogit) data("Fishing", package = "mlogit") Fish <- mlogit.data(Fishing, varying = c(2:9), shape = "wide", choice = "mode") Fish_fit<-Fish[-1,] Fish_test<-Fish[1,] m <- mlogit(mode ~price+ catch | income, data = Fish_fit) predict(m,newdata=Fish_test)

2
Как можно построить непрерывный непрерывный взаимодействия в ggplot2?
Допустим, у меня есть данные: x1 <- rnorm(100,2,10) x2 <- rnorm(100,2,10) y <- x1+x2+x1*x2+rnorm(100,1,2) dat <- data.frame(y=y,x1=x1,x2=x2) res <- lm(y~x1*x2,data=dat) summary(res) Я хочу построить непрерывное непрерывное взаимодействие так, чтобы x1 находился на оси X, а x2 был представлен 3 строками, одна из которых представляет x2 при Z-значении 0, одна при …

2
Какие вещи я могу предсказать с помощью наивного байесовского классификатора?
Я новичок в статистике (прошел только один курс колледжа), но у меня есть опыт программирования. Я только начал играть с библиотекой байесовских классификаторов для Ruby, и я ищу идеи для вещей для анализа. Прямо сейчас я возиться с категоризацией Tweet, но у вас есть какие-нибудь идеи? Что еще более важно, …

2
Обнаружить изменения во временных рядах
Я наткнулся на изображение прототипа приложения, которое обнаруживает значительные изменения («тренды», а не всплески / выбросы) в данных трафика: Я хочу написать программу (Java, опционально R), способную делать то же самое, но поскольку мои навыки статистики немного устарели, мне нужно снова углубиться в эту тему. Какой подход / алгоритм я …

5
Измерение регрессии до среднего значения при попадании в дома
Любой, кто следит за бейсболом, скорее всего, слышал о непонятном выступлении в стиле MVP в Торонто Жозе Баутиста. За четыре года до этого он совершил около 15 хоумранов за сезон. В прошлом году он ударил 54, число превзошло только 12 игроков в истории бейсбола. В 2010 году ему заплатили 2,4 …
11 r  regression  modeling 

4
Как представить выигрыш в объясненной дисперсии благодаря соотношению Y и X?
Я ищу, как (визуально) объяснить простую линейную корреляцию для студентов первого курса. Классический способ визуализации - построить график рассеяния Y ~ X с прямой линией регрессии. Недавно мне пришла в голову идея расширить этот тип графики, добавив к графику еще 3 изображения, оставив мне: график рассеяния y ~ 1, затем …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.