Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Увеличение числа функций приводит к снижению точности, но увеличению предварительного / повторного вызова
Я новичок в машинном обучении. В настоящее время я использую классификатор Наивного Байеса (NB), чтобы классифицировать небольшие тексты в 3 классах как положительные, отрицательные или нейтральные, используя NLTK и python. Проведя несколько тестов с набором данных, состоящим из 300 000 экземпляров (16 924 положительных, 7 477 отрицательных и 275 599 …

9
Может ли стандартное отклонение неотрицательных данных превышать среднее значение?
У меня есть триангулированные трехмерные сетки. Статистика для областей треугольника: Мин 0,000 Макс 2341,141 Среднее 56,317 Стандартное отклонение 98.720 Итак, означает ли это что-нибудь особенно полезное в отношении стандартного отклонения или предполагает наличие ошибок при его расчете, когда цифры работают, как указано выше? Районы, безусловно, далеки от нормального распределения. И, …

6
Как обнаружить значительное изменение данных временных рядов из-за изменения «политики»?
Я надеюсь, что это правильное место, чтобы опубликовать это, я подумал разместить его на скептиках, но я думаю, они просто скажут, что исследование было статистически неверным. Меня интересует обратная сторона вопроса, как правильно это сделать. На веб-сайте Quantified Self автор опубликовал результаты эксперимента по определенному показателю производительности, измеренному с течением …

5
Что такое хороший ресурс, который включает в себя сравнение плюсов и минусов различных классификаторов?
Какой самый лучший из двух классификаторов из коробки? Да, я думаю, это вопрос на миллион долларов, и да, я знаю теорему об отсутствии бесплатного обеда , и я также прочитал предыдущие вопросы: Каков наилучший двухклассный классификатор для вашего приложения? и худший классификатор Тем не менее, мне интересно читать больше на …

1
Как построить функцию ступеней лестницы с помощью ggplot?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. У меня есть график, как это: R код для его генерации: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, …

1
Собственные функции матрицы смежности временного ряда?
Рассмотрим простой временной ряд: > tp <- seq_len(10) > tp [1] 1 2 3 4 5 6 7 8 9 10 мы можем вычислить матрицу смежности для этого временного ряда, представляющего временные связи между выборками. При вычислении этой матрицы мы добавляем воображаемый сайт в момент времени 0, а связь между …

3
Как я могу оценить вероятность того, что случайный член из одной популяции «лучше», чем случайный член из другой популяции?
Предположим, у меня есть выборки из двух разных групп населения. Если я измерил, сколько времени требуется каждому члену для выполнения задачи, я могу легко оценить среднее значение и дисперсию каждой популяции. Если я теперь выдвигаю гипотезу о случайном спаривании с одним человеком из каждой популяции, могу ли я оценить вероятность …

4
Как генерировать случайные автокоррелированные двоичные данные временных рядов?
Как я могу генерировать двоичные временные ряды, такие что: Указана средняя вероятность наблюдения 1 (скажем, 5%); Условная вероятность наблюдения 1 в момент времени учетом значения в момент времени (скажем, 30%, если значение равно 1)?т - 1 т - 1TTtт - 1T-1t-1т - 1T-1t-1

2
Площадь под «pdf» в оценке плотности ядра в R
Я пытаюсь использовать функцию плотности в R для оценки плотности ядра. У меня возникли некоторые трудности при интерпретации результатов и сравнении различных наборов данных, так как кажется, что площадь под кривой не обязательно равна 1. Для любой функции плотности вероятности (pdf) нам нужно иметь площадь . Я предполагаю, что оценка …

1
Как настроить и интерпретировать контрасты ANOVA с пакетом автомобилей в R?
Допустим, у меня есть простой факторный эксперимент 2x2, на котором я хочу провести ANOVA. Вот так, например: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); При отсутствии значительного взаимодействия по умолчанию (т. Е. contr.treatment) Результатом …
15 r  anova  contrasts 

4
Как я могу улучшить свой анализ влияния репутации на голосование?
Недавно я провел некоторый анализ влияния репутации на положительные отзывы (см. Пост в блоге ), и впоследствии у меня возникло несколько вопросов о, возможно, более информативном (или более подходящем) анализе и графике. Итак, несколько вопросов (и не стесняйтесь отвечать кому-то конкретно и игнорировать других): В своем нынешнем воплощении я не …

2
Что такое «метод передачи сообщений»?
У меня есть смутное представление о том, что такое метод передачи сообщений: алгоритм, который строит аппроксимацию к распределению путем итеративного построения аппроксимаций каждого из факторов распределения, условных для всех аппроксимаций всех других факторов. Я полагаю, что оба являются примерами вариационной передачи сообщений и распространения ожиданий . Что алгоритм передачи сообщений …

1
Как работает квантильная нормализация?
В исследованиях экспрессии генов с использованием микрочипов данные интенсивности должны быть нормализованы, чтобы можно было сравнивать интенсивности между индивидуумами, между генами. Концептуально и алгоритмически, как работает «квантильная нормализация», и как бы вы объяснили это не статистику?

5
В чем может быть причина использования преобразования квадратного корня в данных?
Есть ли причина того, что я могу придумать, чтобы преобразовать данные с квадратным корнем? Я имею в виду, что я всегда наблюдаю, что R ^ 2 увеличивается. Но это, вероятно, только из-за центрирования данных! Любая мысль ценится!

1
Каковы плюсы и минусы изучения алгоритмического распределения (моделирования) по сравнению с математическим?
Каковы плюсы и минусы изучения свойств дистрибутива алгоритмически (посредством компьютерного моделирования) по сравнению с математически? Кажется, что компьютерное моделирование может быть альтернативным методом обучения, особенно для тех новых студентов, которые не чувствуют себя сильными в исчислении. Также кажется, что моделирование кода может предложить более раннее и более интуитивное понимание концепции …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.