Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как журнал (p (x, y)) нормализует точечную взаимную информацию?
Я пытаюсь понять нормализованную форму точечной взаимной информации. npmi=pmi(x,y)log(p(x,y))npmi=pmi(x,y)log(p(x,y))npmi = \frac{pmi(x,y)}{log(p(x,y))} Почему логарифмическая вероятность нормализует точечную взаимную информацию между [-1, 1]? Точечная взаимная информация: pmi=log(p(x,y)p(x)p(y))pmi=log(p(x,y)p(x)p(y))pmi = log(\frac{p(x,y)}{p(x)p(y)}) p (x, y) ограничен [0, 1], поэтому log (p (x, y)) ограничен (, 0]. Кажется, что log (p (x, y)) должен каким-то образом …

1
Является ли байесовская оценка с «плоским априором» такой же, как оценка максимального правдоподобия?
В филогенетике филогенетические деревья часто строятся с использованием MLE или байесовского анализа. Часто в байесовской оценке используется плоский априор. Насколько я понимаю, байесовская оценка - это оценка вероятности, которая включает в себя предварительную оценку. Мой вопрос: если вы используете фиксированную априорность, отличается ли она от простого анализа вероятности?

1
В чем разница между «статистическим тестом нулевой гипотезы» и любым другим тестом?
Недавняя горячая тема обсуждения касается журнала, запрещающего использование «процедур статистического тестирования нулевых гипотез (NHSTP)» в статьях, представленных в журнал. Я вижу этот термин, используемый некоторыми авторами, но я не понимаю, какое различие они пытаются провести. Является ли NHSTP чем-то отличным от «проверки гипотезы» или «проверки значимости»?

1
Каковы различия между различными решателями квадратичного программирования R?
Я ищу пакет, который поможет мне решить некоторые задачи квадратичной оптимизации, и я вижу, что есть как минимум полдюжины различных пакетов. Согласно этой странице: QP (квадратичное программирование, 90C20): cplexAPI , kernlab , limSolve , LowRankQP , quadprog , Rcplex , Rmosek Некоторые из них (Rmosek и cplexAPI) зависят от других …
9 r  optimization 

6
Как подготовить / построить функции для обнаружения аномалий (данные сетевой безопасности)
Моя цель - проанализировать сетевые журналы (например, Apache, syslog, аудит безопасности Active Directory и т. Д.), Используя кластеризацию / обнаружение аномалий для целей обнаружения вторжений. Из журналов у меня много текстовых полей, таких как IP-адрес, имя пользователя, имя хоста, порт назначения, порт источника и т. Д. (Всего 15-20 полей). Я …

2
Усеченное среднее против медианного
У меня есть набор данных со всеми звонками в службу экстренной помощи и временем отклика отделения скорой помощи. Они признали, что есть некоторые ошибки с временем отклика, так как есть случаи, когда они не начали запись (таким образом, значение 0) или когда они не останавливали часы (таким образом, значение может …

1
Выбор значения k для анализа обнаружения локального фактора выброса (LOF)
У меня есть набор трехмерных данных, и я пытаюсь использовать локальный анализ коэффициента выбросов, чтобы определить наиболее уникальные или странные значения. Как определить значение k для использования в анализе LOF? Я понимаю, что определяет значение k, и поэтому я не удивлен, что вижу несколько разные результаты, используя разные k, но …

1
Вычислить квантиль суммы распределений из определенных квантилей
Давайте предположим , что NNN независимых случайных величин X1,...,XNX1,...,XNX_1, ..., X_N для которых квантили на некотором конкретном уровне αα\alpha известны посредством оценки по данным: α=P(X1&lt;q1)α=P(X1&lt;q1)\alpha = P(X_1 < q_1) , ..., α=P(XN&lt;qN)α=P(XN&lt;qN)\alpha = P(X_N < q_N) . Теперь давайте определим случайную величину ZZZ как сумму Z=∑Ni=1XiZ=∑i=1NXiZ = \sum_{i=1}^N X_i, Есть …
9 quantiles 

1
Насколько справедливо использовать слово «прогнозировать» для (логистической) регрессии?
Я понимаю, что даже регрессия не дает причинности. Он может дать только связь между переменной y и переменными x и, возможно, направление. Я прав? Я часто встречал фразы, похожие на «x предсказывает y», даже в большинстве учебников курса и на различных страницах курса в Интернете. И вы часто называете регрессоры …

3
Данные подсчета моделирования, где переменная смещения равна 0 для некоторых наблюдений
Я пытаюсь помочь студенту коллеги. Студент наблюдал и подсчитывал поведение птицы (количество вызовов) в экспериментальной обстановке. Количество вызовов, относящихся к конкретной наблюдаемой птице во время каждого эксперимента, определить невозможно, но подсчет числа птиц, внесших вклад в количество зарегистрированных вызовов, был возможен. Следовательно, мое первоначальное предложение состояло в том, чтобы включить …

1
Монте-Карло == применяется случайный процесс?
У меня никогда не было курса официальной статистики, но из-за моего направления исследований я постоянно сталкиваюсь со статьями, которые применяют несколько статистических концепций. Часто я вижу описание процесса Монте-Карло, применяемого к данной ситуации, и то, что я могу собрать 9 из 10 раз, сводится к простому случайному поколению населения и …

3
Генератор случайных чисел Mathematica отклоняется от биномиальной вероятности?
Итак, допустим, вы подбрасываете монету 10 раз и называете это «событием». Если вы запустите 1000000 из этих «событий», какова доля событий с головами от 0,4 до 0,6? Биноминальная вероятность предполагает, что это будет около 0,65, но мой код Mathematica говорит мне о 0,24 Вот мой синтаксис: In[2]:= X:= RandomInteger[]; In[3]:= …

2
Удаление выбросов из данных - максимальное количество выбросов, которые вы можете удалить?
У меня есть несколько выбросов в моих данных, и я хотел исключить их, чтобы увидеть, изменит ли это результаты. По вашему мнению, каким максимальным количеством выбросов следует ограничиться? Спасибо!
9 outliers 

1
Как рассчитать функцию правдоподобия
Срок службы трех электронных компонентов: и . Случайные величины были смоделированы как случайная выборка размера 3 из экспоненциального распределения с параметром . Функция правдоподобия, дляХ 3 = 2,1 &amp; thetas ; &amp; thetas ; &gt; 0X1=3,X2=1.5,X1=3,X2=1.5,X_{1} = 3, X_{2} = 1.5,X3=2.1X3=2.1X_{3} = 2.1θθ\thetaθ&gt;0θ&gt;0\theta > 0 x = ( 2 , …

3
Как переставить 2D данные, чтобы получить заданную корреляцию?
У меня есть следующий простой набор данных с двумя непрерывными переменными; то есть: d = data.frame(x=runif(100,0,100),y = runif(100,0,100)) plot(d$x,d$y) abline(lm(y~x,d), col="red") cor(d$x,d$y) # = 0.2135273 Мне нужно переставить данные таким образом, чтобы корреляция между переменными составляла ~ 0,6. Мне нужно, чтобы средства и другая описательная статистика (sd, min, max и …
9 r  correlation 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.