Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Каково распределение мощности пересечения независимых случайных выборок без замены?
SSS некоторое множество сn∈Nn∈Nn\in\mathbb{N} элементов, и 1 , 2 , . , , , М фиксированные положительные целые числа меньше или равно п .a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_mnnn С элементами SSS быть с равной вероятностью, mmm образцы L1,L2,...,LmL1,L2,...,LmL_1, L_2,...,L_m отдельно и независимо друг от друга взяты из SSS без замены, размер которых 1 , …

2
Можно ли использовать анализ основных компонентов по ценам на акции / нестационарным данным?
Я читаю пример, приведенный в книге « Машинное обучение для хакеров» . Сначала я подробно остановлюсь на примере, а затем расскажу о своем вопросе. Пример : Принимает набор данных за 10 лет по 25 ценам на акции. Работает PCA на 25 акций. Сравнивает основной компонент с индексом Доу-Джонса. Наблюдает очень …

2
Что именно означает нотация?
Что означает обозначение (точка над тильдой) в контексте, подобном ? х ˙ ~ N(0,1)∼˙∼˙\dot\simx∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) Оказывается, легче найти, как правильно его набирать: tex.SE объясняет, что нужно печатать \mathrel{\dot\sim}вместо того, \dot\simчтобы просто исправить проблему с пробелами - чем найти, что это на самом деле означает. До сих пор он …

1
Доказать / Не подтвердить
Доказать / Не подтвердить E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} Учитывая , отфильтрованный вероятностное пространство (Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, \{\mathscr{F}_n\}_{n \in \mathbb{N}}, \mathbb{P}) , пусть A∈FA∈FA …

3
Какие статистические методы я могу использовать, чтобы найти популярные или распространенные комбинации категориальных переменных?
Я делаю исследование по употреблению поликарбоната. У меня есть данные о 400 наркоманах, каждый из которых указал наркотики, которыми злоупотребляет. Существует более 10 лекарств и, следовательно, есть большие возможные комбинации. Я перекодировал большинство наркотиков, которые они потребляют, в двоичные переменные (т. Е. Героин равен 1, если наркоман злоупотребляет героином, иначе …

3
Как читать p, d и q из auto.arima ()?
Как я могу получить p,d and qзначения в ARIMA(p,d,q)модели по оценкам auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Если мы посмотрим на вывод arima_model $ арма мы получили, [1] 1 0 0 0 1 2 0 Какое значение имеют цифры в приведенной выше последовательности?
10 r  arima 

1
Логистическая регрессия против хи-квадрата в таблицах сопряженности 2x2 и Ix2 (однофакторный - двоичный ответ)?
Я пытаюсь понять использование логистической регрессии в таблицах сопряженности 2x2 и Ix2. Например, используя это в качестве примера В чем разница между использованием критерия хи-квадрат и логистической регрессией? Как насчет таблицы с несколькими номинальными коэффициентами (таблица Ix2), например: Существует аналогичный вопрос здесь - но ответ в основном , что хи-квадрат …

1
Как создать простой персептрон?
Задачи классификации с нелинейными границами не могут быть решены простым персептроном . Следующий код R предназначен для иллюстративных целей и основан на этом примере в Python): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) …

1
При повторной параметризации функции правдоподобия, достаточно ли просто вставить преобразованную переменную вместо формулы изменения переменных?
Предположим, что я пытаюсь повторно параметризовать функцию правдоподобия, которая экспоненциально распределена. Если моя первоначальная функция правдоподобия: p(y∣θ)=θe−θyp(y∣θ)=θe−θy p(y \mid \theta) = \theta e^{-\theta y} и я хотел бы повторно параметризовать его, используя , поскольку - это не случайная величина, а параметр, достаточно просто подключить плагин?ϕ=1θϕ=1θ\phi = \frac{1}{\theta}θθ\theta Я имею в …

1
Что подразумевается под PCA, сохраняя только большие попарные расстояния?
В настоящее время я читаю технику визуализации t-SNE, и было упомянуто, что одним из недостатков использования анализа главных компонентов (PCA) для визуализации многомерных данных является то, что он сохраняет только большие попарные расстояния между точками. Значимые точки, которые находятся далеко друг от друга в многомерном пространстве, также будут появляться далеко …

2
Переменная масштаба как данные подсчета - правильно или нет?
В этой статье (свободно доступной через PubMed central) авторы используют отрицательную биномиальную регрессию для моделирования оценки на 10-элементном инструменте скрининга, набравшем 0-40. Эта процедура предполагает подсчет данных, что здесь явно не так. Мне бы хотелось узнать ваше мнение о том, является ли этот подход приемлемым, потому что я иногда использую …

2
Как проверить статистически, является ли моя сеть (график) сетью «маленького мира» или нет?
Малой мировая сеть представляет собой тип математического графа , в котором большинство узлов не являются соседями друга с другом, но большинство узлов могут быть достигнуты с любым другим небольшим числом прыжков или шагов. В частности, сеть малого мира определяется как сеть, в которой типичное расстояние L между двумя случайно выбранными …

4
Переоснащение с помощью линейных классификаторов
Сегодня наш профессор заявил в классе, что «переоснащение линейными классификаторами невозможно». Я считаю, что это неправильно, поскольку даже линейные классификаторы могут быть чувствительны к выбросам в обучающем наборе - возьмем, например, машину векторов поддержки с жестким полем: один единственный шумный объект данных может изменить, какая гиперплоскость будет использоваться для разделения …

2
RMSE (среднеквадратическая ошибка) для логистических моделей
У меня есть вопрос относительно правильности использования RMSE (среднеквадратичная ошибка) для сравнения различных логистических моделей. Ответ либо, 0либо 1и прогнозы вероятности между 0- 1? Применяется ли приведенный ниже способ и для двоичных ответов? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, family = "binomial", type.measure = "mse") A …

4
Учитывая n равномерно распределенных r.v, что такое PDF для одного rv, деленного на сумму всех n r.v?
Меня интересует следующий тип случая: существует n непрерывных случайных величин, которые должны быть равны 1. Каким будет PDF для любой отдельной такой переменной? Итак, если , то меня интересует распределение для , где и распределены равномерно. Конечно, в этом примере среднее значение составляет , так как среднее значение составляет всего …
10 uniform 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.