Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Реализация вложенной перекрестной проверки
Я пытаюсь выяснить, правильно ли мое понимание вложенной перекрестной проверки, поэтому я написал этот игрушечный пример, чтобы проверить, прав ли я: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # load boston dataset …

3
Как классифицировать несбалансированный набор данных по сверточным нейронным сетям (CNN)?
У меня есть несбалансированный набор данных в задаче двоичной классификации, где количество положительных и отрицательных значений составляет 0,3% против 99,7%. Разрыв между позитивами и негативами огромен. Когда я тренирую CNN со структурой, используемой в задаче MNIST, результат тестирования показывает высокий уровень ложных отрицательных результатов. Кроме того, кривая ошибок обучения быстро …

1
Что такое асимптотическая ковариационная матрица?
Верно ли, что асимптотическая ковариационная матрица равна ковариационной матрице оценок параметров? Если нет, то что это? И в чем разница между ковариационной матрицей и асимптотической ковариационной матрицей в этом случае? Заранее спасибо!

2
Является ли выборка на основе цепей Маркова «лучшей» для выборки Монте-Карло? Существуют ли альтернативные схемы?
Марковская цепь Монте-Карло - это метод, основанный на цепях Маркова, который позволяет нам получать выборки (в условиях Монте-Карло) из нестандартных распределений, из которых мы не можем напрямую брать выборки. Мой вопрос заключается в том, почему цепь Маркова является «современной» для отбора проб Монте-Карло. Альтернативный вопрос может быть, есть ли другие …

1
Достаточность или недостаточность
Рассмотрим случайную выборку где - случайные переменные где . Проверьте, является ли достаточной статистикой для .{X1,X2,X3}{X1,X2,X3}\{X_1,X_2,X_3\}XiXiX_iBernoulli(p)Bernoulli(p)Bernoulli(p)p∈(0,1)p∈(0,1)p\in(0,1)T(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3ppp Во-первых, как мы можем найти распределение для ? Или это должно быть разбито на и будет ли это следовать за ? Я думаю, что нет, потому что обратите внимание, что все переменные здесь не …

2
Определитель информационной матрицы Фишера для сверхпараметрической модели
Рассмотрим случайную переменную Бернулли с параметром (вероятность успеха). Функция правдоподобия и информация Фишера ( матрица ):θ 1 × 1X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} Теперь рассмотрим «слишком параметризованную» версию с двумя параметрами: вероятность успеха θ1θ1\theta_1 и вероятность отказа …

1
Обобщенные линейные модели против моделей Тимсери для прогнозирования
Каковы различия в использовании обобщенных линейных моделей, таких как автоматическое определение релевантности (ARD) и регрессия хребта, по сравнению с моделями временных рядов, такими как Box-Jenkins (ARIMA) или экспоненциальное сглаживание для прогнозирования? Существуют ли практические правила, когда следует использовать GLM и когда использовать временные ряды?

1
Является ли закрытым множеством соглашением при проверке гипотез?
При тестировании статистической гипотезы нулевая гипотеза часто принимает форму (по крайней мере, в книгах, которые я прочитал): или H0H0H_0H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 Это только соглашение, что множества в замкнуты? Или есть другие причины?H0H0H_0

3
Есть ли нормализованные эквиваленты асимметрии и куртоза?
Что будет нормализованным эквивалентом асимметрии, которая будет иметь ту же единицу, что и данные? Точно так же, что было бы нормализованным эквивалентом Kurtosis? В идеале эти функции должны быть линейными по отношению к данным, а это означает, что если бы все наблюдения были умножены на коэффициент n, результирующая нормализованная асимметрия …

2
Как мне моделировать взаимодействия между объясняющими переменными, если одна из них может иметь квадратные и кубические члены?
Я искренне надеюсь, что я сформулировал этот вопрос таким образом, чтобы на него можно было дать окончательный ответ - если нет, пожалуйста, дайте мне знать, и я попробую еще раз! Я должен также предположить, что я буду использовать R для этих анализов. У меня есть несколько мер, plant performance (Ys)которые, …

2
Есть ли элегантный / проницательный способ понять эту линейную регрессионную идентичность для множественного
В линейной регрессии я обнаружил восхитительный результат, который, если мы подходим к модели E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, затем, если мы стандартизируем и центрируем данные YYY , X1X1X_1 и X2X2X_2 , R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. Мне кажется, что версия с двумя переменными …

1
Ссылка на рассказ о сэмплировании из телефонной книги
Сегодня я говорил с кем-то о выборке и смутно помню историю о каком-то очень уважаемом статистике, который рекомендует систематическую выборку из телефонной книги в конкретном судебном деле. Я помню историю, в которой судья говорил что-то вроде: «Я не знаю много о статистике, но я знаю, что выборка на каждое сотое …

3
Обнаружение аномалий временных рядов с помощью Python
Мне нужно реализовать обнаружение аномалий в нескольких наборах данных временных рядов. Я никогда не делал этого раньше и надеялся на некоторые советы. Я очень хорошо разбираюсь в python, поэтому я бы предпочел, чтобы в нем было реализовано решение (большая часть моего кода - это python для других частей моей работы). …

2
Преобразовать распределение Пуассона в нормальное распределение
Прежде всего, я имею опыт работы в области компьютерных наук, но сейчас я пытаюсь научить себя основам статистики. У меня есть некоторые данные, которые я думаю, имеет распределение Пуассона У меня есть два вопроса: Это распределение Пуассона? Во-вторых, возможно ли преобразовать это в нормальное распределение? Любая помощь будет оценена. Спасибо …

2
Как интерпретировать графики ACF и PACF
Я просто хочу проверить, правильно ли я интерпретирую графики ACF и PACF: Данные соответствуют ошибкам, сгенерированным между фактическими точками данных и оценками, сгенерированными с использованием модели AR (1). Я посмотрел на ответ здесь: Оценить коэффициенты ARMA путем проверки ACF и PACF После прочтения, кажется, что ошибки не имеют автокорреляции, но …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.