Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Что такое интуитивное объяснение Echo State Networks?
Я новичок в Recurrent Neural Networks (RNN) и все еще изучаю концепции. На абстрактном уровне я понимаю, что сеть эхо-состояний (ESN) способна (повторно) создавать последовательность входов, то есть сигнал, даже после того, как вход был удален. Тем не менее, я нашел статью Scholarpedia слишком трудной для понимания и полного понимания. …

2
Для каких (симметричных) распределений выборка означает более эффективную оценку, чем выборка медианы?
Я работал, полагая, что медиана выборки является более надежной мерой центральной тенденции, чем средняя выборка, поскольку она игнорирует выбросы. Поэтому я был удивлен, узнав (в ответе на другой вопрос ), что для выборок, взятых из нормального распределения, дисперсия среднего значения выборки меньше, чем дисперсия медианы выборки (по крайней мере для …

2
Каково распределение , где - равномерные распределения?
У меня есть четыре независимые равномерно распределенные переменные , каждая в . Я хочу рассчитать распределение . Я вычислил распределение как (отсюда ) и должно быть f_1 (u_1) = \ frac {1- \ sqrt {u_1}} {\ sqrt {u_1}}. Теперь распределение суммы u_1 + u_2 равно ( u_1, \, u_2 также …


3
Почему мы делим на стандартное отклонение, а не какой-то другой фактор стандартизации, прежде чем делать PCA?
Я читал следующее обоснование (из заметок курса cs229) о том, почему мы делим необработанные данные на их стандартное отклонение: хотя я понимаю, что говорится в объяснении, мне не ясно, почему деление на стандартное отклонение приведет к такой цели. Это говорит о том, что все больше в одном и том же …

1
Логарифмическая вероятность и произведение вероятностей
Согласно этой статье в википедии , можно представить произведение вероятностей x⋅yкак -log(x) - log(y)делающее вычисления более оптимальными в вычислительном отношении. Но если я попробую пример, скажи: p1 = 0.5 p2 = 0.5 p1 * p2 = 0.25 -log(p1) - log(p2) = 2 p3 = 0.1 p4 = 0.1 p3 * …

2
Соотношение чернил к данным и сюжетные фоны
Я заметил, что многие «современные» графические пакеты и темы, а также многие выдающиеся люди с данными используют серый фон для своих графиков. Вот несколько примеров: ggplot2: Пятидесятая Нейт Сильвер: Хотя в первом примере выше (ggplot2) можно утверждать, что использование серого фона уменьшает количество чернил, необходимых для линий сетки, но во …

3
Вводные тексты по структурной эконометрике
В последние годы структурный подход к эконометрике по сравнению с эконометрикой уменьшенной формы стал более популярным. Это предполагает тесное сочетание теоретических экономических моделей и статистики для оценки параметров, представляющих интерес. Введение более теоретической структуры в способ, которым мы используем данные и статистические методы, предназначено для обеспечения руководства и иногда может …

1
Можем ли мы использовать одно среднее значение и стандартное отклонение, чтобы выявить выбросы?
Предположим, у меня есть нормально распределенные данные. Для каждого элемента данных я хочу проверить, сколько SD находится от среднего значения. В данных могут быть выбросы (вероятно, только один, но могут быть также два или три) или нет, но этот выброс в основном то, что я ищу. Имеет ли смысл временно …

1
Гарантирует ли алгоритм выборки Гиббса детальный баланс?
У меня есть высший авторитет 1, что выборка Гиббса является частным случаем алгоритма Метрополиса-Гастингса для выборки Маркова с цепочкой Монте-Карло. Алгоритм MH всегда дает вероятность перехода с подробным свойством баланса; Я думаю, что Гиббс тоже должен. Так где же в следующем простом случае я ошибся? Для целевого распределения π(x,y)π(x,y)\pi(x, y) …
17 mcmc  gibbs 

1
Доказательство стационарности АР (2)
Рассмотрим процесс AR (2) где - стандартный процесс белого шума. Просто для простоты позвольте мне назвать и . Сосредоточившись на корнях уравнения характеристик, я получил Классические условия в учебниках следующие: Я пытался вручную (с помощью Mathematica) решить неравенства на корнях, т. е. систему получая толькоXt=ϕ1Xt−1+ϕ2Xt−2+ϵtXt=ϕ1Xt−1+ϕ2Xt−2+ϵtX_t=\phi_1X_{t-1}+\phi_2X_{t-2}+\epsilon_tϵtϵt\epsilon_tϕ1=bϕ1=b\phi_1=bϕ2=aϕ2=a\phi_{2}=az1,2=−b±b2+4a−−−−−−√2az1,2=−b±b2+4a2az_{1,2}=\frac{-b\pm\sqrt{b^2+4a}}{2a}{|a|&lt;1a±b&lt;1{|a|&lt;1a±b&lt;1\begin{cases}|a|<1 \\ a\pm b<1 \end{cases}⎧⎩⎨|−b−b2+4a√2a|&gt;1|−b+b2+4a√2a|&gt;1{|−b−b2+4a2a|&gt;1|−b+b2+4a2a|&gt;1\begin{cases}|\frac{-b-\sqrt{b^2+4a}}{2a}|>1 \\ …

3
Построение и отбор моделей с использованием Hosmer et al. 2013. Прикладная логистическая регрессия в R
Это мой первый пост на StackExchange, но я уже давно использую его в качестве ресурса, я сделаю все возможное, чтобы использовать соответствующий формат и внести соответствующие изменения. Кроме того, это вопрос, состоящий из нескольких частей. Я не был уверен, должен ли я разделить вопрос на несколько разных постов или только …

1
Логистическая регрессия: как получить насыщенную модель
Я только что прочитал о мере отклонения для логистической регрессии. Однако та часть, которая называется насыщенной моделью, мне не ясна. Я сделал обширный поиск в Google, но ни один из результатов не ответил на мой вопрос. До сих пор я обнаружил, что насыщенная модель имеет параметр для каждого наблюдения, что, …

3
Как представить коробочный сюжет с экстремальным выбросом?
Я мог бы использовать некоторые рекомендации по представлению некоторых данных. Этот первый график представляет собой сравнение случай-контроль для цитокина IL-10. Я вручную установил ось Y, чтобы включить 99% данных. Причина, по которой я установил это вручную, заключается в том, что группа дел имеет экстремальный выброс. Мои сотрудники не решаются выполнить …

1
Опущенное переменное смещение в логистической регрессии по сравнению с пропущенным переменным смещением в обычной регрессии наименьших квадратов
У меня есть вопрос об опущенном переменном смещении в логистической и линейной регрессии. Скажем, я опускаю некоторые переменные из модели линейной регрессии. Сделайте вид, что эти пропущенные переменные не связаны с переменными, которые я включил в мою модель. Эти пропущенные переменные не смещают коэффициенты в моей модели. Но в логистической …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.