Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Понимание использования логарифмов в логарифме TF-IDF
Я читал: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition Но я не могу понять, почему именно формула была построена такой, какая она есть. Что я делаю Понять: iDF должен на каком-то уровне измерять, как часто термин S появляется в каждом из документов, уменьшаясь в значении по мере того, как термин появляется чаще. С этой точки зрения …

1
Почему рейтинговая система Elo использует неправильное правило обновления?
Система рейтинга Эло использует алгоритм минимизации градиентного спуска функции кросс-энтропийной потери между ожидаемой и наблюдаемой вероятностью исхода в парных сравнениях. Мы можем написать общие функции потерь как Е= - ∑н , япяГ о г( дя)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) где сумма производится по всем исходам и всем противникам . - …

2
Когда сходятся приближения рядов Тейлора к ожиданиям (целых) функций?
Возьмите ожидание вида для некоторой одномерной случайной величины и целой функции (т. Интервал сходимости - это целая вещественная линия)E(f(X))E(f(X))E(f(X))XXXf(⋅)f(⋅)f(\cdot) У меня есть функция, генерирующая моменты для и, следовательно, я могу легко вычислить целые моменты. Используйте ряд Тейлора вокруг а затем примените ожидание в терминах ряда центральных моментов, = f (\ …


2
Как обучить SVM через обратное распространение?
Мне было интересно, можно ли обучить SVM (скажем, линейный, чтобы упростить задачу) с использованием обратного распространения? В настоящее время я нахожусь в затруднительном положении, потому что я могу думать только о том, чтобы записать вывод классификатора как f(x;θ,b)=sgn(θ⋅x−(b+1))=sgn(g(x;θ,b))f(x;θ,b)=sgn(θ⋅x−(b+1))=sgn(g(x;θ,b)) f(\mathbf{x};\theta,b) = \text{sgn}(\theta\cdot\mathbf{x} - (b+1)) = \text{sgn}(g(\mathbf{x};\theta,b)) Следовательно, когда мы пытаемся вычислить …

1
Как я могу сравнить 2 средства, которые распределены по Лапласу?
Я хочу сравнить 2 типовых средства для 1-минутного возврата. Я предполагаю, что они распределены по Лапласу (уже проверены), и я разделил результаты на 2 группы. Как я могу проверить, значительно ли они отличаются? Я думаю, что не могу относиться к ним как к нормальному распределению, потому что, хотя они имеют …

1
Почему все компоненты PLS вместе объясняют только часть дисперсии исходных данных?
У меня есть набор данных, состоящий из 10 переменных. Я запустил частичные наименьшие квадраты (PLS), чтобы предсказать одну переменную ответа по этим 10 переменным, извлек 10 компонентов PLS, а затем вычислил дисперсию каждого компонента. По исходным данным я взял сумму дисперсий всех переменных, которая составляет 702. Затем я разделил дисперсию …

1
Почему доля выборки также не имеет биномиального распределения
В биномиальной установке случайная величина X, которая дает количество успехов, распределяется биномиально. Пропорция выборки может быть рассчитана как где - размер вашей выборки. В моем учебнике говорится, чтоИксNИксN\frac{X}{n}NNn Эта пропорция не имеет биномиального распределения однако, поскольку - это просто масштабированная версия биномиально распределенной случайной величины , разве она не должна …

4
Это правильно ? (порождающий усеченную норму, многомерный гауссов)
Если X∈Rn, X∼N(0–,σ2I)X∈Rn, X∼N(0_,σ2I)X\in\mathbb{R}^n,~X\sim \mathcal{N}(\underline{0},\sigma^2\mathbf{I}) т fX(x)=1(2πσ2)n/2exp(−||x||22σ2)fX(x)=1(2πσ2)n/2exp⁡(−||x||22σ2) f_X(x) = \frac{1}{{(2\pi\sigma^2)}^{n/2}} \exp\left(-\frac{||x||^2}{2\sigma^2}\right) Я хочу аналогичную версию усеченного нормального распределения в многомерном случае. Точнее, я хочу сгенерировать ограниченный по норме (до значения ≥a≥a\geq a ) многомерный гауссовский YYY st fY(y)={c.fX(y), if ||y||≥a0, otherwise .fY(y)={c.fX(y), if ||y||≥a0, otherwise . f_Y(y) = \begin{cases} c.f_X(y), …

2
Является ли взвешивание, основанное на точности (т.е. обратная дисперсия), неотъемлемой частью мета-анализа?
Является ли основанное на точности взвешивание центральным для мета-анализа? Боренштейн и соавт. (2009) пишут, что для мета-анализа все, что необходимо, это то, что: Исследования сообщают о точечной оценке, которая может быть выражена одним числом. Дисперсия может быть вычислена для этой точечной оценки. Мне не сразу понятно, почему (2) строго необходимо. …

1
Модельные матрицы для моделей со смешанными эффектами
В lmerфункции lme4in in Rесть вызов для построения модельной матрицы случайных эффектов , как описано здесь , стр. 7 - 9.ZZZ Вычисление влечет за собой произведения ХатриРао и / или Кронекера двух матриц, и . ZZZJiJiJ_iXiXiX_i Матрица представляет собой глоток: «Матрица индикаторов группирующих индексов», но, похоже, она представляет собой разреженную …

2
Означает ли выпуклое упорядочение доминирование правого хвоста?
Учитывая два непрерывных распределения и , мне не ясно, существует ли отношение выпуклого доминирования между ними:FXFX\mathcal{F}_XFYFY\mathcal{F}_Y (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y подразумевает, что (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] имеет место или если необходимы некоторые дополнительные гипотезы, если должно быть выполнено?(1)(1)(1) Определение выпуклого доминирования. Если два непрерывных распределения и удовлетворяют:FИксFX\mathcal{F}_XFYFY\mathcal{F}_Y ( …

1
Как работает Kriging Interpolation?
Я работаю над проблемой, в которой мне нужно использовать Кригинг, чтобы предсказать значение некоторых переменных на основе некоторых окружающих переменных. Я хочу реализовать его код самостоятельно. Итак, я просмотрел слишком много документов, чтобы понять, как это работает, но я был так растерян. Как правило, я понимаю, что это средневзвешенное значение, …

2
Зачем когда-либо использовать Durbin-Watson вместо тестирования автокорреляции?
Тест Дурбина-Ватсона проверяет автокорреляцию остатков при лаге 1. Но тестирование автокорреляции при лаге 1 также выполняется напрямую. Кроме того, вы можете проверить автокорреляцию с задержкой 2,3,4, и есть хорошие тесты portmanteau для автокорреляции с несколькими задержками и получить красивые, легко интерпретируемые графики [например, функцию acf () в R]. Дурбин-Ватсон не …

1
Различают краткосрочные и долгосрочные эффекты
Я прочитал в газете следующее предложение: Тот факт, что есть разница между краткосрочными и долгосрочными коэффициентами, является результатом нашей спецификации, которая включает в себя отстающие эндогенные переменные. Они запускают регрессию в первых различиях и включают отставание зависимой переменной. Теперь они утверждают, что если вы посмотрите на оценку (например, давайте назовем …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.