Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


3
Модель временного ряда ансамбля
Мне нужно автоматизировать прогнозирование временных рядов, и я заранее не знаю особенностей этих рядов (сезонность, тренд, шум и т. Д.). Моя цель не в том, чтобы получить лучшую модель для каждой серии, а в том, чтобы избежать довольно плохих моделей. Другими словами, каждый раз получать небольшие ошибки - не проблема, …

3
Вероятность против условного распределения для байесовского анализа
Мы можем написать теорему Байеса как p(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(\theta|x) = \frac{f(X|\theta)p(\theta)}{\int_{\theta} f(X|\theta)p(\theta)d\theta} где - апостериор, - условное распределение, а - априорное.p(θ|x)p(θ|x)p(\theta|x)f(X|θ)f(X|θ)f(X|\theta)p(θ)p(θ)p(\theta) или же p(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(\theta|x) = \frac{L(\theta|x)p(\theta)}{\int_{\theta} L(\theta|x)p(\theta)d\theta} где - апостериор, - функция правдоподобия, а - приоритет.L ( θ | x ) p ( θ )p(θ|x)p(θ|x)p(\theta|x)L(θ|x)L(θ|x)L(\theta|x)p(θ)p(θ)p(\theta) Мой вопрос Почему байесовский анализ выполняется с …

3
Совместная модель с условиями взаимодействия и отдельными регрессиями для группового сравнения
Собрав ценные отзывы о предыдущих вопросах и обсуждениях, я поставил следующий вопрос: предположим, что цель состоит в том, чтобы выявить различия в эффектах в двух группах, например, мужчины и женщины. Есть два способа сделать это: запустить две отдельные регрессии для двух групп и использовать тест Вальда, чтобы отклонить (или нет) …

1
Как я могу рассчитать критическое значение т, используя R?
Извините, если это новый вопрос; Я пытаюсь научить себя статистике в первый раз. Я думаю, что у меня есть базовая процедура, но я изо всех сил пытаюсь выполнить ее с R. Итак, я пытаюсь оценить значимость коэффициентов регрессии в множественной линейной регрессии формы y^=Xβ^y^=Xβ^ \hat y = X \hat \beta …

4
Интуиция / интерпретация распределения собственных значений корреляционной матрицы?
Какова ваша интуиция / интерпретация распределения собственных значений матрицы корреляции? Я склонен слышать, что обычно 3 самых больших собственных значения являются наиболее важными, в то время как близкие к нулю значения являются шумом. Кроме того, я видел несколько научных работ, исследующих, как естественные распределения собственных значений отличаются от вычисленных из …

3
Стратегии увеличения данных для прогнозирования временных рядов
Я рассматриваю две стратегии «увеличения данных» для прогнозирования временных рядов. Сначала немного предыстории. Предиктор для прогнозирования следующего шага временного ряда - это функция, которая обычно зависит от двух вещей: прошлых состояний временного ряда, но также и прошлых состояний предиктора:PпP{Ai}{Aя}\lbrace A_i\rbrace P({Ai≤t−1},PSt−1)п({Aя≤T-1},пST-1)P(\lbrace A_{i\leq t-1}\rbrace,P_{S_{t-1}}) Если мы хотим настроить / обучить нашу …

1
«Абсолютно непрерывная случайная величина» против «Непрерывная случайная величина»?
В книге Валентина В. Петрова «Предельные теоремы теории вероятностей» я увидел различие между определениями «непрерывного» и «абсолютно непрерывного», которое сформулировано следующим образом: X P ( X ∈ B ) = 0 B P ( X ∈ B ) = 0 B(∗)(∗)(*) "... Распределение случайной величины называется непрерывным, если для любого …


3
Скрытая марковская модель против рекуррентной нейронной сети
Какие проблемы последовательного ввода лучше всего подходят для каждого? Определяет ли входная размерность, какое из них лучше подходит? Являются ли проблемы, для которых требуется «более длинная память», более подходящими для RNN LSTM, а проблемы с циклическими шаблонами ввода (фондовый рынок, погода) легче решаются с помощью HMM? Кажется, что есть много …

2
Модель Google Inception: почему существует несколько softmax?
Топологию модели Google Inception можно найти здесь: Google Inception Netowrk Я заметил, что в этой модели есть 3 слоя softmax (# 154, # 152, # 145), и 2 из них являются своего рода ранним выходом из этой модели. Из того, что я знаю, слой softmax предназначен для окончательного вывода, так …

3
Что такое метод моментов и чем он отличается от MLE?
В целом кажется, что метод моментов просто сопоставляет наблюдаемое среднее значение выборки или дисперсию с теоретическими моментами для получения оценок параметров. Я понимаю, что это часто то же самое, что и MLE для экспоненциальных семей. Тем не менее, трудно найти четкое определение метода моментов и четкое обсуждение того, почему MLE, …

2
Классификация с шумными метками?
Я пытаюсь обучить нейронную сеть для классификации, но у меня довольно шумные ярлыки (около 30% ярлыков ошибочны). Потеря перекрестной энтропии действительно работает, но мне было интересно, есть ли альтернативы, более эффективные в этом случае? или потеря кросс-энтропии является оптимальной? Я не уверен, но я думаю о некоторой «отсечке» кросс-энтропийной потери, …

2
Подходит ли Random Forest для очень маленьких наборов данных?
У меня есть набор данных, состоящий из 24 строк ежемесячных данных. Особенности ВВП, прибытие в аэропорт, месяц и некоторые другие. Зависимой переменной является количество посетителей популярного туристического направления. Подойдет ли Random Forest для такой проблемы? Данные не являются общедоступными, поэтому я не могу опубликовать образец.

2
Коэффициент Кости такой же, как точность?
Я сталкиваюсь с коэффициентом Кости для сходства объема ( https://en.wikipedia.org/wiki/S%C3%B8rensen%E2%80%93Dice_coefficient ) и точности ( https://en.wikipedia.org/wiki/Accuracy_and_precision ). Мне кажется, что эти две меры одинаковы. Какие-нибудь мысли?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.