Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Расчет показателей сезонности для сложной сезонности
Я хочу прогнозировать розничные позиции (по неделям), используя экспоненциальное сглаживание. Я сейчас застрял в том, как рассчитывать, хранить и применять индексы сезонности. Проблема в том, что все примеры, которые я нашел, имеют дело с некой простой сезонностью. В моем случае у меня есть следующие проблемы: 1. Сезоны не происходят на …

2
Мягкая порога против штрафной санкции Лассо
Я пытаюсь обобщить то, что я до сих пор понимал в многомерном анализе наказаний с помощью многомерных наборов данных, и я все еще борюсь за то, чтобы получить правильное определение мягкого порогового определения по сравнению с штрафом Лассо (или ).L1L1L_1 Точнее, я использовал разреженную регрессию PLS для анализа структуры двухблочных …

5
Какие есть способы показать, что два аналитических метода эквивалентны?
У меня есть два различных аналитических метода, которые могут измерить концентрацию конкретной молекулы в матрице (например, измерить количество соли в воде). Эти два метода различны, и у каждого есть своя собственная ошибка. Какие существуют способы показать эти два метода эквивалентны (или нет). Я думаю, что нанесение результатов из нескольких выборок, …

1
Насколько различны ограниченные кубические сплайны и штрафные сплайны?
Я много читаю об использовании сплайнов в различных регрессионных задачах. В некоторых книгах (например, в линейных моделях Парриметриза Ходжеса ) рекомендуются штрафные сплайны. Другие (например, стратегии регрессионного моделирования Харрелла ) выбирают ограниченные кубические сплайны. Насколько они отличаются на практике? Часто ли вы получаете существенно отличающиеся результаты от использования одного или …

1
Что означает термин «редкий априорный» (FBProphet Paper)?
Читая статью «Прогнозирование в масштабе» (инструмент прогнозирования FBProphet, см. Https://peerj.com/preprints/3190.pdf ), я натолкнулся на термин «разреженный априор». Авторы объясняют, что они использовали такой «разреженный априор» при моделировании вектора отклонений скорости δδ\mathbf{\delta} от некоторой скалярной скорости Кkk , которая является модельным параметром в модели логистического роста. Поскольку они утверждают, что δJ∼ …

4
Почему бы нам просто не изучить гиперпараметры?
Я реализовывал довольно популярную статью « ОБЪЯСНЕНИЕ И ПРИМЕНЕНИЕ ОБОБЩЕННЫХ ПРИМЕРОВ », и в статье она обучает противоборствующей целевой функции. J '' (θ) = αJ (θ) + (1 - α) J '(θ). Он рассматривает α как гиперпараметр. α может быть 0,1, 0,2, 0,3 и т. д. Независимо от этой конкретной …

2
Разве несколько фильтров в сверточном слое не будут учить один и тот же параметр во время тренировки?
Основываясь на том, что я узнал, мы используем несколько фильтров в Conv Layer CNN для изучения различных детекторов функций. Но так как эти фильтры применяются одинаково (то есть скользят и умножаются на области ввода), разве они не изучат одни и те же параметры во время обучения? Следовательно, использование нескольких фильтров …

2
Какова интуиция, лежащая в основе различий второго порядка?
Иногда временную серию необходимо различать, чтобы сделать ее стационарной. Однако я не понимаю, как различие второго порядка может помочь сделать его стационарным, когда различие первого порядка недостаточно. Не могли бы вы дать интуитивное объяснение различий второго порядка и случаев, когда это необходимо?

1
Как рассчитать доверительные оценки в регрессии (со случайными лесами / XGBoost) для каждого прогноза в R?
Есть ли способ получить показатель достоверности (мы можем также назвать его значением достоверности или вероятности) для каждого прогнозируемого значения при использовании таких алгоритмов, как Random Forests или Extreme Gradient Boosting (XGBoost)? Допустим, этот показатель доверия будет варьироваться от 0 до 1 и покажет, насколько я уверен в том или ином …

1
Почему LKJcorr является хорошим приоритетом для корреляционной матрицы?
Я читаю главу 13 «Приключения в ковариации» в ( превосходной ) книге Ричарда Мак-Элирея « Статистическое переосмысление », где он представляет следующую иерархическую модель: ( Rэто корреляционная матрица) Автор объясняет, что LKJcorrэто слабоинформативный априор, который работает как регуляризирующий априор для корреляционной матрицы. Но почему это так? Какие характеристики у LKJcorrраспределения …

2
Критерий Колмогорова – Смирнова: статистика p-значения и ks-критерия уменьшается с увеличением размера выборки
Почему p-значения и статистика ks-теста уменьшаются с увеличением размера выборки? Возьмите этот код Python в качестве примера: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) Результаты: Ks_2sampResult(statistic=0.30000000000000004, pvalue=0.67507815371659508) …

3
Проблемы с горячим кодированием и фиктивным кодированием
Мне известен тот факт, что категориальные переменные с k уровнями должны кодироваться с помощью k-1 переменных в фиктивном кодировании (аналогично для многозначных категориальных переменных). Мне было интересно, сколько проблем делает одноразовое кодирование (то есть использование вместо этого k переменных) вместо фиктивного кодирования для различных методов регрессии, в основном, линейной регрессии, …

2
Плюсы и минусы начальной загрузки
Я только что узнал о концепции начальной загрузки, и возникла наивная проблема: если мы всегда можем генерировать многочисленные примеры начальной загрузки наших данных, зачем вообще пытаться получить больше «реальных» данных? Я думаю, что у меня есть объяснение, пожалуйста, скажите мне, если я прав: я думаю, что процесс начальной загрузки уменьшает …

3
CIFAR-10 не может быть выше 60% точности, керас с бэкэндом Tensorflow [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто в прошлом году . Тренировка после 15 эпох в наборе данных CIFAR-10, кажется, делает потерю проверки больше не снижающейся, придерживаясь приблизительно 1,4 (с …

2
Можем ли мы принять ноль в тестах неуязвимости?
В обычном t-тесте средних значений, используя обычные методы проверки гипотез, мы либо отклоняем нулевое значение, либо не принимаем отрицательное нулевое, но никогда не принимаем нулевое. Одна из причин этого заключается в том, что если бы мы получили больше доказательств, тот же размер эффекта стал бы значительным. Но что происходит в …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.