Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Какие методы существуют для настройки гиперпараметров ядра графов SVM?
У меня есть некоторые данные, которые существуют на графе . Вершины принадлежат одному из двух классов y i ∈ { - 1 , 1 } , и я заинтересован в обучении SVM различать эти два класса. Одним подходящее ядро для этого является в диффузии ядро , К = ехру ( …

2
Разница между усреднением данных, затем подгонкой и подбором данных, затем усреднением
Если таковые имеются, между подгонкой линии к нескольким отдельным «экспериментам», затем усреднением подгонки или усреднением данных из отдельных экспериментов, затем подгонкой усредненных данных. Позвольте мне уточнить: Я выполняю компьютерное моделирование, которое генерирует кривую, показанную ниже. Мы извлекаем количество, давайте назовем его «A», подгоняя линейную область графика (длительное время). Значение - …
10 error  fitting  average 

3
G-тест против критерия хи-квадрат Пирсона
Я проверяю независимость в таблице непредвиденных обстоятельствЯ не знаю, лучше ли G-тест или критерий хи-квадрат Пирсона. Размер выборки исчисляется сотнями, но есть небольшое количество клеток. Как указано на странице Википедии , приближение к распределению хи-квадрат лучше для G-теста, чем для теста Пирсона. Но я использую симуляцию Монте-Карло для вычисления значения …


2
Пакет R для объединения значений p с использованием метода Фишера или Стоуффера
Существует ли пакет R (или даже базовая функция R), который реализует метод Фишера или Стоуффера для объединения p-значений? Кодирование этого должно быть почти тривиальным, но я бы предпочел использовать (и процитировать) пакет. Пример кода в этом вопросе: метод Фишера для комбинирования p-значений - как насчет нижнего хвоста?

1
Возможна ли крупномасштабная PCA?
Классический метод анализа основных компонентов (PCA) состоит в том, чтобы сделать это на матрице входных данных, столбцы которой имеют нулевое среднее значение (тогда PCA может «максимизировать дисперсию»). Это может быть легко достигнуто путем центрирования колонн. Тем не менее, когда входная матрица является разреженной, центрированная матрица теперь будет более разреженной и, …

1
Ожидаемое значение как функция квантилей?
Мне было интересно, где есть общая формула для связи ожидаемого значения непрерывной случайной величины как функции квантилей того же самого rv. Ожидаемое значение rv определяется как: E ( X ) = ∫ x d F X ( x ) и квантили определяются как: Q p X = { x : …

2
Функция кросс-энтропийной стоимости в нейронной сети
Я смотрю на функцию стоимости кросс-энтропии, найденную в этом уроке : C=−1n∑x[ylna+(1−y)ln(1−a)]C=−1n∑x[yln⁡a+(1−y)ln⁡(1−a)]C = -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] Что именно мы подводим? Это, конечно, над xxx , но yyy и aaa не меняются с xxx . Все xxx являются входами в один aaa . aaa даже определяется в абзаце выше …

3
Зачем делать преобразование WOE категориальных предикторов в логистической регрессии?
Когда полезно преобразование весовых доказательств (WOE) категориальных переменных? Пример можно увидеть в трансформации WOE (Таким образом, для ответа , & категорического предиктора с категориями & из испытаний в й категории этого предиктора, WOE для й категории определяется какk y j n j j jYYyККkYJYJy_jNJNJn_jJJjJJj журналYJΣКJYJΣКJ( нJ- уJ)NJ- уJжурнал⁡YJΣJКYJΣJК(NJ-YJ)NJ-YJ\log \frac{y_j} {\sum_j^k …

1
Найти уникальный MVUE
Этот вопрос взят из книги Роберта Хогга «Введение в математическую статистику, 6-я версия», проблема 7.4.9 на стр. 388. Пусть будут iid с pdf ноль в другом месте, где .X1,...,XnX1,...,XnX_1,...,X_nf(x;θ)=1/3θ,−θ<x<2θ,f(x;θ)=1/3θ,−θ<x<2θ,f(x;\theta)=1/3\theta,-\theta0 (а) Найдите mle изθ^θ^\hat{\theta}θθ\theta (b) Является ли достаточной статистикой для ? Почему ?θ^θ^\hat{\theta}θθ\theta (c) Является ли уникальным MVUE для ? Почему …

1
Требуется ли перекрестная проверка для моделирования со случайными лесами?
Насколько я видел, мнения об этом, как правило, расходятся. Лучшая практика, безусловно, диктует использование перекрестной проверки (особенно если сравнивать RF с другими алгоритмами в одном наборе данных). С другой стороны, первоначальный источник утверждает, что факт ошибки OOB, рассчитанный во время обучения модели, является достаточным показателем эффективности тестового набора. Даже Тревор …

1
Почему прогнозирование моделей ARMA выполняется фильтром Калмана
Каковы преимущества выражения модели ARMA как модели пространства состояний и прогнозирования с использованием фильтра Калмана? Эта методология, например, используется в реализации SARIMAX для python-statsmodels: https://github.com/statsmodels/statsmodels/tree/master/statsmodels/tsa/statespace

2
Что можно сказать о моделях по данным наблюдений при отсутствии приборов?
В прошлом я задавал мне ряд вопросов, касающихся опубликованных работ в ряде областей, где регрессии (и связанные с ними модели, такие как панельные модели или GLM) используются в данных наблюдений (то есть данных, не полученных контролируемым экспериментом). во многих случаях - но не всегда - данные наблюдаются с течением времени), …

1
Управление высокой автокорреляцией в MCMC
Я строю довольно сложную иерархическую байесовскую модель для мета-анализа с использованием R и JAGS. Упрощенно, два ключевых уровня модели имеют α j = ∑ h γ h ( j ) + ϵ j, где y i j - i- е наблюдение за конечной точкой (в данном случае , GM против …

4
Как называется эта диаграмма?
Может кто-нибудь сказать мне, как называется этот тип диаграммы (если есть)? Также кто-нибудь может предложить какие-нибудь инструменты, пусть и простые, для построения такой диаграммы?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.