Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Являются ли сумма и произведение двух ковариационных матриц ковариационной матрицей?
Предположим , у меня есть ковариационной матрицы и . Какие из этих вариантов также являются ковариационными матрицами?YXXXYYY X+YX+YX+Y X2X2X^2 XYXYXY У меня возникли проблемы с пониманием того, что именно нужно для того, чтобы что-то было матрицей ковариации. Я предполагаю, что это означает, что, например, если и что для того, чтобы …

1
Градиент для функции логистической потери
Я хотел бы задать вопрос, связанный с этим . Я нашел пример написания пользовательской функции потерь для xgboost здесь : loglossobj <- function(preds, dtrain) { # dtrain is the internal format of the training data # We extract the labels from the training data labels <- getinfo(dtrain, "label") # We …

1
В чем разница между асимптотической непредвзятостью и последовательностью?
Означает ли каждый другой? Если нет, то подразумевает ли одно другое? Почему, почему нет? Эта проблема возникла в ответ на комментарий к ответу, который я разместил здесь . Хотя поиск по релевантным терминам в Google не дал ничего, что казалось бы особенно полезным, я заметил ответ на математическом стеке. Однако …

1
Почему центральная предельная теорема работает с одним образцом?
Меня всегда учили, что CLT работает, когда вы повторяете выборку, причем каждая выборка достаточно велика. Например, представьте, что у меня есть страна с 1 000 000 граждан. Мое понимание CLT состоит в том, что даже если распределение их высот было ненормальным, если я взял 1000 выборок из 50 человек (т.е. …


1
Какой метод мета-анализа сети является лучшим?
В настоящее время существует несколько различных подходов для выполнения сетевого мета-анализа или сравнения смешанного лечения. Наиболее часто используемые и доступные из них, вероятно, следующие: в байесовских рамках : подход взаимодействия дизайн-за-лечением в WinBUGS (например, Jackson et al ); иерархическое байесовское моделирование в WinBUGS (например, Zhao et al ); иерархическое байесовское …

3
Дата / Время кодирования (циклические данные) для нейронных сетей
Как закодировать дату и время события для нейронной сети? У меня нет непрерывных временных рядов, но есть некоторые события с датой и временем, и я анализирую какой-то интерес. Этот интерес различается по утрам и вечерам, а также по будням, летом и зимой, перед Рождеством, Пасхой и т. Д. И сами …

2
Являются ли байесовские методы последовательными?
То есть, для проведения последовательного анализа (вы не знаете заранее, сколько именно данных вы будете собирать) с помощью часто используемых методов требуется особая осторожность; Вы не можете просто собирать данные, пока значение p не станет достаточно маленьким или доверительный интервал не станет достаточно коротким. Но при проведении байесовского анализа это …

5
Как анализировать тренд в непериодических временных рядах
Предположим, у меня есть следующие непериодические временные ряды. Очевидно, что тенденция уменьшается, и я хотел бы доказать это с помощью некоторого теста (с p-значением ). Я не могу использовать классическую линейную регрессию из-за сильной временной (последовательной) автокорреляции между значениями. library(forecast) my.ts <- ts(c(10,11,11.5,10,10.1,9,11,10,8,9,9, 6,5,5,4,3,3,2,1,2,4,4,2,1,1,0.5,1), start = 1, end = 27,frequency …
12 r  time-series 

2
Как работает операция DepthConcat в «Идти глубже с извилинами»?
Чтение Углубляясь в свертки, я наткнулся на слой DepthConcat , строительный блок предлагаемых начальных модулей , который объединяет выходные данные нескольких тензоров различного размера. Авторы называют это «Фильтр конкатенации». Там , как представляется , реализация для Torch , но я не очень понимаю, что это делает. Может кто-нибудь объяснить простыми …

4
Получение правильных начальных значений для модели NLS в R
Я пытаюсь приспособить простую модель степенного закона к набору данных, который выглядит следующим образом: mydf: rev weeks 17906.4 1 5303.72 2 2700.58 3 1696.77 4 947.53 5 362.03 6 Цель состоит в том, чтобы пропустить линию электропередачи и использовать ее для прогнозирования revзначений на будущие недели. Куча исследований привела меня …

1
Интерпретация выходных данных Scikitвести
Я работаю с библиотекой Scikit-Learn в Python. В приведенном ниже коде я предсказываю вероятность, но я не знаю, как прочитать вывод. Данные тестирования from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) Разделить набор данных X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, …

2
Почему регрессия гребня не может обеспечить лучшую интерпретируемость, чем LASSO?
У меня уже есть представление о плюсах и минусах регрессии гребня и LASSO. Для LASSO штрафной член L1 даст вектор разреженного коэффициента, который можно рассматривать как метод выбора признаков. Тем не менее, существуют некоторые ограничения для LASSO. Если функции имеют высокую корреляцию, LASSO выберет только одну из них. Кроме того, …

1
Выбор диапазона и плотности сетки для параметра регуляризации в LASSO
Тем временем я изучаю LASSO (оператор наименьшей абсолютной усадки и выбора). Я вижу, что оптимальное значение параметра регуляризации можно выбрать перекрестной проверкой. Я также вижу в регрессии гребня и во многих методах, которые применяют регуляризацию, мы можем использовать CV, чтобы найти оптимальный параметр регуляризации (скажем, штраф). Теперь мой вопрос о …

2
Ожидаемое значение x в нормальном распределении, ДАЕТ, что оно ниже определенного значения
Просто интересно, можно ли найти ожидаемое значение x, если оно нормально распределено, учитывая, что оно ниже определенного значения (например, ниже среднего значения).

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.