Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
XGBoost и Python Sklearn повышают градиент деревьев
Я пытаюсь понять, как работает XGBoost. Я уже понимаю, как деревья с градиентным ускорением работают на Python sklearn. Что мне не ясно, так это то, работает ли XGBoost таким же образом, но быстрее, или если между ним и реализацией python есть фундаментальные различия. Когда я читаю эту статью http://learningsys.org/papers/LearningSys_2015_paper_32.pdf Мне …

5
Глубокое обучение: Как узнать, какие переменные важны?
С точки зрения языка нейронной сети (у = вес * х + смещение), как я узнаю, какие переменные являются более важными, чем другие? У меня есть нейронная сеть с 10 входами, 1 скрытый слой с 20 узлами и 1 выходной слой с 1 узлом. Я не уверен, как узнать, какие …

3
Когда генетические алгоритмы являются хорошим выбором для оптимизации?
Генетические алгоритмы являются одной из форм метода оптимизации. Часто стохастический градиентный спуск и его производные являются лучшим выбором для оптимизации функций, но генетические алгоритмы все еще иногда используются. Например, антенна космического корабля НАСА ST5 была создана с использованием генетического алгоритма: Когда методы генетической оптимизации являются лучшим выбором, чем более распространенные …

3
Почему вес сетей RNN / LSTM распределен по времени?
Недавно я заинтересовался LSTM и с удивлением узнал, что веса распределяются по времени. Я знаю, что если вы разделяете веса по времени, то ваши входные временные последовательности могут иметь переменную длину. С общими весами у вас гораздо меньше параметров для тренировки. Насколько я понимаю, причина, по которой можно обратиться к …

3
Интуиция условного ожидания
Пусть - вероятностное пространство, заданное случайной величиной и -algebra мы можем построить новую случайную величину , которая является условным ожиданием.(Ω,F,μ)(Ω,F,μ)(\Omega,\mathscr{F},\mu)ξ:Ω→Rξ:Ω→R\xi:\Omega \to \mathbb{R}σσ\sigmaG⊆FG⊆F\mathscr{G}\subseteq \mathscr{F}E[ξ|G]E[ξ|G]E[\xi|\mathscr{G}] Что такое интуиция для размышления об ? Я понимаю интуицию для следующего:E[ξ|G]E[ξ|G]E[\xi|\mathscr{G}] (i) где - событие (с положительной вероятностью).E[ξ|A]E[ξ|A]E[\xi|A]AAA (ii) где - дискретная случайная величина.E[ξ|η]E[ξ|η]E[\xi|\eta]ηη\eta Но я …

2
Что означает суперскрипт 2, индекс 2 в контексте норм?
Я новичок в оптимизации. Я продолжаю видеть уравнения, которые имеют верхний индекс 2 и нижний индекс 2 в правой части нормы. Например, вот уравнение наименьших квадратов мин| |A x - b | |22||Ax−b||22 ||Ax-b||^2_2 Я думаю, что понимаю верхний индекс 2: это означает возвести в квадрат значение нормы. Но что …


1
K-кратная перекрестная проверка ансамблевого обучения
Я запутался в том, как разделить данные для k-кратной перекрестной проверки ансамблевого обучения. Предполагая, что у меня есть система обучения ансамбля для классификации. Мой первый слой содержит модели классификации, например, svm, деревья решений. Мой второй слой содержит модель голосования, которая объединяет прогнозы из первого слоя и дает окончательный прогноз. Если …

3
Ожидаемая ошибка прогноза - вывод
Я изо всех сил пытаюсь понять вывод ожидаемой ошибки прогнозирования в соответствии с приведенным ниже (ESL), особенно в отношении выводов 2.11 и 2.12 (обусловливание, шаг к точечному минимуму). Любые указатели или ссылки высоко ценится. Ниже я сообщаю отрывок из ESL pg. 18. Первые два уравнения, по порядку, уравнения 2.11 и …

1
Дистанционное наблюдение: под наблюдением, под наблюдением или оба?
«Дистанционный контроль» - это схема обучения, в которой классификатор обучается с использованием слабо маркированного обучающего набора (данные обучения автоматически маркируются на основе эвристики / правил). Я думаю, что как контролируемое обучение, так и полууправляемое обучение могут включать такое «дистанционное наблюдение», если их помеченные данные эвристически / автоматически помечены. Тем не …

1
Сравнение между SHAP (объяснение аддитивной формы Шепли) и LIME (локальное интерпретируемое объяснение, основанное на модели)
Я читаю о двух популярных методах интерпретации специальных моделей: LIME и SHAP У меня проблемы с пониманием ключевой разницы в этих двух методах. По словам Скотта Лундберга , мозги, стоящие за SHAP: Значения SHAP поставляются с преимуществами локальной оценки для черного ящика, а также с теоретическими гарантиями согласованности и локальной …

4
Это хорошая идея использовать CNN для классификации 1D сигнала?
Я работаю над классификацией стадии сна. Я читал некоторые исследовательские статьи на эту тему, многие из них использовали SVM или метод ансамбля. Является ли хорошей идеей использовать сверточную нейронную сеть для классификации одномерного сигнала ЭЭГ? Я новичок в такой работе. Простите, если я спрошу что-то не так?

1
Когда можно использовать выборку Гиббса вместо Метрополис-Гастингс?
Существуют различные виды алгоритмов MCMC: Метрополис-Гастингс Gibbs Важность / отклонение выборки (связано). Зачем использовать выборку Гиббса вместо Метрополис-Гастингс? Я подозреваю, что бывают случаи, когда при выборке Гиббса можно сделать вывод лучше, чем при работе с Метрополис-Гастингс, но я не совсем уверен в деталях.

1
Помогите мне понять скорректированное соотношение шансов в логистической регрессии
Мне было трудно понять, как использовать логистическую регрессию в статье. Доступный здесь документ использует логистическую регрессию для прогнозирования вероятности осложнений во время операции по удалению катаракты. Что меня смущает, так это то, что в статье представлена ​​модель, которая присваивает отношение шансов 1 к базовой линии, описываемое следующим образом: Пациент, профиль …

2
Экстремальная обучающая машина: что это такое?
Я думал о внедрении и использовании парадигмы Extreme Learning Machine (ELM) уже более года, и чем дольше я это делаю, тем больше сомневаюсь, что это действительно хорошо. Однако мое мнение, по-видимому, противоречит научному сообществу, в котором - при использовании цитат и новых публикаций в качестве меры - представляется, что это …
20 regression 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.