Вопросы с тегом «machine-learning»

Алгоритмы машинного обучения строят модель обучающих данных. Термин «машинное обучение» определен неопределенно; оно включает в себя то, что также называется статистическим обучением, обучением с подкреплением, обучением без присмотра и т. д. ВСЕГДА ДОБАВЛЯЙТЕ БОЛЬШЕ КОНКРЕТНОЙ ТАГ.

5
Для классификации со случайными лесами в R, как следует приспособиться к несбалансированным размерам классов?
Я изучаю различные методы классификации для проекта, над которым я работаю, и заинтересован в попытках использовать «Случайные леса». Я стараюсь обучаться сам по себе, и буду признателен за любую помощь, предоставленную сообществом CV. Я разделил свои данные на тренировочные / тестовые наборы. После экспериментов со случайными лесами в R (с …

2
Будет ли возможен / практичен случайный лес с несколькими выходами?
Случайные леса (RF) - это конкурентный метод моделирования / добычи данных. Модель RF имеет один выход - переменную выход / прогноз. Наивный подход к моделированию нескольких выходов с RFs должен был бы построить RF для каждой выходной переменной. Таким образом, у нас есть N независимых моделей, и там, где есть …

3
ROC против точных кривых отзыва на несбалансированном наборе данных
Я только что закончил читать эту дискуссию. Они утверждают, что PR AUC лучше, чем ROC AUC по несбалансированному набору данных. Например, у нас есть 10 образцов в тестовом наборе данных. 9 образцов положительные и 1 отрицательный. У нас ужасная модель, которая предсказывает все положительное. Таким образом, у нас будет метрика: …

4
Интерпретация отрицательного косинуса сходства
Мой вопрос может быть глупым. Поэтому я заранее извинюсь. Я пытался использовать модель GLOVE, предварительно подготовленную группой Stanford NLP ( ссылка ). Тем не менее, я заметил, что мои результаты сходства показали некоторые отрицательные числа. Это сразу же побудило меня взглянуть на файл словесных векторных данных. По-видимому, значения в словах …

1
Является ли контролируемое обучение подмножеством обучения с подкреплением?
Похоже, что определение контролируемого обучения является подмножеством обучающего обучения с особым типом функции вознаграждения, основанной на помеченных данных (в отличие от другой информации в среде). Это точное изображение?

3
Как причинно-следственная связь определяется математически?
Каково математическое определение причинно-следственной связи между двумя случайными величинами? Учитывая выборку из совместного распределения двух случайных величин и , когда мы скажем, что вызывает ?XXXYYYXXXYYY Для контекста, я читаю эту статью о причинно-следственной связи .

1
Почему информационный критерий Акаике больше не используется в машинном обучении?
Я просто наткнулся на «Информационный критерий Акайке» и заметил большое количество литературы по выбору моделей (кажется, существуют и такие вещи, как BIC). Почему современные методы машинного обучения не используют эти критерии выбора моделей BIC и AIC?

2
Что здесь происходит, когда я использую квадрат потерь в настройке логистической регрессии?
Я пытаюсь использовать квадратичные потери, чтобы выполнить двоичную классификацию для набора данных игрушек. Я использую mtcarsнабор данных, использую милю на галлон и вес, чтобы предсказать тип передачи. На приведенном ниже графике показаны два типа данных типа передачи в разных цветах и ​​границы решения, сформированные различными функциями потерь. Квадратный убыток равен …

4
Что считается хорошей потерей журнала?
Я пытаюсь лучше понять потерю журналов и как это работает, но я не могу найти одну вещь - поместить число потерь журналов в какой-то контекст. Если у моей модели потеря журнала 0,5, это хорошо? Что считается хорошим и плохим счетом? Как меняются эти пороги?

5
Как ансамблевые методы превосходят всех составляющих?
Я немного запутался в изучении ансамбля. Короче говоря, он запускает k моделей и получает среднее значение этих k моделей. Как можно гарантировать, что среднее значение k моделей будет лучше, чем у любой другой модели? Я понимаю, что уклон "распределен" или "усреднен". Однако что, если в ансамбле две модели (т.е. k …

1
Какие теории причинности я должен знать?
Какие теоретические подходы к причинности я должен знать как прикладной статистик / эконометрик? Я знаю (очень немного) Причинно-следственная модель Неймана – Рубина (и Рой , Гавелмо и т. Д.) Работа Перла о причинности Причинность Грейнджера (хотя и менее ориентированная на лечение) Какие концепции мне не хватает или мне следует знать? …

1
количество карт характеристик в сверточных нейронных сетях
При изучении сверточной нейронной сети у меня возникают вопросы относительно следующего рисунка. 1) C1 в слое 1 имеет 6 карт характеристик, означает ли это, что имеется шесть сверточных ядер? Каждое сверточное ядро ​​используется для генерации карты объектов на основе входных данных. 2) S1 в слое 2 имеет 6 карт характеристик, …

2
Как провести исследовательский анализ данных, чтобы выбрать подходящий алгоритм машинного обучения
Мы изучаем машинное обучение с помощью машинного обучения: вероятностная перспектива (Кевин Мерфи). Хотя в тексте объясняется теоретическая основа каждого алгоритма, в нем редко говорится, в каком случае какой алгоритм лучше, а когда - нет, но не говорится, как определить, в каком случае я нахожусь. Например, для выбора ядра мне было …

3
Площадь под кривой ROC или область под кривой PR для несбалансированных данных?
У меня есть некоторые сомнения по поводу того, какую меру эффективности использовать: область под кривой ROC (TPR как функция FPR) или область под кривой точности-отзыва (точность как функция отзыва). Мои данные несбалансированы, то есть количество отрицательных экземпляров намного больше, чем положительных. Я использую выходной прогноз Weka, пример: inst#,actual,predicted,prediction 1,2:0,2:0,0.873 2,2:0,2:0,0.972 …

2
При каких условиях машины повышения градиента превосходят случайные леса?
Может ли машина повышения градиента Фридмана достичь лучшей производительности, чем «Случайный лес» Бреймана ? Если да, то в каких условиях или какой набор данных может сделать gbm лучше?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.