Вопросы с тегом «machine-learning»

Алгоритмы машинного обучения строят модель обучающих данных. Термин «машинное обучение» определен неопределенно; оно включает в себя то, что также называется статистическим обучением, обучением с подкреплением, обучением без присмотра и т. д. ВСЕГДА ДОБАВЛЯЙТЕ БОЛЬШЕ КОНКРЕТНОЙ ТАГ.

2
Работа с наборами данных с переменным количеством функций
Каковы некоторые подходы для классификации данных с переменным количеством признаков? В качестве примера рассмотрим проблему, в которой каждая точка данных представляет собой вектор точек x и y, и у нас не одинаковое количество точек для каждого экземпляра. Можем ли мы рассматривать каждую пару точек x и y как особенность? Или …

3
Что можно рассказать школьнику о статистике и машинном обучении?
На следующей неделе у нас есть стажер из местной школы в доме. Идея его короткой стажировки заключается в том, чтобы понять, как работает реальный мир и с чем связаны определенные рабочие места, как выглядит повседневная работа и т. Д. Теперь мне стало интересно, что можно рассказать / показать / продемонстрировать …

2
Кодирование категориальных функций в числа для машинного обучения
Многие алгоритмы машинного обучения, например нейронные сети, предполагают работу с числами. Поэтому, когда у вас есть категорические данные, вам необходимо преобразовать их. Под категориальным я имею в виду, например: Марки автомобилей: Audi, BMW, Chevrolet ... Идентификаторы пользователей: 1, 25, 26, 28 ... Несмотря на то, что идентификаторы пользователей - это …

1
Когда несбалансированные классы с избыточной / недостаточной выборкой, отличается ли максимальная точность от минимизации затрат на неправильную классификацию?
Прежде всего, я хотел бы описать некоторые распространенные макеты, которые используются в книгах Data Mining, и объяснить, как работать с несбалансированными наборами данных . Обычно основной раздел называется несбалансированными наборами данных, и они охватывают эти два подраздела: чувствительная к затратам классификация и методы выборки. Кажется, что, столкнувшись с проблемой редкого …

8
Каковы «горячие алгоритмы» для машинного обучения?
Это наивный вопрос от того, кто начинает изучать машинное обучение. Я читаю в эти дни книгу «Машинное обучение: алгоритмическая перспектива» от Марсленда. Я считаю ее полезной в качестве вводной книги, но теперь я хотел бы перейти к продвинутым алгоритмам, которые в настоящее время дают лучшие результаты. В основном меня интересует …

1
Интерпретация расстояния от гиперплоскости в SVM
У меня есть несколько сомнений в интуитивном понимании SVM. Предположим, что мы обучили модель SVM для классификации с использованием некоторого стандартного инструмента, такого как SVMLight или LibSVM. Когда мы используем эту модель для прогнозирования тестовых данных, модель генерирует файл, имеющий значения «альфа» для каждой тестовой точки. Если альфа-значение положительное, контрольная …

1
Когда можно использовать AdaBoost?
Как я слышал о классификаторе AdaBoost, который неоднократно упоминался на работе, я хотел лучше понять, как он работает и когда его можно использовать. Я прочитал несколько статей и учебных пособий, которые я нашел в Google, но есть некоторые аспекты классификатора, которые я до сих пор не могу понять: Большинство уроков, …

2
Заказ временных рядов для машинного обучения
Прочитав один из «Советов по исследованию» Р. Дж. Хиндмана о перекрестной проверке и временных рядах, я вернулся к своему старому вопросу, который я постараюсь сформулировать здесь. Идея состоит в том, что в задачах классификации или регрессии порядок данных не важен, и, следовательно, можно использовать перекрестную проверку в k- кратном порядке. …

2
Почему оценка ошибки случайного леса OOB улучшается при уменьшении количества выбранных объектов?
Я применяю алгоритм случайного леса в качестве классификатора для набора данных микрочипов, который разделен на две известные группы с тысячами объектов. После первого запуска я смотрю на важность функций и снова запускаю алгоритм дерева с 5, 10 и 20 наиболее важными функциями. Я обнаружил, что для всех 10-ти и 20-ти …


3
Каково максимальное значение дивергенции Кульбака-Лейблера (КЛ)
Я собираюсь использовать дивергенцию KL в своем коде Python, и я получил это руководство . На этом уроке реализовать дивергенцию KL довольно просто. kl = (model * np.log(model/actual)).sum() Как я понимаю, распределение вероятностей modelи actualдолжно быть <= 1. Мой вопрос: какова максимальная граница / максимально возможное значение k ?. Мне …

1
Карет глмнет против cv.glmnet
Кажется, существует большая путаница при сравнении использования glmnetвнутри caretдля поиска оптимальной лямбды и использования cv.glmnetдля выполнения той же задачи. Было задано много вопросов, например: Модель классификации train.glmnet против cv.glmnet? Как правильно использовать glmnet с кареткой? Перекрестная проверка `glmnet` с использованием` caret` но ответа не дано, что может быть связано с …

4
Интервалы прогнозирования для алгоритмов машинного обучения
Я хочу знать, является ли процесс, описанный ниже, действительным / приемлемым и доступно ли любое обоснование. Идея: контролируемые алгоритмы обучения не предполагают базовых структур / распределений данных. В конце дня они выводят точечные оценки. Я надеюсь как-то количественно оценить неопределенность оценок. Теперь процесс построения модели ML по своей природе является …

3
Как моделировать большие продольные данные?
Традиционно мы используем смешанную модель для моделирования продольных данных, то есть таких данных, как: id obs age treatment_lvl yield 1 0 11 M 0.2 1 1 11.5 M 0.5 1 2 12 L 0.6 2 0 17 H 1.2 2 1 18 M 0.9 мы можем предположить случайный перехват или …

1
ГАМ против проигрыша против сплайнов
Контекст : Я хочу , чтобы нарисовать линию в диаграмме рассеяния , что не появляется параметрическими, поэтому я использую geom_smooth()в ggplotв R. Он автоматически возвращает geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.