Вопросы с тегом «machine-learning»

Алгоритмы машинного обучения строят модель обучающих данных. Термин «машинное обучение» определен неопределенно; оно включает в себя то, что также называется статистическим обучением, обучением с подкреплением, обучением без присмотра и т. д. ВСЕГДА ДОБАВЛЯЙТЕ БОЛЬШЕ КОНКРЕТНОЙ ТАГ.

1
Тест: Скажите классификатору по границе его решения
Ниже приведены 6 границ принятия решений. Границы решения - фиолетовые линии. Точки и крестики - это два разных набора данных. Мы должны решить, какой из них: Линейный СВМ Ядро SVM (Полиномиальное ядро ​​порядка 2) Perceptron Логистическая регрессия Нейронная сеть (1 скрытый слой с 10 выпрямленными линейными единицами) Нейронная сеть (1 …

5
Понимание того, какие особенности были наиболее важны для логистической регрессии
Я построил классификатор логистической регрессии, который очень точен в моих данных. Теперь я хочу лучше понять, почему это так хорошо работает. В частности, я хотел бы оценить, какие функции вносят наибольший вклад (какие функции являются наиболее важными) и, в идеале, количественно оценить, насколько каждая функция вносит вклад в точность общей …

1
Каковы теоретические гарантии упаковки
Я (примерно) слышал, что: пакетирование - это метод, позволяющий уменьшить дисперсию алгоритма предиктор / оценщик / обучение. Однако я никогда не видел формального математического доказательства этого утверждения. Кто-нибудь знает, почему это математически верно? Это просто кажется настолько широко признанным / известным фактом, что я ожидал бы прямой ссылки на это. …

3
Почему мы делим на стандартное отклонение, а не какой-то другой фактор стандартизации, прежде чем делать PCA?
Я читал следующее обоснование (из заметок курса cs229) о том, почему мы делим необработанные данные на их стандартное отклонение: хотя я понимаю, что говорится в объяснении, мне не ясно, почему деление на стандартное отклонение приведет к такой цели. Это говорит о том, что все больше в одном и том же …

1
Подходит ли значение R-квадрата для сравнения моделей?
Я пытаюсь определить лучшую модель для прогнозирования цен на автомобили, используя цены и функции, доступные на сайтах, рекламируемых автомобилями. Для этого я использовал пару моделей из библиотеки scikit-learn и модели нейронной сети из pybrain и neurolab. Подход, который я использовал до сих пор, состоит в том, чтобы прогонять фиксированный объем …

1
Когда Наивный Байес работает лучше, чем SVM?
В небольшой проблеме классификации текста, которую я рассматривал, Наивный Байес демонстрирует производительность, аналогичную или превышающую SVM, и я был очень смущен. Мне было интересно, какие факторы определяют триумф одного алгоритма над другим. Существуют ли ситуации, когда нет смысла использовать наивный байесовский метод вместо SVM? Может кто-то пролить свет на это?

4
Что означает «степень свободы» в нейронных сетях?
В книге Бишопа «Классификация образов и машинное обучение» описывается метод регуляризации в контексте нейронных сетей. Тем не менее, я не понимаю параграф, описывающий, что в процессе обучения количество степеней свободы увеличивается вместе со сложностью модели. Соответствующая цитата следующая: Альтернативой регуляризации как способу управления эффективной сложностью сети является процедура ранней остановки. …

1
Я хочу построить индекс преступности и индекс политической нестабильности, основанный на новостях
У меня есть этот побочный проект, где я сканирую местные новостные сайты в моей стране и хочу создать индекс преступности и индекс политической нестабильности. Я уже освещал информационно-поисковую часть проекта. Мой план состоит в том, чтобы сделать: Неконтролируемая тема извлечения. Обнаружение близких дубликатов. Контролируемая классификация и уровень инцидента (преступность / …

2
Использование нейронной сети для торговли на бирже
Я нырнул в область нейронных сетей и увлекся ими. Наконец-то я разработал прикладную среду для тестирования торговых систем на биржах, и теперь я собираюсь внедрить в нее свою первую нейронную сеть. Очень простой и примитивный, не предназначенный для реальной торговли, просто для начинающих. Я только хочу знать, хороший ли мой …

3
Сравнение двух результатов точности классификатора для статистической значимости с t-тестом
Я хочу сравнить точность двух классификаторов по статистической значимости. Оба классификатора работают на одном наборе данных. Это наводит меня на мысль, что я должен использовать один образец t-критерия из того, что я читал . Например: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 Это правильный тест для …

1
Входные параметры для использования скрытого распределения Дирихле
При использовании тематического моделирования (скрытое распределение Дирихле) количество тем является входным параметром, который необходимо указать пользователю. Мне кажется, что мы также должны предоставить набор кандидатских тем, по которым процесс Dirichlet должен сэмплировать? Правильно ли мое понимание? На практике, как настроить этот набор кандидатов?

12
Лучшие книги для введения в статистический анализ данных?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я купил эту книгу: Как измерить что-либо: найти значение нематериальных активов в бизнесе и Head First Анализ данных: Учебное пособие для больших …

3
Какие алгоритмы нуждаются в масштабировании функций, кроме SVM?
Я работаю со многими алгоритмами: RandomForest, DecisionTrees, NaiveBayes, SVM (kernel = linear и rbf), KNN, LDA и XGBoost. Все они были довольно быстрыми, кроме SVM. Именно тогда я узнал, что для ускорения работы требуется масштабирование функций. Тогда я начал задаваться вопросом, должен ли я сделать то же самое для других …

1
Как построить окончательную модель и настроить порог вероятности после вложенной перекрестной проверки?
Во-первых, извинения за размещение вопроса, который уже подробно обсуждался здесь , здесь , здесь , здесь , здесьи для разогрева старой темы. Я знаю, что @DikranMarsupial подробно писал об этой теме в постах и ​​журнальных статьях, но я все еще в замешательстве, и, судя по количеству подобных постов, это все …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.