Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

3
Учебник по анализу настроений
Я пытаюсь понять анализ настроений и как применять его на любом языке (R, Python и т. Д.). Я хотел бы знать, есть ли хорошее место в Интернете для учебника, которому я могу следовать. Я гуглил, но я не очень доволен, потому что они были не учебниками, а скорее теорией. Я …

2
Классификация векторных последовательностей
Мой набор данных состоит из векторных последовательностей. Каждый вектор имеет 50 вещественных измерений. Количество векторов в последовательности колеблется от 3-5 до 10-15. Другими словами, длина последовательности не является фиксированной. Некоторое значительное количество последовательностей (не векторов!) Помечено меткой класса. Моя задача состоит в том, чтобы узнать классификатор, который дает последовательность векторов, …

1
Как двоично кодировать многозначную категориальную переменную из кадра данных Pandas?
Предположим, у нас есть следующий фрейм данных с несколькими значениями для определенного столбца: categories 0 - ["A", "B"] 1 - ["B", "C", "D"] 2 - ["B", "D"] Как мы можем получить такой стол? "A" "B" "C" "D" 0 - 1 1 0 0 1 - 0 1 1 1 2 …
9 python  pandas 

5
Есть идеи о применении глубокого сна?
Недавно Google опубликовал интересную глубокую мечту. Помимо создания произведений искусства, таких как http://deepdreamgenerator.com/ , видите ли вы какие-либо потенциальные применения глубокого сна в компьютерном зрении или машинном обучении?

4
Книги по усиленному обучению
Я уже довольно давно пытаюсь понять обучение с подкреплением, но каким-то образом я не могу представить, как написать программу для обучения подкреплению для решения проблемы мира сетки. Можете ли вы предложить мне несколько учебников, которые помогли бы мне составить четкую концепцию обучения в области подкрепления?

1
Выбор функции для опорных векторных машин
Мой вопрос в три раза В контексте «Kernelized» поддержка векторных машин Желателен ли выбор переменной / функции - тем более, что мы упорядочиваем параметр C, чтобы предотвратить переоснащение, и основной причиной внедрения ядер в SVM является увеличение размерности проблемы, в таком случае уменьшение размеров за счет уменьшения параметров кажется нелогичным …

2
Связь между измерением ВК и степенями свободы
Я изучаю машинное обучение и чувствую, что существует тесная связь между концепцией измерения VC и более классической (статистической) концепцией степеней свободы. Кто-нибудь может объяснить такую ​​связь?

1
Использование Vowpal Wabbit для NER
Vowpal Wabbit (VW), очевидно, поддерживает функцию маркировки последовательности через SEARN . Проблема в том, что я нигде не могу найти подробный список параметров с пояснениями и некоторыми примерами. Лучшее, что я смог найти - это запись в блоге Зинкова с очень коротким примером. Главная страница Вики почти не упоминает SEARN. …

2
Реализовать дополнительный наивный байесовский в python?
проблема Я пытался использовать наивный байесовский код на помеченном наборе данных о преступности, но получил очень плохие результаты (точность 7%). Наивный Байес работает намного быстрее, чем другие алгоритмы, которые я использовал, поэтому я хотел попытаться выяснить, почему счет был таким низким. Исследование После прочтения я обнаружил, что наивный байесовский анализ …

2
Есть ли метод, противоположный уменьшению размерности?
Я новичок в области машинного обучения, но сделал свою долю обработки сигналов. Пожалуйста, дайте мне знать, если этот вопрос был неправильно маркирован. У меня есть двумерные данные, которые определяются как минимум тремя переменными, а модель с сильно нелинейной моделью слишком сложна для моделирования. У меня был разный уровень успеха при …

1
Существуют ли какие-либо неконтролируемые алгоритмы обучения для последовательных данных?
Каждое наблюдение в моих данных было собрано с разницей в 0,1 секунды. Я не называю это временным рядом, потому что у него нет даты и времени. В примерах алгоритмов кластеризации (я нашел онлайн) и PCA данные выборки имеют 1 наблюдение на случай и не рассчитаны по времени. Но мои данные …

3
R случайный лес на Amazon ec2 Ошибка: невозможно выделить вектор размером 5,4 Гб
Я тренирую модели случайных лесов на R, используя randomForest()1000 деревьев и фреймы данных с примерно 20 предикторами и 600К строк. На моем ноутбуке все работает нормально, но когда я перехожу на amazon ec2, чтобы запустить то же самое, я получаю ошибку: Error: cannot allocate vector of size 5.4 Gb Execution …

2
Кластеризация документов с использованием тем, полученных из скрытого распределения Дирихле
Я хочу использовать скрытое выделение дирихле для проекта, и я использую Python с библиотекой gensim. После нахождения тем я хотел бы кластеризовать документы, используя алгоритм, такой как k-means (в идеале я хотел бы использовать хороший для перекрывающихся кластеров, поэтому любая рекомендация приветствуется). Мне удалось получить темы, но они в форме: …

2
Есть ли различия в регуляризации в MLP между пакетными и индивидуальными обновлениями?
Я только что узнал о регуляризации как о подходе к управлению перетеканием, и я хотел бы включить эту идею в простую реализацию обратного распространения и многослойного персептрона (MLP), которую я собрал. В настоящее время, чтобы избежать чрезмерной подгонки, я проверяю и сохраняю сеть с лучшими показателями на данный момент по …

7
Карьерный переход на Big Data Analytics
Я 35-летний ИТ-специалист, чисто технический специалист. Я хорош в программировании, изучаю новые технологии, понимаю их и внедряю. Я не любил математику в школе, поэтому у меня не было хороших результатов по математике. Я очень заинтересован в карьере аналитика больших данных. Меня больше интересует аналитика, а не технологии больших данных (Hadoop …
9 career 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.