Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

2
почему мы должны справиться с дисбалансом данных?
Мне нужно знать, почему мы должны бороться с дисбалансом данных. Я знаю, как с этим справляться, и различными методами для решения проблемы, которая заключается в повышении или понижении или использовании Smote. Например, если у меня редкое заболевание 1% из 100, и, скажем, я решил иметь сбалансированный набор данных для моего …

4
Обнаружение аномалий с нейронной сетью
У меня есть большой многомерный набор данных, который генерируется каждый день. Каков будет хороший подход для выявления любых «аномалий» по сравнению с предыдущими днями? Является ли это подходящей проблемой, которую можно решить с помощью нейронных сетей? Любые предложения приветствуются. дополнительная информация: примеров нет, поэтому метод должен сам определять аномалии

4
Альтернативы TF-IDF и Cosine Similarity при сравнении документов разных форматов
Я работал над небольшим, личным проектом, который берет навыки работы пользователя и предлагает наиболее идеальную карьеру для них на основе этих навыков. Я использую базу данных списков вакансий для достижения этой цели. На данный момент код работает следующим образом: 1) Обработайте текст каждого списка вакансий для извлечения навыков, упомянутых в …

2
Может ли перенастройка произойти, даже если потеря проверки все еще падает?
У меня есть сверточная модель + LSTM в Керасе, похожая на эту (ссылка 1), которую я использую для конкурса Kaggle. Архитектура показана ниже. Я обучил его на своем маркированном наборе из 11000 образцов (два класса, начальная распространенность ~ 9: 1, поэтому я увеличил выборку с 1 до примерно 1/1) в …

3
Как использовать RBM для классификации?
В данный момент я играю с Restricted Boltzmann Machines, и, поскольку я в нем, я хотел бы попытаться классифицировать рукописные цифры по ним. Модель, которую я создал, теперь является довольно модной генеративной моделью, но я не знаю, как дальше с ней работать. В этой статье автор говорит, что после создания …

1
Обучение под присмотром против обучения с подкреплением для простого самостоятельного вождения автомобиля
Я строю автомобиль с дистанционным управлением для удовольствия. Я использую Raspberry Pi в качестве бортового компьютера; и я использую различные плагины, такие как камера Raspberry Pi и датчики расстояния, для обратной связи по окружению автомобиля. Я использую OpenCV, чтобы превратить видеокадры в тензоры, и я использую TensorFlow от Google, чтобы …

2
Сколько измерений нужно уменьшить при выполнении PCA?
Как выбрать K для PCA? K - количество измерений, на которое нужно спроецировать. Единственное требование - не терять слишком много информации. Я понимаю, что это зависит от данных, но я больше ищу простой общий обзор о том, какие характеристики следует учитывать при выборе K.
12 pca 

1
Классификация клиентов на основе 2 функций и временных рядов событий
Мне нужна помощь в том, что должно быть моим следующим шагом в алгоритме, который я разрабатываю. Из-за NDA я не могу раскрыть многое, но постараюсь быть обобщенным и понятным. В основном, после нескольких шагов в алгоритмах, у меня есть это: Для каждого имеющегося у меня клиента и событий, которые он …

1
MinHashing vs SimHashing
Предположим, у меня есть пять наборов, которые я бы хотел сгруппировать. Я понимаю, что техника SimHashing описана здесь: https://moultano.wordpress.com/2010/01/21/simple-simhashing-3kbzhsxyg4467-6/ может привести к трем кластерам ( {A}, {B,C,D}и {E}), например, если его результаты были: A -> h01 B -> h02 C -> h02 D -> h02 E -> h03 Точно так …

5
Лучшая библиотека Юлии для нейронных сетей
Я использую эту библиотеку для базового построения и анализа нейронной сети. Однако он не поддерживает построение многослойных нейронных сетей и т. Д. Итак, я хотел бы знать о каких-либо хороших библиотеках для продвинутых нейронных сетей и Deep Learning в Юлии.

2
Тарифы авиакомпаний - Какой анализ следует использовать для выявления конкурентного поведения при установлении цен и ценовых корреляций?
Я хочу исследовать поведение авиакомпаний в отношении ценообразования - особенно то, как авиакомпании реагируют на ценообразование конкурентов. Как я сказал бы, мои знания о более сложном анализе довольно ограничены, я использовал в основном все основные методы для сбора общего представления о данных. Это включает в себя простые графики, которые уже …

7
Что такое «старое имя» специалиста по данным?
Такие термины, как «наука о данных» и «ученый данных» все чаще используются в наши дни. Многие компании нанимают «ученого данных». Но я не думаю, что это совершенно новая работа. Данные существовали из прошлого, и кто-то должен был иметь дело с данными. Я думаю, что термин «ученый данных» становится все более …
12 bigdata 

1
Хеширование - что на самом деле происходит
Когда алгоритмы ML, например, Vowpal Wabbit или некоторые из машин факторизации, побеждающих в конкурсе кликов ( Kaggle ), упоминают, что функции «хэшированы», что это на самом деле означает для модели? Допустим, есть переменная, которая представляет идентификатор интернет-добавления, который принимает значения, такие как «236BG231». Тогда я понимаю, что эта функция хэшируется …

2
Данные настроения для Emoji
Для экспериментов мы хотели бы использовать эмодзи, встроенные во многие твиты, в качестве базовых данных о правде / обучении для простого количественного анализа настроений. Твиты обычно слишком неструктурированы для НЛП, чтобы работать хорошо. Так или иначе, в Unicode 6.0 есть 722 Emoji, и, вероятно, еще 250 будут добавлены в Unicode …

3
Классификация неструктурированного текста
Я собираюсь классифицировать неструктурированные текстовые документы, а именно сайты неизвестной структуры. Количество классов, которые я классифицирую, ограничено (на данный момент я считаю, что их не более трех). У кого-нибудь есть предложения о том, как мне начать? Возможен ли подход "мешок слов" здесь? Позже я мог бы добавить еще один этап …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.