Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

3
Онтологии и Семантическая паутина мертвы? [закрыто]
Закрыто . Этот вопрос должен быть более сфокусированным . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он фокусировался только на одной проблеме, редактируя этот пост . Закрыто 3 года назад . Семантическая паутина мертва? Онтологии мертвы? Я разрабатываю план работы для своей диссертации …

2
Сколько времени занимают классификаторы scikit, чтобы классифицировать?
Я планирую использовать классификатор линейных опорных векторов (SVM) Scikit для классификации текста в корпусе, состоящем из 1 миллиона помеченных документов. Я планирую сделать следующее: когда пользователь вводит какое-либо ключевое слово, классификатор сначала классифицирует его по категории, а затем в документах этой категории будет выполняться последующий запрос на получение информации. У …

2
Стохастический градиентный спуск на основе векторных операций?
давайте предположим, что я хочу обучить алгоритм регрессии стохастического градиентного спуска, используя набор данных, который имеет N выборок. Поскольку размер набора данных фиксирован, я буду использовать данные T раз. На каждой итерации или «эпохе» я использую каждую обучающую выборку ровно один раз после случайного переупорядочения всего обучающего набора. Моя реализация …

4
Как создать оптимизированный список прогулок с учетом координат долготы и широты?
Я работаю над политической кампанией, в которой десятки добровольцев будут проводить промоушены в течение следующих нескольких недель. Учитывая список с именами, адресами и координатами long / lat, какие алгоритмы можно использовать для создания оптимизированного списка прогулок.
10 algorithms 

3
Сетевой анализ классических наборов данных
Существует несколько классических наборов данных для задач классификации / регрессии машинного обучения. Наиболее популярными являются: Набор данных Iris Flower ; Титаник Набор Данных ; Motor Trend Cars ; и т.п. Но кто-нибудь знает подобные наборы данных для анализа сетей / теории графов? Более конкретно - я ищу наборы данных золотого …
10 dataset  graphs 

2
Перекрестная проверка: K-кратная и повторная случайная выборка
Интересно, какой тип перекрестной проверки модели выбрать для задачи классификации: K-кратная или случайная суб-выборка (выборка с начальной загрузкой)? Мое лучшее предположение - использовать 2/3 набора данных (который составляет ~ 1000 элементов) для обучения и 1/3 для проверки. В этом случае K-fold дает только три итерации (сгиба), чего недостаточно, чтобы увидеть …

4
Как отладить анализ данных?
Я столкнулся со следующей проблемой, которая, по моему мнению, довольно типична. У меня есть большие данные, скажем, несколько миллионов строк. Я провел некоторый нетривиальный анализ, например, SQL-запрос, состоящий из нескольких подзапросов. Я получаю некоторый результат, утверждая, например, что свойство X увеличивается со временем. Теперь есть две возможные вещи, которые могут …

2
Отладка нейронных сетей
Я построил искусственную нейронную сеть в Python, используя функцию оптимизации scipy.optimize.minimize (Conjugate Gradient). Я реализовал проверку градиента, дважды проверил все и т.д., и я уверен, что он работает правильно. Я запускал его несколько раз, и он достигает «Оптимизация успешно завершена», однако, когда я увеличиваю количество скрытых слоев, стоимость гипотезы увеличивается …

1
Кластеризация данных клиентов, хранящихся в ElasticSearch
У меня есть куча профилей клиентов, хранящихся в elasticsearchкластер. Эти профили теперь используются для создания целевых групп для наших подписок на электронную почту. Целевые группы в настоящее время формируются вручную с использованием возможностей поиска с использованием эластичного поиска (например, получить всех клиентов мужского пола в возрасте 23 лет с одним …

5
Как создать хороший список стоп-слов
Я ищу несколько советов о том, как составить список стоп-слов. Кто-то знает / кто-то может порекомендовать хороший метод для извлечения списков стоп-слов из самого набора данных для предварительной обработки и фильтрации? Данные: огромное количество вводимого человеком текста различной длины (поисковые термины и целые предложения (до 200 символов)) в течение нескольких …


1
Почему моя модель Keras учится распознавать фон?
Я пытаюсь обучить эту реализацию Keras Deeplabv3 + на Pascal VOC2012, используя предварительно обученную модель (которая также обучалась на этом наборе данных). Я получил странные результаты с точностью, быстро сходящейся к 1,0: 5/5 [==============================] - 182s 36s/step - loss: 26864.4418 - acc: 0.7669 - val_loss: 19385.8555 - val_acc: 0.4818 Epoch …

4
SGDClassifier: онлайн-обучение / part_fit с ранее неизвестным ярлыком
Мой тренировочный набор содержит около 50 тысяч записей, с которыми я делаю начальное обучение. На еженедельной основе добавляется ~ 5 тыс. Записей; но такое же количество «исчезает» (так как это пользовательские данные, которые должны быть удалены через некоторое время). Поэтому я использую онлайн-обучение, потому что у меня нет доступа к …


2
Означает ли пакетная нормализация, что сигмоиды работают лучше, чем ReLU?
Пакетная нормализация и ReLU являются решениями проблемы исчезающего градиента. Если мы используем пакетную нормализацию, должны ли мы тогда использовать сигмоиды? Или есть функции ReLU, которые делают их полезными даже при использовании batchnorm? Я предполагаю, что нормализация, выполненная в batchnorm, отправит ноль активаций отрицательно. Означает ли это, что batchnorm решает проблему …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.