Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

3
Эффективная модель базы данных для хранения данных, проиндексированных с помощью n-грамм
Я работаю над приложением, которое требует создания очень большой базы данных n-грамм, которые существуют в большом текстовом корпусе. Мне нужны три эффективных типа операций: поиск и вставка, проиндексированные самой n-граммой, и запрос всех n-граммов, которые содержат вложенную n-грамм. Для меня это звучит так, будто база данных должна быть гигантским деревом …
12 nlp  databases 

3
Предсказание следующего состояния здоровья из прошлых условий в данных претензий
В настоящее время я работаю с большим количеством данных о страховых случаях, включая некоторые лабораторные и аптечные претензии. Однако наиболее согласованная информация в наборе данных состоит из диагноза (ICD-9CM) и кодов процедур (CPT, HCSPCS, ICD-9CM). Мои цели: Выявить наиболее влиятельные исходные состояния (сопутствующие заболевания) для такого заболевания, как хроническое заболевание …

3
Измерение производительности различных классификаторов с различными размерами выборки
В настоящее время я использую несколько различных классификаторов для различных сущностей, извлеченных из текста, и использую точность / отзыв в качестве сводки того, насколько хорошо работает каждый отдельный классификатор в данном наборе данных. Мне интересно, есть ли реальный способ сравнения производительности этих классификаторов подобным образом, но который также учитывает общее …

1
В чем разница между глобальным и универсальным методами сжатия?
Я понимаю, что методы сжатия можно разделить на два основных набора: Глобальный местный Первый набор работает независимо от обрабатываемых данных, т. Е. Они не зависят от какой-либо характеристики данных и, следовательно, не требуют какой-либо предварительной обработки какой-либо части набора данных (до самого сжатия). С другой стороны, локальные методы анализируют данные, …

2
Алгоритм сопоставления предпочтений
Есть этот побочный проект, над которым я работаю, где мне нужно структурировать решение следующей проблемы. У меня есть две группы людей (клиентов). Группа Aнамеревается купить, и группа Bнамеревается продать определенный продукт X. Продукт имеет ряд атрибутов x_i, и моя цель состоит в том, чтобы облегчить транзакцию между Aи Bпутем сопоставления …

3
Amazon RedShift заменяет Hadoop для данных ~ 1XTB?
Вокруг Hadoop и его экосистемы много ажиотажа. Однако на практике, когда многие наборы данных находятся в терабайтовом диапазоне, не более ли разумно использовать Amazon RedShift для запросов больших наборов данных, вместо того, чтобы тратить время и усилия на создание кластера Hadoop? Кроме того, как Amazon Redshift сравнивается с Hadoop с …

9
Какие простые в освоении приложения для машинного обучения? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 5 лет назад . Будучи новичком в машинном обучении в целом, я хотел бы начать играть и …

2
Компромиссы между Storm и Hadoop (MapReduce)
Может ли кто-нибудь любезно рассказать мне о компромиссах, возникающих при выборе между Storm и MapReduce в Hadoop Cluster для обработки данных? Конечно, помимо очевидного, что Hadoop (обработка с помощью MapReduce в кластере Hadoop) является системой пакетной обработки, а Storm - системой обработки в реальном времени. Я немного работал с Hadoop …

3
Экземпляры против ядер при использовании EC2
Работая над проектами, которые часто называют «средними данными», я смог распараллелить мой код (в основном для моделирования и прогнозирования в Python) в одной системе в любом месте от 4 до 32 ядер. Сейчас я смотрю на масштабирование до кластеров в EC2 (возможно, с помощью StarCluster / IPython, но также и …
12 parallel  clusters  aws 

2
Может ли нейронная сеть вычислить
В духе знаменитой шутки Tensorflow Fizz Buzz и проблемы XOr я начал думать, возможно ли спроектировать нейронную сеть, которая реализует функцию ?Y= х2y=x2y = x^2 Учитывая некоторое представление числа (например, как вектор в двоичной форме, так что число 5представляется как [1,0,1,0,0,0,0,...]), нейронная сеть должна научиться возвращать свой квадрат - 25 …

3
Существует ли правило большого пальца для проектирования нейронных сетей?
Я знаю, что архитектура нейронной сети в основном основана на самой проблеме и типах ввода / вывода, но все же - всегда есть «квадратная», когда начинается ее создание. Итак, мой вопрос - учитывая входной набор данных MxN (M - количество записей, N - количество объектов) и C возможных классов вывода …


4
Как узнать, что модель начала переоснащаться?
Я надеюсь, что следующие выдержки дадут представление о том, каким будет мой вопрос. Это из http://neuralnetworksanddeeplearning.com/chap3.html Затем обучение постепенно замедляется. Наконец, примерно в эпоху 280 точность классификации почти перестает улучшаться. Более поздние эпохи просто видят небольшие стохастические флуктуации вблизи значения точности в эпоху 280. Сравните это с более ранним графиком, …

1
Важность признаков с категоричными признаками высокой кардинальности для регрессии (числовая переменная отклонения)
Я пытался использовать значения функций из случайных лесов, чтобы выполнить эмпирический выбор объектов для задачи регрессии, в которой все объекты являются категориальными и многие из них имеют много уровней (порядка 100-1000). Учитывая, что горячее кодирование создает фиктивную переменную для каждого уровня, значения функций относятся к каждому уровню, а не к …

3
Массовое преобразование категориальных столбцов в Pandas (не одноразовое кодирование)
У меня есть панды dataframe с тоннами категоричных колонн, которые я планирую использовать в дерево решений с scikit учиться. Мне нужно преобразовать их в числовые значения (не один горячий вектор). Я могу сделать это с LabelEncoder из scikit учиться. Проблема в том, что их слишком много, и я не хочу …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.