Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

2
Эффективный алгоритм для вычисления кривой ROC для классификатора, состоящего из множества непересекающихся классификаторов
Предположим, у меня есть классификаторы C_1 ... C_n, которые не пересекаются в том смысле, что никакие два не вернут истину на одном входе (например, узлы в дереве решений). Я хочу создать новый классификатор, который объединяет некоторые их подмножества (например, я хочу решить, какие листья дерева решений дать положительную классификацию). Конечно, …
13 algorithms 

2
Как рассчитать среднее значение столбца данных и найти верхние 10%
Я очень новичок в Scala и Spark и работаю над некоторыми самостоятельными упражнениями, используя бейсбольную статистику. Я использую класс наблюдений, создаю RDD и назначаю схему данным, а затем превращаю ее в DataFrame, чтобы я мог использовать SparkSQL для выбора групп игроков по их статистике, которая соответствует определенным критериям. Как только …

1
В чем разница между генерацией и извлечением объектов?
Кто-нибудь может сказать мне, какова цель создания функции? и зачем обогащать пространство признаков перед классификацией изображения? Это необходимый шаг? Есть ли способ обогатить пространство функций?

1
Neo4j против OrientDB против Титана
Я работаю над научно-исследовательским проектом, связанным с анализом социальных отношений, и мне нужно хранить данные в некоторых графовых базах данных. Изначально я выбрал Neo4j в качестве базы данных. Но швы Neo4j плохо масштабируются. Альтернатива, которую я обнаружил, это Titan и oriebtDB. Я провел это сравнение этих трех баз данных, но …

7
Я программист, как мне попасть в область науки о данных?
Прежде всего, этот термин звучит так неясно. В любом случае .. Я программист. Одним из языков, которые я могу кодировать, является Python. Говоря о данных, я могу использовать SQL и выполнять очистку данных. То, что я понял до сих пор после прочтения множества статей, в которых Data Science хороша: 1- …
13 beginner  career 

1
Он-лайн случайные леса, добавив больше деревьев решений
Случайный лес (RF) создается ансамблем деревьев решений (DT). Благодаря использованию пакетов каждый DT обучается в отдельном подмножестве данных. Следовательно, есть ли способ реализовать случайный лес в режиме онлайн, добавив больше решений для новых данных? Например, у нас есть 10K образцов и обучаем 10 DT. Затем мы получаем 1K выборок, и …

2
Визуализация глубокого обучения нейронной сети
Я пытаюсь найти эквивалент диаграмм Хинтона для многослойных сетей, чтобы построить вес во время обучения. Обученная сеть в некоторой степени похожа на Deep SRN, т. Е. Имеет большое количество матриц с несколькими весами, что делает одновременное построение нескольких диаграмм Хинтона визуально запутанным. Кто-нибудь знает хороший способ визуализации процесса обновления веса …

2
Какие особенности обычно используются из деревьев разбора в процессе классификации в НЛП?
Я изучаю различные типы структур дерева разбора. Двумя широко известными структурами дерева разбора являются: а) дерево разбора на основе постоянных и б) основанные на зависимости структуры дерева разбора. Я могу использовать генерацию обоих типов структур дерева разбора с помощью пакета Stanford NLP. Однако я не уверен, как использовать эти древовидные …

2
Анализ результатов A / B-теста, которые обычно не распределяются, с использованием независимого t-теста
У меня есть набор результатов теста A / B (одна контрольная группа, одна группа объектов), которые не соответствуют нормальному распределению. На самом деле распределение больше напоминает распределение Ландау. Я считаю, что независимый критерий Стьюдента требует, чтобы образцы были, по крайней мере, приблизительно нормально распределены, что отговаривает меня использовать критерий Стьюдента …

4
Изучение алгоритмов машинного обучения: глубина понимания против количества алгоритмов
Недавно я познакомился с областью науки о данных (прошло около 6 месяцев), и я начал свой путь с курса по машинному обучению Эндрю Нга и поста, который начал работать над специализацией по науке данных в JHU. Что касается практического применения, я работал над созданием прогностической модели, которая предсказывала бы истощение. …

6
Наборы данных с пониманием лучших практик
Я магистрант CS в области интеллектуального анализа данных. Мой руководитель однажды сказал мне, что перед тем, как запустить какой-либо классификатор или сделать что-либо с набором данных, я должен полностью понять данные и убедиться, что данные чистые и правильные. Мои вопросы: Как лучше всего понимать набор данных (большой размер с числовыми …

1
Когда реляционная база данных имеет лучшую производительность, чем не реляционная
Когда реляционная база данных, такая как MySQL, имеет лучшую производительность, чем не реляционная, как MongoDB? На днях я видел вопрос о Quora: почему Quora по-прежнему использует MySQL в качестве бэкэнда и что их производительность по-прежнему хорошая.

4
Пример больших данных или пример использования
Я читал много блогов \ статей о том, как разные типы отраслей используют Big Data Analytic. Но в большинстве этих статей не упоминается Какие данные эти компании использовали. Каков был размер данных Какие инструменты технологий они использовали для обработки данных В чем заключалась проблема, с которой они столкнулись, и как …

5
Почему добавление слоя отсева улучшает производительность глубокого / машинного обучения, учитывая, что выпадение подавляет некоторые нейроны из модели?
Если удаление некоторых нейронов приводит к более эффективной модели, почему бы не использовать более простую нейронную сеть с меньшим количеством слоев и меньшим количеством нейронов? Зачем строить большую, более сложную модель в начале, а потом подавлять ее?

3
Что такое вложение графов?
Недавно я наткнулся на встраивание графиков, таких как DeepWalk и LINE. Тем не менее, я до сих пор не имею четкого представления о том, что подразумевается под вложением графов и когда его использовать (приложения)? Любые предложения приветствуются!
13 graphs 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.