Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

3
Проблема с IPython / Jupyter на Spark (Нераспознанный псевдоним)
Я работаю над настройкой набора виртуальных машин для экспериментов со Spark, прежде чем потратить деньги и потратить деньги на создание кластера с некоторым оборудованием. Краткое примечание: я академик с опытом работы в области прикладного машинного обучения и немного бросил работу в науке о данных. Я использую инструменты для вычислений, редко …

4
Как избежать переобучения в случайном лесу?
Я хочу избежать переобучения в случайном лесу. В связи с этим я намерен использовать mtry, nodeize, maxnodes и т. Д. Не могли бы вы помочь мне выбрать значения для этих параметров? Я использую R. Также, если возможно, скажите, пожалуйста, как я могу использовать перекрестную проверку в k-кратном порядке для случайного …

7
LinkedIn веб-соскоб
Недавно я обнаружил новый пакет R для подключения к LinkedIn API. К сожалению, API LinkedIn кажется довольно ограниченным для начала; Например, вы можете получить только базовые данные о компаниях, а это отдельно от данных о физических лицах. Я хотел бы получить данные обо всех сотрудниках данной компании, что вы можете …

3
Полевые машины факторизации
Кто-нибудь может объяснить, как машины факторизации с учетом специфики поля (FFM) сравниваются со стандартными машинами факторизации (FM)? Стандарт: http://www.ismll.uni-hildesheim.de/pub/pdfs/Rendle2010FM.pdf «Полевая информация»: http://www.csie.ntu.edu.tw/~r01922136/kaggle-2014-criteo.pdf

1
Решения для непрерывной онлайн-идентификации кластеров?
Позвольте мне показать вам пример гипотетического приложения онлайн кластерной: В момент времени n точек 1,2,3,4 выделяются синему кластеру A, а точки b, 5,6,7 выделяются красному кластеру B. В момент времени n + 1 вводится новая точка a, которая назначается синему кластеру A, но также вызывает назначение точки b также синему …

2
Нейронная сеть для мониторинга сервера
Я смотрю на pybrain для принятия сигналов монитора сервера и определения основной причины проблемы. Я доволен тем, обучение его с помощью контролируемого обучения и курирования наборов обучающих данных. Данные структурированы примерно так: Тип сервера A # 1 Тип тревоги 1 Тип тревоги 2 Тип сервера # 2 Тип тревоги 1 …

1
Fisher Scoring v / s Координатный спуск для MLE в R
Базовая функция R glm()использует баллы Фишера для MLE, в то время как, по- glmnetвидимому, используется метод спуска координат для решения того же уравнения. Спуск по координатам более эффективен по времени, чем оценка Фишера, так как оценка Фишера вычисляет производную матрицу второго порядка в дополнение к некоторым другим матричным операциям. что …

2
Решая систему уравнений с разреженными данными
Я пытаюсь решить систему уравнений, которая имеет 40 независимых переменных (x1, ..., x40) и одну зависимую переменную (у). Общее количество уравнений (количество строк) составляет ~ 300, и я хочу решить для набора из 40 коэффициентов, который минимизирует общую сумму квадратов ошибки между y и прогнозируемым значением. Моя проблема в том, …

5
Как объединить данные за месяц, день и неделю?
Google Trends возвращает еженедельные данные, поэтому мне нужно найти способ объединить их с моими ежедневными / ежемесячными данными. Пока что я разбил каждую серию на ежедневные данные, например: от: 2013-03-03 - 2013-03-09 37 чтобы: 2013-03-03 37 2013-03-04 37 2013-03-05 37 2013-03-06 37 2013-03-07 37 2013-03-08 37 2013-03-09 37 Но это …

3
Создайте двоичный классификатор только с положительными и непомеченными данными
У меня есть 2 набора данных, один с положительными экземплярами того, что я хотел бы обнаружить, и один с немечеными экземплярами. Какие методы я могу использовать? В качестве примера, предположим, что мы хотим понять, обнаруживать спам по электронной почте на основе нескольких структурированных характеристик электронной почты. У нас есть один …

4
Техника извлечения признаков - суммирование последовательности данных
Я часто строю модель (классификацию или регрессию), где у меня есть некоторые предикторные переменные, которые являются последовательностями, и я пытался найти технические рекомендации для их обобщения наилучшим образом, чтобы включить их в качестве предикторов в модель. В качестве конкретного примера, скажем, строится модель, позволяющая предсказать, покинет ли клиент компанию в …

4
Является ли GLM статистической или машины модели обучения?
Я думал, что обобщенная линейная модель (GLM) будет рассматриваться как статистическая модель, но один из моих друзей сказал мне, что некоторые статьи классифицируют ее как технику машинного обучения. Какой из них является истинным (или точнее)? Любое объяснение будет оценено.

4
Алгоритм генерации правил классификации
Таким образом, у нас есть потенциал для приложения машинного обучения, которое довольно точно вписывается в традиционную проблемную область, решаемую классификаторами, то есть у нас есть набор атрибутов, описывающих элемент, и «корзина», в которой они заканчиваются. Однако вместо того, чтобы создавать модели из вероятностей, как в наивных байесовских или аналогичных классификаторах, …

3
Могут ли алгоритмы сокращения карт, написанные для MongoDB, быть перенесены в Hadoop позже?
В нашей компании у нас есть база данных MongoDB, содержащая много неструктурированных данных, по которым нам нужно запускать алгоритмы преобразования карт для генерации отчетов и других анализов. У нас есть два подхода для выбора необходимого анализа: Один из подходов заключается в извлечении данных из MongoDB в кластер Hadoop и проведении …

2
Выпадение на каких слоях LSTM?
LSTMРекомендуется ли использовать многослойный режим с выпадающим списком для всех скрытых слоев, а также для выходных плотных слоев? В статье Хинтона (в которой предлагалось Dropout) он помещал Dropout только на плотные слои, но это было потому, что скрытые внутренние слои были сверточными. Очевидно, я могу проверить свою конкретную модель, но …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.