Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

1
Реализация Python t-SNE: расхождение Кульбака-Лейблера
t-SNE, как и в [1], работает путем постепенного уменьшения расхождения Кульбака-Лейблера (KL), пока не будет выполнено определенное условие. Создатели t-SNE предлагают использовать дивергенцию KL в качестве критерия производительности для визуализаций: Вы можете сравнить расхождения Kullback-Leibler, о которых сообщает t-SNE. Совершенно нормально выполнить t-SNE десять раз и выбрать решение с самой …

4
Работа с кластерами HPC
В моем университете у нас есть вычислительный кластер HPC. Я использую кластер для обучения классификаторов и так далее. Поэтому, обычно для отправки задания в кластер (например, сценарий python scikit-learn) мне нужно написать сценарий Bash, который содержит (среди прочего) такую ​​команду qsub script.py. Тем не менее, я нахожу этот процесс очень …

3
Визуализация данных для анализа паттернов (не зависит от языка, но предпочтительнее для R)
Я хочу построить байты из образа диска, чтобы понять в них закономерность. Это в основном академическая задача, так как я почти уверен, что этот шаблон был создан программой тестирования диска, но я все равно хотел бы его перепроектировать. Я уже знаю, что шаблон выровнен с периодичностью 256 символов. Я могу …
11 r  visualization 

4
Где я могу скачать историческую рыночную капитализацию и ежедневные данные об обороте акций?
Существует множество источников, которые предоставляют исторические данные о запасах, но они предоставляют только поля OHLC вместе с объемом и скорректированным закрытием. Также несколько источников, которые я нашел, предоставляют наборы рыночной капитализации, но они ограничены акциями США. Yahoo Finance предоставляет эти данные онлайн, но нет возможности загрузить их (или ни одной …
11 dataset 

4
Является ли логистическая регрессия на самом деле алгоритмом регрессии?
Обычное определение регрессии (насколько мне известно) - это прогнозирование непрерывной выходной переменной из заданного набора входных переменных . Логистическая регрессия - это двоичный алгоритм классификации, поэтому он дает категориальный результат. Это действительно алгоритм регрессии? Если так, то почему?

3
Data Science ориентированный набор данных / исследовательский вопрос для диссертации MSc Statistics
Я хотел бы изучить «науку о данных». Этот термин кажется мне немного расплывчатым, но я ожидаю, что он потребует: машинное обучение (а не традиционная статистика); достаточно большой набор данных для анализа кластеров. Какие есть хорошие наборы данных и проблемы, доступные статистику с некоторым опытом программирования, который я могу использовать для …

3
Как обрабатывать запросы на естественном языке?
Мне любопытно, что запросы на естественном языке. Стэнфорд обладает мощным набором программного обеспечения для обработки естественного языка . Я также видел библиотеку Apache OpenNLP и общую архитектуру для текстовой инженерии . Существует невероятное количество применений для обработки естественного языка, что затрудняет быстрое освоение документации этих проектов. Можете ли вы немного …
11 nlp 


1
Параметр scikit-learn n_jobs об использовании процессора и памяти
В большинстве оценок в scikit-learn в n_jobsпараметре fit/ predictmethod есть параметр для создания параллельных заданий с использованием joblib. Я заметил, что его установка -1создает всего 1 процесс Python и максимально увеличивает количество ядер, в результате чего загрузка ЦП достигает 2500% сверху. Это сильно отличается от установки некоторого положительного целого числа> …

2
Как я могу соответствовать категориальным типам данных для классификации случайных лесов?
Мне нужно найти точность набора обучающих данных, применяя алгоритм случайного леса. Но мой тип набора данных - как категориальный, так и числовой. Когда я пытался уместить эти данные, я получаю сообщение об ошибке. 'Вход содержит NaN, бесконечность или значение, слишком большое для dtype (' float32 ')'. Может быть проблема в …

3
Что такое LSTM, BiLSTM и когда их использовать?
Я очень новичок в области глубокого обучения, и мне особенно интересно знать, что такое LSTM и BiLSTM и когда их использовать (основные области применения). Почему LSTM и BILSTM более популярны, чем RNN? Можем ли мы использовать эти архитектуры глубокого обучения в неконтролируемых задачах?

2
Странное поведение с оптимизатором Адама, когда тренируешься слишком долго
Я пытаюсь обучить один персептрон (1000 входных единиц, 1 выходной, без скрытых слоев) на 64 случайно сгенерированных точках данных. Я использую Pytorch с помощью оптимизатора Adam: import torch from torch.autograd import Variable torch.manual_seed(545345) N, D_in, D_out = 64, 1000, 1 x = Variable(torch.randn(N, D_in)) y = Variable(torch.randn(N, D_out)) model = …

1
Количество и размер плотных слоев в CNN
Большинство сетей, которые я видел, имеют один или два плотных слоя перед последним слоем softmax. Есть ли принципиальный способ выбора количества и размера плотных слоев? Являются ли два плотных слоя более репрезентативными, чем один, для одного и того же числа параметров? Следует ли применять отсев перед каждым плотным слоем или …
11 convnet 

4
Машинное обучение против глубокого обучения
Меня немного смущает различие между терминами «машинное обучение» и «глубокое обучение». Я прогуглил это и прочитал много статей, но это все еще не очень ясно для меня. Известное определение машинного обучения Тома Митчелла: Компьютерная программа называется извлечь из опыта Е относительно некоторого класса задач T и измерения производительности P , …

4
Показатель эффективности: почему это называется отзывом?
Точность - это доля извлеченных экземпляров, которые имеют отношение, в то время как отзыв (также известный как чувствительность) - это доля соответствующих извлекаемых экземпляров. Я знаю их значение, но я не знаю, почему это называется отзыв ? Я не являюсь носителем английского языка. Я знаю, что вспомнить означает помнить, тогда …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.