Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

2
Машинное обучение Python / Структура проекта Data Science
Я ищу информацию о том, как организовать проект машинного обучения Python. Для обычных проектов Python есть Cookiecutter, а для R ProjectTemplate . Это моя текущая структура папок, но я смешиваю ноутбуки Jupyter с реальным кодом Python, и это не очень понятно. . ├── cache ├── data ├── my_module ├── logs …
10 python 

2
Инструменты для автоматического обнаружения аномалий в таблице SQL?
У меня есть большая таблица SQL, которая по сути является журналом. Данные довольно сложные, и я пытаюсь найти способ идентифицировать аномалии без понимания всех данных. Я нашел много инструментов для обнаружения аномалий, но большинство из них требует своего рода «среднего человека», то есть Elastic Search, Splunk и т. Д. Кто-нибудь …

3
Является ли направление ребер в байесовской сети нерелевантным?
Сегодня на лекции было заявлено, что направление ребер в байесовской сети не имеет большого значения. Они не должны представлять причинность. Очевидно, что вы не можете переключить ни одного ребра в байесовской сети. Например, пусть с и . Если вы переключите на , то больше не будет ациклическим и, следовательно, не …

1
Сходимость в методе К-средних Хартиган-Вонга и других алгоритмах
Я пытался понять различные алгоритмы кластеризации k-средних, которые в основном реализованы в statsпакете Rязыка. Я понимаю алгоритм Ллойда и онлайн-алгоритм МакКуина. Я понимаю их следующим образом: Алгоритм Ллойда: Первоначально выбираются случайные наблюдения «k», которые будут служить центроидами кластеров «k». Затем выполняются следующие шаги в итерации, пока центроиды не сходятся. Евклидово …
10 r  clustering  k-means 

2
ggvis vs. ggplot2 + Shiny; какой выбрать для интерактивной визуализации?
В CrossValidated есть похожий вопрос, и я прочитал ответы. Мой вопрос немного другой. Я не хочу просто визуализировать свои данные, и на самом деле то, что я хочу визуализировать, нелегко визуализировать с помощью любого пакета. У меня есть два набора точек ( координаты ) на моем графике. Я хочу добавить …

2
Тестирование программного обеспечения для Data Science в R
Я часто использую Nose, Tox или Unittest при тестировании моего кода на Python, особенно когда он должен быть интегрирован с другими модулями или другими частями кода. Однако теперь, когда я обнаружил, что использую R больше, чем python, для моделирования и разработки ML. Я понял, что на самом деле не тестирую …

1
Анализ логов сервера с использованием машинного обучения
Мне было поручено проанализировать журналы сервера нашего приложения, которые содержат журналы исключений, журналы событий журналов базы данных и т. Д. Я новичок в машинном обучении, мы используем Spark с упругим поиском и Sparks MLlib (или PredictionIO). Пример желаемого В результате можно было бы прогнозировать на основе собранных журналов исключений, чтобы …

1
Text-Classification-Problem: Word2Vec / NN - лучший подход?
Я рассчитываю разработать систему, которая с учетом абзаца текста сможет классифицировать его и определить контекст: Обучается с пользовательскими текстовыми параграфами (например, комментарии / вопросы / ответы) Каждый элемент в обучающем наборе будет помечен. Так, например, («категория 1», «текстовый абзац») Там будут сотни категорий Каков наилучший подход к созданию такой системы? …

2
Как ИИ учатся действовать, когда проблемное пространство слишком велико
Я учусь лучше всего через эксперименты и пример. Я изучаю нейронные сети, и у меня есть (что я думаю) довольно хорошее понимание классификации и регрессии, а также обучения под наблюдением и без него, но я наткнулся на то, чего не могу понять; Если бы я хотел обучить ИИ играть в …

1
Преобразование автоэнкодеров
Я только что прочитал статью Джеффа Хинтона о преобразовании автоэнкодеров Хинтон, Крижевский и Ван: Преобразование авто-кодировщиков . В искусственных нейронных сетях и машинном обучении, 2011. и очень хотел бы поиграть с чем-то вроде этого. Но, прочитав его, я не смог получить достаточно подробностей из статьи о том, как я мог …


2
Обучение совместному укреплению
У меня уже есть работающая реализация для одного агента, работающего над проблемой динамического ценообразования с целью максимизации дохода. Однако проблема, с которой я работаю, связана с несколькими различными продуктами, которые заменяют друг друга, поэтому динамическое ценообразование их всех с независимыми учениками кажется неправильным, потому что цена одного влияет на вознаграждение …

5
LSTM или другой пакет RNN для R
Я видел впечатляющий результат от моделей LSTM, производящих тексты, подобные Шекспиру. Мне было интересно, существует ли пакет LSTM для R. Я гуглил его, но нашел только пакеты для Python и Julia. (возможно, есть некоторая проблема с производительностью, которая объясняет, почему эти программы более предпочтительны, чем R). Знаете ли вы о …
10 r  neural-network  rnn 


3
Что быстрее: PostgreSQL против MongoDB на больших наборах данных JSON?
У меня есть большой набор данных с 9-метровыми объектами JSON по ~ 300 байт каждый. Это сообщения из агрегатора ссылок: в основном ссылки (URL, заголовок и идентификатор автора) и комментарии (текст и идентификатор автора) + метаданные. Они вполне могут быть реляционными записями в таблице, за исключением того факта, что у …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.