Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

4
Интервал прогнозирования вокруг прогноза временных рядов LSTM
Существует ли метод для расчета интервала прогнозирования (распределения вероятностей) вокруг прогноза временного ряда из нейронной сети LSTM (или другой рекуррентной)? Скажем, например, я прогнозирую 10 выборок в будущем (от t + 1 до t + 10), основываясь на последних 10 наблюдаемых выборках (от t-9 до t), я ожидаю, что прогноз …

3
Как глубоко обучение NNS различного сейчас (2016) от тех, которые я изучал только 4 года назад (2012)?
В Википедии и deeplearning4j сказано, что NN с глубоким обучением (DLNN) - это NN, которые имеют> 1 скрытый слой. Подобные NN были стандартными в университете для меня, в то время как DLNN сейчас очень популярны. Был там, сделал это - в чем дело? Я также слышал, что сложенные NN считаются …

2
Есть ли возможность изменить показатель, используемый обратным вызовом ранней остановки в Керасе?
При использовании обратного вызова ранней остановки в Keras обучение останавливается, когда некоторая метрика (обычно потеря проверки) не увеличивается. Есть ли способ использовать другую метрику (например, точность, отзыв, f-мера) вместо потери проверки? Все примеры, которые я видел до сих пор, похожи на этот: callbacks.EarlyStopping (monitor = 'val_loss', терпение = 5, verbose …

3
Что это значит, когда мы говорим, что большинство точек в гиперкубе находятся на границе?
Если у меня есть 50-мерный гиперкуб. И я определяю его границу как или где - размерность гиперкуба. Тогда вычисление доли точек на границе гиперкуба составит . Что это значит? Значит ли это, что остальное пространство пусто? Если точек находятся на границе, то точки внутри куба не должны быть равномерно распределены?0&lt;xj&lt;0.050&lt;xj&lt;0.050<x_j<0.050.95&lt;xj&lt;10.95&lt;xj&lt;10.95<x_j<1xjxjx_j0.9950.9950.99599%99%99\%


4
Импорт содержимого файла CSV в фреймы данных pyspark
Как я могу импортировать файл .csv в фреймы данных pyspark? Я даже пытался прочитать CSV-файл в Pandas, а затем преобразовать его в искровой фрейм данных, используя createDataFrame, но он все еще показывает некоторую ошибку. Может ли кто-нибудь провести меня через это? Кроме того, скажите, пожалуйста, как я могу импортировать файл …
13 pyspark 


2
Как вы применяете SMOTE в текстовой классификации?
Техника избыточной выборки синтетического меньшинства (SMOTE) - это метод избыточной выборки, используемый в проблеме с несбалансированным набором данных. До сих пор у меня есть идея, как применить его к общим структурированным данным. Но возможно ли применить его к проблеме классификации текста? Какую часть данных вам нужно отбирать? Об этом уже …

3
Запрос Natural Language to SQL
Я работал над разработкой системы «Преобразование естественного языка в SQL-запрос». Я прочитал ответы на подобные вопросы, но не смог получить информацию, которую искал. Ниже приведена блок-схема для такой системы, которую я получил от алгоритма преобразования естественного языка в запросы SQL для реляционных баз данных Гаримы Сингха, Аруна Соланки Я понял …

4
Одна горячая альтернатива кодирования для больших категориальных значений?
У меня есть датафрейм с большими категориальными значениями более 1600 категорий, есть ли способ найти альтернативы, чтобы у меня не было более 1600 столбцов. Я нашел эту интересную ссылку ниже http://amunategui.github.io/feature-hashing/#sourcecode Но они конвертируются в класс / объект, который я не хочу. Я хочу, чтобы мой конечный результат был в …

5
Преимущества pandas dataframe для обычной реляционной базы данных
В Data Science многие, кажется, используют фреймы данных pandas в качестве хранилища данных. Каковы особенности панд, которые делают его превосходным хранилищем данных по сравнению с обычными реляционными базами данных, такими как MySQL , которые используются для хранения данных во многих других областях программирования? Хотя pandas предоставляет некоторые полезные функции для …
13 pandas  databases 

2
Почему бы не всегда использовать технику оптимизации ADAM?
Похоже, что оптимизатор адаптивной оценки моментов (Адам) почти всегда работает лучше (быстрее и надежнее, достигая глобального минимума) при минимизации функции стоимости в обучении нейронных сетей. Почему не всегда использовать Адама? Зачем вообще использовать RMSProp или оптимизаторы импульса?

1
Многомерный и многомерный прогноз временных рядов (RNN / LSTM) Керас
Я пытался понять, как представлять и формировать данные для составления многомерного и многомерного прогноза временных рядов с использованием Keras (или TensorFlow), но я все еще очень неясен после прочтения многих постов / учебников / документации в блоге о том, как представлять данные в правильная форма (большинство примеров немного меньше Мой …
12 python  keras  rnn  lstm 

1
Многозадачное обучение в Керасе
Я пытаюсь реализовать общие слои в Keras. Я вижу, что Keras имеет keras.layers.concatenate, но я не уверен в документации о его использовании. Могу ли я использовать его для создания нескольких общих слоев? Как лучше всего реализовать простую общую нейронную сеть, как показано ниже, с использованием Keras? Обратите внимание, что все …

1
Так в чем же подвох с LSTM?
Я расширяю свои знания о пакете Keras и работаю с некоторыми из доступных моделей. У меня есть проблема двоичной классификации НЛП, которую я пытаюсь решить, и я применяю разные модели. Поработав с некоторыми результатами и прочитав все больше и больше о LSTM, кажется, что этот подход намного превосходит все, что …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.