Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

2
Потери и точность проверки остаются постоянными
Я пытаюсь реализовать эту статью на множестве медицинских изображений. Я делаю это в Керасе. Сеть по существу состоит из 4 слоев conv и max-pool, за которыми следуют полностью связанный слой и программный классификатор max. Насколько я знаю, я следовал архитектуре, упомянутой в статье. Однако потери и точность проверки просто остаются …

2
Сколько изображений в классе достаточно для обучения CNN
Я начинаю проект, где задача состоит в том, чтобы идентифицировать типы кроссовок по изображениям. В настоящее время я читаю в реализации TensorFlow и Torch . Мой вопрос: сколько изображений на класс требуется для достижения разумной эффективности классификации?

3
Функция корректировки ценового потока для несбалансированных данных
У меня проблема классификации с сильно несбалансированными данными. Я прочитал, что снова и Undersampling, а также изменения стоимости на недостаточно категоричные результаты приведут к лучшей подгонке. До того, как это было сделано, тензорный поток классифицировал бы каждый вход как группу большинства (и получал бы точность более 90%, как бы бессмысленно …

3
Нужна помощь в понимании приблизительного предложения точек разделения xgboost
фон: в xgboost в итерационным подгоняет дерево ф т по всему п примерам , которые сводят к минимуму следующей цели:tttftftf_tnnn ∑i=1n[gift(xi)+12hif2t(xi)]∑i=1n[gift(xi)+12hift2(xi)]\sum_{i=1}^n[g_if_t(x_i) + \frac{1}{2}h_if_t^2(x_i)] где сначала порядок и производные второго порядка над нашей предыдущей лучшей оценки у (от итерации т - 1 ):gi,higi,hig_i, h_iy^y^\hat{y}t−1t−1t-1 gi=dy^l(yi,y^)gi=dy^l(yi,y^)g_i=d_{\hat{y}}l(y_i, \hat{y}) hi=d2y^l(yi,y^)hi=dy^2l(yi,y^)h_i=d^2_{\hat{y}}l(y_i, \hat{y}) и наша функция …
12 xgboost  gbm 

2
Глубокое обучение с помощью спектрограмм для распознавания звука
Я искал возможность классифицировать звук (например, звуки животных), используя спектрограммы. Идея состоит в том, чтобы использовать глубоко сверточные нейронные сети, чтобы распознавать сегменты в спектрограмме и выводить одну (или несколько) меток классов. Это не новая идея (см., Например, классификацию звуков китов или распознавание музыкального стиля ). Проблема, с которой я …

3
Как я могу динамически различать категориальные данные и числовые данные?
Я знаю кого-то, кто работает над проектом, который включает в себя прием файлов данных без учета столбцов или типов данных. Задача состоит в том, чтобы взять файл с любым количеством столбцов и различных типов данных и вывести сводную статистику по числовым данным. Однако он не уверен в том, как динамически …

1
Выбор объектов с использованием значений функций в случайных лесах с помощью scikit-learn
Я нанесены художественные важности в случайных лесах с scikit учиться . Как улучшить прогнозирование с использованием случайных лесов, как я могу использовать информацию о графике для удаления объектов? Т.е. как определить, является ли объект бесполезным или, что еще хуже, снижение производительности случайных лесов, основываясь на информации о графике? Сюжет основан …

4
Загрузка большого набора данных в Интернете непосредственно в AWS S3
Кто-нибудь знает, возможно ли импортировать большой набор данных в Amazon S3 с URL? По сути, я хочу избежать загрузки огромного файла и последующей его загрузки на S3 через веб-портал. Я просто хочу указать URL-адрес загрузки для S3 и подождать, пока они загрузят его в свою файловую систему. Это кажется легким …
12 dataset  aws 

3
Помощь относительно NER в NLTK
Я работал в NLTK некоторое время с использованием Python. Проблема, с которой я сталкиваюсь, заключается в том, что они не могут получить помощь по обучению NER в NLTK с моими пользовательскими данными. Они использовали MaxEnt и обучили его на корпусе ACE. Я много искал в Интернете, но я не смог …

2
Моделирование неравномерно распределенных временных рядов
У меня есть непрерывная переменная, отобранная в течение года с нерегулярными интервалами. Некоторые дни имеют более одного наблюдения в час, в то время как другие периоды не имеют ничего в течение нескольких дней. Это делает особенно сложным обнаружение закономерностей во временных рядах, поскольку некоторые месяцы (например, октябрь) имеют высокую выборку, …

2
Инструменты с открытым исходным кодом для помощи в майнинг-потоке результатов лидеров.
Рассмотрим поток, содержащий кортежи, (user, new_score) представляющие оценки пользователей в онлайн-игре. Поток может иметь 100-1000 новых элементов в секунду. В игре 200K до 300K уникальных игроков. Я хотел бы иметь несколько постоянных запросов, таких как: Какие игроки опубликовали более x баллов в скользящем окне продолжительностью один час Какие игроки набрали …

3
Как оживить рост социальной сети?
Я ищу библиотеку / инструмент для визуализации того, как меняется социальная сеть, когда к ней добавляются новые узлы / ребра. Одним из существующих решений является SoNIA: аниматор социальных сетей . Это позволяет вам делать фильмы, как этот . Документация SoNIA гласит, что в данный момент она не работает, и помимо …

3
Как запрос в огромную базу данных возвращает с незначительной задержкой?
Например, при поиске в Google результаты возвращаются практически мгновенно. Я понимаю, что Google сортирует и индексирует страницы с помощью алгоритмов и т. Д., Но я считаю невозможным индексировать результаты каждого отдельного запроса (и результаты персонализируются, что делает это еще более неосуществимым)? Кроме того, не аппаратная задержка в аппаратных средств от …
12 bigdata  google  search 

1
Сколько ячеек LSTM я должен использовать?
Существуют ли какие-либо практические правила (или фактические правила), касающиеся минимального, максимального и «разумного» количества ячеек LSTM, которые я должен использовать? В частности, я имею в виду BasicLSTMCell из TensorFlow и num_unitsсвойства. Пожалуйста, предположите, что у меня есть проблема классификации, определяемая как: t - number of time steps n - length …
12 rnn  machine-learning  r  predictive-modeling  random-forest  python  language-model  sentiment-analysis  encoding  machine-learning  deep-learning  neural-network  dataset  caffe  classification  xgboost  multiclass-classification  unbalanced-classes  time-series  descriptive-statistics  python  r  clustering  machine-learning  python  deep-learning  tensorflow  machine-learning  python  predictive-modeling  probability  scikit-learn  svm  machine-learning  python  classification  gradient-descent  regression  research  python  neural-network  deep-learning  convnet  keras  python  tensorflow  machine-learning  deep-learning  tensorflow  python  r  bigdata  visualization  rstudio  pandas  pyspark  dataset  time-series  multilabel-classification  machine-learning  neural-network  ensemble-modeling  kaggle  machine-learning  linear-regression  cnn  convnet  machine-learning  tensorflow  association-rules  machine-learning  predictive-modeling  training  model-selection  neural-network  keras  deep-learning  deep-learning  convnet  image-classification  predictive-modeling  prediction  machine-learning  python  classification  predictive-modeling  scikit-learn  machine-learning  python  random-forest  sampling  training  recommender-system  books  python  neural-network  nlp  deep-learning  tensorflow  python  matlab  information-retrieval  search  search-engine  deep-learning  convnet  keras  machine-learning  python  cross-validation  sampling  machine-learning 

2
глубокое обучение для задач, не связанных с имиджем и не являющихся НЛП?
Пока есть много интересных приложений для глубокого изучения в области компьютерного зрения или обработки естественного языка. Как это в других более традиционных областях? Например, у меня есть традиционные социально-демографические переменные плюс, возможно, много лабораторных измерений и я хочу предсказать определенную болезнь. Будет ли это приложение для глубокого изучения, если у …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.