Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

2
Как нормализовать данные для нейронной сети и леса принятия решений
У меня есть набор данных с 20000 сэмплами, каждый имеет 12 различных функций. Каждая выборка относится к категории 0 или 1. Я хочу обучить нейронную сеть и лес решений для классификации выборок, чтобы можно было сравнить результаты и оба метода. Первое, на что я наткнулся, это правильная нормализация данных. Одна …

3
Предсказать лучшее время звонка
У меня есть набор данных, включающий набор клиентов в разных городах Калифорнии, время вызова для каждого клиента и статус вызова (True, если клиент отвечает на вызов, и False, если клиент не отвечает). Я должен найти подходящее время звонка для будущих клиентов, так что вероятность ответа на звонок высока. Итак, какова …

2
У Relu есть градиент 0 по определению, тогда почему исчезновение градиента не является проблемой для x <0?
По определению, Relu есть max(0,f(x)). Затем ее градиент определяется как: 1 if x &gt; 0 and 0 if x &lt; 0. Не означает ли это, что градиент всегда равен 0 (исчезает), когда x &lt;0? Тогда почему мы говорим, что Relu не страдает от проблемы градиентного исчезновения?

1
КАК: Инициализация веса глубоких нейронных сетей
Учитывая сложную задачу обучения (например, высокую размерность, сложность данных), глубокие нейронные сети становятся сложными для обучения. Чтобы облегчить многие из проблем, можно: Нормализовать &amp;&amp; данные качества отобранных вручную выберите другой алгоритм обучения (например, RMSprop вместо Gradient Descent) выберите функцию более крутого градиента стоимости (например, перекрестная энтропия вместо MSE) Используйте другую …

3
Как сгруппировать одинаковые значения и посчитать их частоту в Python?
Новичок в аналитике с Python, поэтому, пожалуйста, будьте осторожны :-) Я не смог найти ответ на этот вопрос - извинения, если на него уже ответили в другом формате в другом формате. У меня есть набор данных транзакций для торговой точки. Переменные вместе с объяснением: раздел: раздел магазина, ул; prod_name: название …

1
Неверный вывод линейной регрессии XGBoost
Я новичок в XGBoost, так что простите мое невежество. Вот код Python: import pandas as pd import xgboost as xgb df = pd.DataFrame({'x':[1,2,3], 'y':[10,20,30]}) X_train = df.drop('y',axis=1) Y_train = df['y'] T_train_xgb = xgb.DMatrix(X_train, Y_train) params = {"objective": "reg:linear"} gbm = xgb.train(dtrain=T_train_xgb,params=params) Y_pred = gbm.predict(xgb.DMatrix(pd.DataFrame({'x':[4,5]}))) print Y_pred Выход: [ 24.126194 24.126194] …

3
Построение модели машинного обучения для прогнозирования урожайности на основе экологических данных
У меня есть набор данных, содержащий данные о температуре, количестве осадков и урожайности сои для фермы за 10 лет (2005 - 2014). Я хотел бы прогнозировать урожайность на 2015 год на основе этих данных. Обратите внимание, что набор данных имеет ЕЖЕДНЕВНЫЕ значения для температуры и осадков, но только 1 значение …

1
Пользователь-продукт положительный (нажмите данные) доступны. Как генерировать негатив (данные без кликов)?
Рекомендуется, чтобы у нас были данные о пользовательских продуктах, которые помечены, например, как «клик». Чтобы узнать модель, мне нужны данные по кликам и без кликов. Простейший подход к генерации - это взять пары продуктов пользователя, которые не найдены в данных о кликах. Однако это может вводить в заблуждение. Пример: user1, …

2
Что делать, если данные тестирования имеют меньше возможностей, чем данные обучения?
Допустим, мы прогнозируем продажи магазина, и мои данные обучения имеют два набора функций: Один о продаже магазина с датами (поле «Магазин» не является уникальным) Один из типов магазинов (поле «Магазин» здесь уникально) Таким образом, матрица будет выглядеть примерно так: +-------+-----------+------------+---------+-----------+------+-------+--------------+ | Store | DayOfWeek | Date | Sales | Customers …

2
Как ученые придумали правильные параметры и топологию скрытой модели Маркова для использования?
Я понимаю, как скрытая марковская модель используется в геномных последовательностях, таких как поиск гена. Но я не понимаю, как придумать конкретную марковскую модель. Я имею в виду, сколько состояний должна иметь модель? Сколько возможных переходов? Должна ли модель иметь петлю? Как они узнали бы, что их модель оптимальна? Представляют ли …

1
Сколько учебных данных нужно word2vec?
Я хотел бы сравнить разницу между одним и тем же словом, упомянутым в разных источниках. То есть, чем отличаются авторы в использовании плохо определенных слов, таких как «демократия». Краткий план был Возьмите книги с упоминанием термина «демократия» как простой текст В каждой книге заменить democracyнаdemocracy_%AuthorName% Тренируй word2vecмодель по этим книгам …

1
Насколько гибка связь между целевой функцией и функцией активации выходного слоя?
Во многих пакетах нейронных сетей кажется стандартным объединение целевой функции, которая должна быть минимизирована, с функцией активации в выходном слое. Например, для линейного выходного слоя, используемого для регрессии, является стандартным (и часто единственным выбором) иметь целевую функцию квадрата ошибки. Другим обычным сопряжением является логистический вывод и потери в журнале (или …

1
Как рассчитать дельта-член сверточного слоя, учитывая дельта-члены и веса предыдущего сверточного слоя?
Я пытаюсь обучить искусственную нейронную сеть с двумя сверточными слоями (с1, с2) и двумя скрытыми слоями (с1, с2). Я использую стандартный подход обратного распространения. При обратном проходе я вычисляю член ошибки слоя (дельта) на основе ошибки предыдущего слоя, весов предыдущего слоя и градиента активации относительно функции активации текущего слоя. Более …

1
Нужно ли нормализовать данные при построении деревьев решений с использованием R?
Итак, наш набор данных на этой неделе имеет 14 атрибутов, и каждый столбец имеет очень разные значения. Один столбец имеет значения ниже 1, а другой - от трех до четырех целых цифр. Мы изучали нормализацию на прошлой неделе, и кажется, что вы должны нормализовать данные, когда они имеют очень разные …
10 r  beginner 

2
Усиление локально-чувствительного хэша
Я пытаюсь создать хеш, чувствительный к косинусной местности, чтобы найти подходящие пары элементов без необходимости сравнивать каждую возможную пару. У меня это в основном работает, но большинство пар в моих данных, похоже, имеют косинусное сходство в диапазоне от -0,2 до +0,2, поэтому я пытаюсь нарезать кубики довольно точно и выбирать …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.