Наука о данных

Вопросы и ответы для специалистов по науке о данных, специалистов по машинному обучению и тех, кто хочет больше узнать об этой области

1
Искра, оптимально разделяющая один RDD на два
У меня есть большой набор данных, который мне нужно разделить на группы в соответствии с конкретными параметрами. Я хочу, чтобы работа выполнялась максимально эффективно. Я могу представить два способа сделать это Вариант 1 - Создать карту из оригинального СДР и отфильтровать def customMapper(record): if passesSomeTest(record): return (1,record) else: return (0,record) …

4
Как почистить IMDB веб-страницу?
Я пытаюсь самостоятельно изучить работу с использованием Python как часть усилий по изучению анализа данных. Я пытаюсь очистить веб-страницу imdb, URL которой следующий: http://www.imdb.com/search/title?sort=num_votes,desc&start=1&title_type=feature&year=1950,2012 Я использую модуль BeautifulSoup. Ниже приведен код, который я использую: r = requests.get(url) # where url is the above url bs = BeautifulSoup(r.text) for movie in …

3
Модель векторного пространства косинус tf-idf для поиска похожих документов
Иметь корпус более миллиона документов Для данного документа нужно найти похожие документы с использованием косинуса, как в модели векторного пространства d1⋅d2/(||d1||||d2||)d1⋅d2/(||d1||||d2||)d_1 \cdot d_2 / ( ||d_1|| ||d_2|| ) Все tf были нормализованы с использованием увеличенной частоты, чтобы предотвратить смещение к более длинным документам, как в этом tf-idf : tf(t,d)=0.5+0.5f(t,d)max{f(t,d):t∈d}Tе(T,d)знак равно0,5+0,5е(T,d)мaИкс{е(T,d):T∈d}tf(t,d)=0.5+0.5\frac{f(t,d)}{\mathrm{max}\{f(t,d): …

1
Несколько меток в контролируемом алгоритме обучения
У меня есть текстовый корпус с соответствующими темами. Например "A rapper Tupac was shot in LA"и было помечено как ["celebrity", "murder"]. Таким образом, в основном каждый вектор объектов может иметь много меток (не одинаковое количество. Первый вектор объектов может иметь 3 метки, второй 1, третий 5). Если бы каждому тексту …

2
Масштабируемый выброс / обнаружение аномалий
Я пытаюсь настроить инфраструктуру больших данных, используя Hadoop, Hive, Elastic Search (среди прочих), и я хотел бы запустить некоторые алгоритмы для определенных наборов данных. Мне бы хотелось, чтобы сами алгоритмы были масштабируемыми, поэтому это исключает использование таких инструментов, как Weka, R или даже RHadoop. Библиотека Apache Mahout , по-видимому, является …

3
Анализ файла журнала: извлечение информационной части из части значения
Я пытаюсь создать набор данных из нескольких файлов журнала одного из наших продуктов. Различные файлы журналов имеют свой собственный макет и собственный контент; Я успешно сгруппировал их, остался всего один шаг ... Действительно, журнал «Сообщения» - лучшая информация. У меня нет исчерпывающего списка всех этих сообщений, и это плохая идея …

2
Библиотеки для онлайн-машинного обучения
Я ищу пакеты (либо в python, R, либо в отдельном пакете) для онлайн-обучения для прогнозирования биржевых данных. Я нашел и прочитал о Vowpal Wabbit ( https://github.com/JohnLangford/vowpal_wabbit/wiki ), который кажется довольно многообещающим, но мне интересно, есть ли какие-либо другие пакеты там. Заранее спасибо.

1
Библиотеки для (алгоритмы распространения меток / частое извлечение подграфа) для графов в R
Общее описание проблемы У меня есть график, где некоторые вершины помечены с типом с 3 или 4 возможных значений. Для остальных вершин тип неизвестен. Моя цель - использовать график, чтобы предсказать тип для немаркированных вершин. Возможные рамки Я подозреваю, что это вписывается в общую структуру проблем распространения этикеток, основываясь на …

2
реализация временной разницы в шахматах
Я занимаюсь разработкой шахматной программы, в которой используется алгоритм обрезки альфа-бета и функция оценки, которая оценивает позиции с использованием следующих функций, а именно: материал, безопасность короля, мобильность, структура пешки и захваченные фигуры и т. Д. ..... Моя функция оценки полученный из е( р ) = ш1⋅ материал + ш2⋅ kingsafety …

2
Извлечь каноническую строку из списка шумных строк
У меня есть тысячи списков строк, и каждый список имеет около 10 строк. Большинство строк в данном списке очень похожи, хотя некоторые строки (редко) полностью не связаны с другими, а некоторые строки содержат нерелевантные слова. Их можно считать шумными вариациями канонической струны. Я ищу алгоритм или библиотеку, которая преобразует каждый …

4
Почему несколько типов моделей могут давать почти одинаковые результаты?
Я анализировал набор данных из ~ 400 тыс. Записей и 9 переменных. Зависимая переменная является двоичной. Я установил логистическую регрессию, дерево регрессии, случайный лес и дерево с градиентным повышением. Все они дают виртуально идентичные данные соответствия, когда я проверяю их на другом наборе данных. Почему это так? Я предполагаю, что …

4
Какие начальные шаги я должен использовать, чтобы понять большие наборы данных, и какие инструменты я должен использовать?
Предостережение: я начинающий, когда дело доходит до машинного обучения, но хочу учиться. У меня большой набор данных, и я пытаюсь найти в нем закономерность. Может быть / не быть корреляции между данными, либо с известными переменными, либо с переменными, которые содержатся в данных, но которые я еще не осознал, на …

3
Как различные статистические методы (регрессия, PCA и т. Д.) Масштабируются в зависимости от размера и размера выборки?
Существует ли известная общая таблица статистических методов, объясняющих, как они масштабируются в зависимости от размера и размера выборки? Например, мой друг сказал мне на днях, что время вычисления простой быстрой сортировки одномерных данных размера n равно n * log (n). Так, например, если мы регрессируем y против X, где X …

3
Статистика + Информатика = Наука о данных? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме Data Stack Exchange. Закрыто 5 лет назад . Я хочу стать специалистом по данным . Я изучал прикладную статистику (актуарная наука), поэтому у меня большой статистический …

1
Прогноз с неатомарными особенностями
Я хотел бы использовать неатомарные данные, как функцию для прогноза. Предположим, у меня есть таблица с этими функциями: - Column 1: Categorical - House - Column 2: Numerical - 23.22 - Column 3: A Vector - [ 12, 22, 32 ] - Column 4: A Tree - [ [ 2323, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.