Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Метрики для оценки алгоритмов ранжирования
Я заинтересован в рассмотрении нескольких различных метрик для алгоритмов ранжирования - на странице Википедии «Обучение для ранжирования» перечислены некоторые из них, в том числе: • Средняя средняя точность (MAP); • DCG и NDCG; • Точность @ n, NDCG @ n, где «@n» означает, что метрики оцениваются только для первых n …

1
Что такое «Целевое ожидание максимального правдоподобия»?
Я пытаюсь понять некоторые работы Марка ван дер Лаана. Он - теоретический статистик в Беркли, работающий над проблемами, которые существенно пересекаются с машинным обучением. Одна проблема для меня (помимо глубокой математики) состоит в том, что он часто заканчивает тем, что описывает знакомые подходы машинного обучения, используя совершенно другую терминологию. Одна …

2
Что такое точность Top-n?
Я читаю научную статью о классификации изображений. В экспериментальных результатах они говорят о точности топ-1 и топ-5, но я никогда не слышал этого термина и не могу найти его с помощью Google. Может кто-нибудь дать мне определение или указать мне где-нибудь? :)

1
Как интерпретировать отрицательный ACF (автокорреляционная функция)?
Поэтому я построил график ACF / PACF возврата нефти и ожидал увидеть некоторую положительную автокорреляцию, но, к моему удивлению, я получаю только отрицательную значительную автокорреляцию. Как мне интерпретировать приведенный выше график? Похоже, они указывают на то, что существует тенденция к увеличению возврата нефти, когда оно уменьшалось ранее, и наоборот, что …

3
Проверьте, совпадают ли многомерные распределения
Допустим, у меня есть две или более выборочных совокупностей n-мерных непрерывнозначных векторов. Есть ли непараметрический способ проверить, относятся ли эти образцы к одному и тому же распределению? Если это так, есть ли функция в R или Python для этого?

2
Почему масштабирование важно для линейной классификации SVM?
При выполнении линейной классификации SVM часто бывает полезно нормализовать тренировочные данные, например, путем вычитания среднего значения и деления на стандартное отклонение, а затем масштабировать данные теста со средним и стандартным отклонением обучающих данных. Почему этот процесс резко меняет производительность классификации?

3
Сравнение ранжированных списков
Предположим, что две группы, включающие в себя и ранжируют набор из 25 элементов от наиболее до наименее важных. Каковы лучшие способы сравнить эти рейтинги?n1n1n_1n2n2n_2 Ясно, что можно сделать 25 U-тестов Манна-Уитни, но это приведет к 25 интерпретируемым результатам, что может быть слишком много (и, при строгом использовании, поднимает вопросы множественных …

1
Соотношение расстояний и взаимная информация
Я работал с взаимной информацией в течение некоторого времени. Но я нашел очень недавнюю меру в «мире корреляции», которую также можно использовать для измерения независимости распределения, так называемой «корреляции расстояний» (также называемой броуновской корреляцией): http://en.wikipedia.org/wiki/Brownian_covariance , Я проверил документы, где вводится эта мера, но не нашел никаких ссылок на взаимную …

2
Почему U-критерий Манна-Уитни имеет значение, когда медианы равны?
Я получил результаты теста ранга Манна-Уитни, которые я не понимаю. Медиана двух популяций идентична (6,9). Верхний и нижний квантили каждой популяции: 6.64 и 7.2 6.60 и 7.1 Значение р, полученное в результате теста, сравнивающего эти популяции, составляет 0,007. Как эти популяции могут значительно отличаться? Это из-за распространения о медиане? Бокплот, …

1
Каковы наиболее точные из известных границ для распределенных переменных ?
Пусть X∼χ2kX∼χk2X \sim \chi^2_k - распределенная случайная величина хи-квадрат с kkk степенями свободы. Каковы наиболее точные известные оценки для следующих вероятностей P[X&gt;t]≤1−δ1(t,k)P[X&gt;t]≤1−δ1(t,k) \mathbb{P}[X > t] \leq 1 - \delta_1(t, k) и P[X&lt;z]≤1−δ2(z,k)P[X&lt;z]≤1−δ2(z,k) \mathbb{P}[X < z] \leq 1 - \delta_2(z, k) где δ1δ1\delta_1 и δ2δ2\delta_2 - некоторые функции. Указатели на соответствующие …

1
Анализ взаимной корреляции между точечными процессами
Я хотел бы получить совет относительно метода анализа, который я использую, чтобы узнать, является ли он статистически обоснованным. Я измерил две точки процессы и Т 2 = т 2 1 , т 2 2 , . , , , t 2 m, и я хочу определить, связаны ли события в …


1
Что такое временная классификация коннекционистов (CTC)?
Я ищу проект оптического распознавания символов (OCR). После некоторых исследований я натолкнулся на интересную архитектуру: CNN + RNN + CTC. Я знаком с извилистыми нейронными сетями (CNN) и рекуррентными нейронными сетями (RNN), но что такое временная классификация Connectionist (CTC)? Я хотел бы получить объяснение с точки зрения непрофессионала.

2
Зачем вам нужно масштабировать данные в KNN
Может кто-нибудь объяснить мне, почему вам нужно нормализовать данные при использовании K ближайших соседей. Я пытался найти это, но я все еще не могу понять это. Я нашел следующую ссылку: https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 Но в этом объяснении я не понимаю, почему больший диапазон в одной из функций влияет на прогнозы.

3
Нулевые раздутые распределения, что они на самом деле?
Я изо всех сил пытаюсь понять ноль раздутых распределений. Кто они такие? В чем смысл? Если у меня есть данные со многими нулями, то я мог бы подогнать логистическую регрессию, сначала вычислить вероятность нулей, а затем я мог бы удалить все нули, а затем подобрать регулярную регрессию, используя мой выбор …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.