Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Обзор литературы по нелинейной регрессии
Кто-нибудь знает хорошую обзорную статью для статистической литературы по нелинейной регрессии? Меня в первую очередь интересуют результаты согласованности и асимптотики. Особый интерес представляет модель Yя т= м ( хя т, θ ) + ϵя т,YяTзнак равном(ИксяT,θ)+εяT,y_{it} = m(x_{it},\theta) + \epsilon_{it}, для данных панели. Менее интересны непараметрические методы. Предложения для журналов, …


3
ROC против точных кривых отзыва на несбалансированном наборе данных
Я только что закончил читать эту дискуссию. Они утверждают, что PR AUC лучше, чем ROC AUC по несбалансированному набору данных. Например, у нас есть 10 образцов в тестовом наборе данных. 9 образцов положительные и 1 отрицательный. У нас ужасная модель, которая предсказывает все положительное. Таким образом, у нас будет метрика: …

4
Интерпретация отрицательного косинуса сходства
Мой вопрос может быть глупым. Поэтому я заранее извинюсь. Я пытался использовать модель GLOVE, предварительно подготовленную группой Stanford NLP ( ссылка ). Тем не менее, я заметил, что мои результаты сходства показали некоторые отрицательные числа. Это сразу же побудило меня взглянуть на файл словесных векторных данных. По-видимому, значения в словах …

4
Можно ли дать изображения переменного размера в качестве входных данных для сверточной нейронной сети?
Можем ли мы предоставить изображения с переменным размером в качестве входных данных для сверточной нейронной сети для обнаружения объектов? Если возможно, как мы можем это сделать? Но если мы попытаемся обрезать изображение, мы потеряем некоторую часть изображения, и если мы попытаемся изменить его размер, то четкость изображения будет потеряна. Означает …


1
Является ли контролируемое обучение подмножеством обучения с подкреплением?
Похоже, что определение контролируемого обучения является подмножеством обучающего обучения с особым типом функции вознаграждения, основанной на помеченных данных (в отличие от другой информации в среде). Это точное изображение?

4
Почему независимость подразумевает нулевую корреляцию?
Прежде всего, я не спрашиваю это: Почему нулевая корреляция не подразумевает независимость? Это решено (довольно красиво) здесь: /math/444408/why-does-zero-correlation-not-imply-independence Я спрашиваю об обратном ... скажем, две переменные полностью независимы друг от друга. Разве они не могли случайно обнаружить корреляцию? Не должно ли это быть ... независимость подразумевает ОЧЕНЬ МАЛЕНЬКУЮ корреляцию?

3
Как причинно-следственная связь определяется математически?
Каково математическое определение причинно-следственной связи между двумя случайными величинами? Учитывая выборку из совместного распределения двух случайных величин и , когда мы скажем, что вызывает ?XXXYYYXXXYYY Для контекста, я читаю эту статью о причинно-следственной связи .

4
О Джордже Боксе, Галите Шмуэли и научном методе?
(Этот вопрос может показаться, что он лучше подходит для Philosophy SE. Я надеюсь, что статистики смогут уточнить мои неправильные представления о высказываниях Бокса и Шмуэли, поэтому я публикую его здесь). Джордж Бокс (из известности ARIMA) сказал: «Все модели ошибочны, но некоторые полезны». Галит Шмуэли в своей знаменитой статье «Объяснить или …

3
Существует ли более одной «медианной» формулы?
В моей работе, когда люди ссылаются на «среднее» значение набора данных, они обычно ссылаются на среднее арифметическое (то есть «среднее» или «ожидаемое значение»). Если бы я указал среднее геометрическое , люди, вероятно, подумали бы, что я глупый или бесполезный, так как определение «среднего» известно заранее. Я пытаюсь определить, есть ли …

1
Что это означает, что AUC является полусобственным правилом подсчета очков?
Правильное правило подсчета очков - это правило, которое максимизируется «истинной» моделью, и оно не позволяет «хеджировать» или разыгрывать систему (преднамеренно сообщая о различных результатах, как и истинное убеждение модели в улучшении оценки). Оценка Бриера правильная, точность (пропорция классифицирована правильно) неуместна и часто не рекомендуется. Иногда я вижу, что AUC называют …

2
Какие формы распределения приводят к «пифагорейскому ожиданию»?
Пусть X∼Dist(θX)X∼Dist(θX)X \sim \text{Dist}(\theta_X) и - независимые непрерывные случайные величины, сгенерированные из одной и той же неопределенной формы распределения, но с учетом различных значений параметров. Мне интересно найти форму параметрического распределения, для которой для всех допустимых значений параметров справедлива следующая вероятность выборки:Y∼Dist(θY)Y∼Dist(θY)Y \sim \text{Dist}(\theta_Y) P(X>Y|θX,θY)=θ2Xθ2X+θ2Y.P(X>Y|θX,θY)=θX2θX2+θY2.\mathbb{P}(X > Y| \theta_X, \theta_Y) = …

4
Возможно ли, что 3 вектора имеют все отрицательные попарные корреляции?
Учитывая три вектора , и , возможно ли, чтобы корреляции между и , и , а также и были отрицательными? Т.е. возможно ли это?aaabbbcccaaabbbaaacccbbbccc corr(a,b)&lt;0corr(a,c)&lt;0corr(b,c)&lt;0corr(a,b)&lt;0corr(a,c)&lt;0corr(b,c)&lt;0\begin{align} \text{corr}(a,b) < 0\\ \text{corr}(a,c) < 0 \\ \text{corr}(b,c) < 0\\ \end{align}

4
Как байесовская статистика справляется с отсутствием приоров?
Этот вопрос был вдохновлен двумя недавними взаимодействиями, которые у меня были: одно здесь, в резюме , другое на economics.se. Там, я отправил ответ на известный «Конверт парадокса» (заметьте, не как на «правильный ответ» , но в качестве ответа , вытекающих из конкретных предположений о структуре ситуации). Через некоторое время пользователь …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.