Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Ожидаемое значение , коэффициент детерминации, при нулевой гипотезе
Мне любопытно заявление, сделанное внизу первой страницы в этом тексте относительно настройкиR2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). Текст гласит: Логика корректировки заключается в следующем: в обычной множественной регрессии случайный предиктор объясняет в среднем пропорцию 1/(n–1)1/(n–1)1/(n – 1) вариации ответа, так что mmm случайных предикторов объясняют вместе, в среднем, m/(n–1)m/(n–1)m/(n – 1) вариации ответа; …

3
Почему иерархический софтмакс лучше для нечастых слов, а отрицательная выборка лучше для частых слов?
Интересно, почему иерархический софтмакс лучше подходит для нечастых слов, а отрицательная выборка лучше для частых слов в моделях CBOW и skip-грамм word2vec. Я прочитал претензию на https://code.google.com/p/word2vec/ .

2
Производная гауссовского процесса
Я считаю, что производная гауссовского процесса (ГП) - это другая ГП, и поэтому я хотел бы знать, существуют ли уравнения замкнутой формы для уравнений предсказания производной от ГП? В частности, я использую квадратичное экспоненциальное (также называемое гауссовским) ковариационное ядро ​​и хочу знать, как делать предсказания о производной гауссовского процесса.

2
Как выбрать оптимальную ширину бункера при калибровке вероятностных моделей?
Предпосылки: Здесь есть несколько замечательных вопросов / ответов о том, как калибровать модели, которые предсказывают вероятности того или иного исхода. Например Оценка Бриера и ее разложение на разрешение, неопределенность и надежность . Калибровочные графики и изотоническая регрессия . Эти методы часто требуют использования метода биннинга для прогнозируемых вероятностей, так что …

1
Одинаковые коэффициенты, оцениваемые в модели Пуассона и Квази-Пуассона
При моделировании данных подсчета претензий в страховой среде я начал с Пуассона, но затем заметил чрезмерную дисперсию. Квази-Пуассон лучше моделировал большее отношение средней дисперсии, чем основной Пуассон, но я заметил, что коэффициенты были идентичны как в модели Пуассона, так и в модели Квази-Пуассона. Если это не ошибка, почему это происходит? …

4
Подсказки, что проблема хорошо подходит для линейной регрессии
Я изучаю линейную регрессию, используя Введение в анализ линейной регрессии Монтгомери, Пека и Вайнинга . Я хотел бы выбрать проект анализа данных. У меня наивная мысль, что линейная регрессия подходит только тогда, когда подозревают, что существуют линейные функциональные отношения между объясняющими переменными и переменной отклика. Но не так много реальных …

1
Оценки «Приблизительно нормально» для t-тестов
Я проверяю равенство средств, используя t-критерий Уэлча. Базовое распределение далеко от нормального (более искажено, чем пример в соответствующем обсуждении здесь ). Я могу получить больше данных, но хотел бы найти принципиальный способ определить, в какой степени это сделать. Существует ли хорошая эвристика для оценки приемлемости распределения выборки? Какие отклонения от …

1
Порядковый логистический регресс в Python
Я хотел бы запустить порядковую логистическую регрессию в Python - для переменной ответа с тремя уровнями и несколькими объяснительными факторами. statsmodelsПакет поддерживает двоичный логит и модель полиномиального логита (MNLogit), но не упорядоченную логит. Поскольку основополагающая математика не так уж отличается, мне интересно, может ли она быть легко реализована с помощью …

1
Карточная игра. Если я вытаскиваю четыре карты случайным образом, а вы берете шесть, какова вероятность того, что моя старшая карта выше вашей самой высокой?
Как указано в названии, скажите, что если я случайно выберу 4 карты, а вы вытянете 6 из одной колоды, какова вероятность того, что моя старшая карта превзойдет вашу старшую? Как это изменится, если мы будем рисовать из разных колод? Благодарность!

1
Тест на пригодность в логистической регрессии; какую «посадку» мы хотим проверить?
Я имею в виду вопрос и его ответы: как сравнить (вероятностную) прогностическую способность моделей, разработанных на основе логистической регрессии? @ Clark Chong и ответы / комментарии @Frank Harrell. и к вопросу о Степени свободы в тесте Хосмера-Лемешоуχ2χ2\chi^2 и комментариях. Я прочитал статью DW Hosmer, T. Hosmer, S. Le Cessie, S. …

2
Перевод проблемы машинного обучения в регрессионную структуру
Предположим, у меня есть панель объясняющих переменных , для i = 1 . , , N , t = 1 . , , Т , а также вектор двоичных результатов зависимых переменных У я Т . Таким образом, Y наблюдается только в последний момент времени T, а не в любое …

2
Захват начальных образцов при использовании усеченного обратного распространения по времени (RNN / LSTM)
Скажем, я использую RNN / LSTM для анализа настроений, который является подходом «многие к одному» (см. Этот блог ). Сеть обучается по усеченному обратному распространению по времени (BPTT), где сеть разворачивается всего за 30 последних шагов, как обычно. В моем случае каждый из моих текстовых разделов, которые я хочу классифицировать, …

3
Какой алгоритм я могу использовать, чтобы найти корреляции между событиями?
Я новичок в машинном обучении, поэтому я пытаюсь найти некоторую литературу, но я даже не знаю, для чего Google. Мои данные имеют следующую форму: User A performs Action P User B performs Action Q User C performs Action R ... User C performs Action X User A performs Action Y …

5
Является ли автоматическое машинное обучение мечтой?
Когда я открываю машинное обучение, я вижу разные интересные методы, такие как: автоматически настраивать алгоритмы с помощью таких методов, как grid search, получить более точные результаты за счет комбинации различных алгоритмов одного и того же «типа», это boosting, получить более точные результаты за счет сочетания различных алгоритмов (но не тот …

3
Различные способы получения доверительного интервала для отношения шансов из логистической регрессии
Я изучаю, как построить 95% доверительный интервал для отношения шансов из коэффициентов, полученных в логистической регрессии. Итак, учитывая модель логистической регрессии, log(p1−p)=α+βxlog⁡(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} такой, что x=0x=0x = 0 для контрольной группы и x=1x=1x = 1 для группы случаев. Я …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.