Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


5
Интерпретация теоремы Байеса применительно к положительным результатам маммографии
Я пытаюсь обернуть голову вокруг результата теоремы Байеса, примененного к классическому примеру маммографии, с идеальным поворотом маммограммы. Это, Заболеваемость раком:.01.01.01 Вероятность положительной маммографии у пациента с раком:111 Вероятность положительной маммографии, учитывая, что пациент не имеет рака:.01.01.01 Байес: P (рак | маммография +) =1⋅.01(1⋅.01)+(.091⋅.99)1⋅.01(1⋅.01)+(.091⋅.99)\dfrac {1 \cdot .01}{(1 \cdot .01) + (.091 …

1
Почему 95% -й ДИ для медианы должен составлять ?
В различных источниках (см., Например, здесь ) приведена следующая формула для доверительного интервала для медианы (особенно с целью нанесения надрезов на графиках типа «коробка и усы»): 95% CImedian=Median±1.57×IQRN−−√95% CImedian=Median±1.57×IQRN 95\%\ CI_{\rm median} = {\rm Median} \pm \frac{1.57\times IQR}{\sqrt{N}} Магическая постоянная сводит меня с ума, я не могу понять, как она …

1
Когда нельзя распределить выборку по частоте в байесовской апостериорной системе в условиях регрессии?
Мои актуальные вопросы приведены в двух последних абзацах, но для их мотивации: Если я пытаюсь оценить среднее значение случайной величины, которая следует за нормальным распределением с известной дисперсией, я прочитал, что если поставить перед средним равномерное значение, получится апостериорное распределение, пропорциональное функции правдоподобия. В этих ситуациях байесовский доверительный интервал полностью …

2
Что такое автокорреляция для случайной прогулки?
Кажется, это действительно высоко, но это противоречит мне. Может кто-нибудь объяснить, пожалуйста? Я очень смущен этим вопросом и был бы признателен за подробное, проницательное объяснение. Заранее большое спасибо!

3
Является ли каждая корреляционная матрица положительно определенной?
Я говорю здесь о матрицах корреляций Пирсона. Я часто слышал, что все корреляционные матрицы должны быть положительными полуопределенными. Насколько я понимаю, положительно определенные матрицы должны иметь собственные значения , в то время как положительные полуопределенные матрицы должны иметь собственные значения . Это заставляет меня думать, что мой вопрос можно перефразировать …

2
Как фильтры и карты активации связаны в сверточных нейронных сетях?
Как карты активации на данном слое связаны с фильтрами для этого слоя? Я не спрашиваю о том, как выполнить сверточную операцию между фильтром и картой активации, я спрашиваю о типе связи, которую имеют эти два. Например, скажем, вы хотели сделать полную связь. У вас есть f количество фильтров и n …

1
Каковы плюсы и минусы применения точечной взаимной информации на матрице словосочетания перед SVD?
Один из способов создания встраивания слов заключается в следующем ( зеркало ): Получите корпус, например: «Мне нравится летать. Мне нравится НЛП. Мне нравится глубокое обучение». Создайте матрицу словосочетания из него: Выполните SVD на ИксИксX и сохраните первые ККk столбцов U. U1 : | В| ,1:kU1:|В|,1:КU_{1:|V|,1:k} Между этапами 2 и 3 …

1
Измерьте равномерность распределения по дням недели
У меня похожая проблема с вопросом, заданным здесь: Как измерить неоднородность распределения? У меня есть набор распределения вероятностей по дням недели. Я хочу измерить, насколько близко каждое распределение к (1 / 7,1 / 7, ..., 1/7). В данный момент я использую ответ на вышеуказанный вопрос; норма L2, которая имеет значение …



1
Методика начальной загрузки. Зачем пересчитывать «с заменой» вместо случайной подвыборки?
Метод начальной загрузки получил широкое распространение в последние годы, я также часто его использую, особенно потому, что обоснование довольно интуитивно понятно. Но это одна вещь, которую я не понимаю. Почему Efron решил выполнить повторную выборку с заменой, а не просто субсэмплирование путем случайного включения или исключения отдельных наблюдений? Я думаю, …

1
OLS vs. Poisson GLM с идентификационной связью
Мой вопрос показывает мое плохое понимание регрессии Пуассона и GLM в целом. Вот некоторые поддельные данные, чтобы проиллюстрировать мой вопрос: ### some fake data x=c(1:14) y=c(0, 1, 2, 3, 1, 4, 9, 18, 23, 31, 20, 25, 37, 45) Некоторые пользовательские функции для возврата psuedo-R2: ### functions of pseudo-R2 psuR2 …

2
Как симулировать цензурированные данные
Мне интересно, как я могу смоделировать выборку из n времен жизни распределения Вейбулла, которые включают наблюдения типа I с правой цензурой. Например, пусть n = 3, shape = 3, scale = 1 и уровень цензуры = .15, а время цензуры = .88. Я знаю, как сгенерировать выборку Вейбулла, но я …

1
Функция потери биномиального отклонения Scikit
Это функция биномиального отклонения Scikit GradientBoosting, def __call__(self, y, pred, sample_weight=None): """Compute the deviance (= 2 * negative log-likelihood). """ # logaddexp(0, v) == log(1.0 + exp(v)) pred = pred.ravel() if sample_weight is None: return -2.0 * np.mean((y * pred) - np.logaddexp(0.0, pred)) else: return (-2.0 / sample_weight.sum() * np.sum(sample_weight …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.