Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Понимание того, какие особенности были наиболее важны для логистической регрессии
Я построил классификатор логистической регрессии, который очень точен в моих данных. Теперь я хочу лучше понять, почему это так хорошо работает. В частности, я хотел бы оценить, какие функции вносят наибольший вклад (какие функции являются наиболее важными) и, в идеале, количественно оценить, насколько каждая функция вносит вклад в точность общей …

3
Какой алгоритм оптимизации используется в функции glm в R?
Можно выполнить логит-регрессию в R, используя такой код: > library(MASS) > data(menarche) > glm.out = glm(cbind(Menarche, Total-Menarche) ~ Age, + family=binomial(logit), data=menarche) > coefficients(glm.out) (Intercept) Age -21.226395 1.631968 Похоже, что алгоритм оптимизации сходится - есть информация о количестве шагов алгоритма Фишера: Call: glm(formula = cbind(Menarche, Total - Menarche) ~ Age, …

1
Обновление декомпозиции SVD после добавления одной новой строки в матрицу
Предположим , что у меня плотную матрицу AA \textbf{A} из m×nm×nm \times n размера, с SVD разложения A=USV⊤.A=USV⊤.\mathbf{A}=\mathbf{USV}^\top.В Rможно вычислить СВД следующим образом : svd(A). Если в добавлена новая -я строка , можно ли вычислить новую декомпозицию SVD на основе старой (т. Е. Используя , и ), без пересчета СВД …

2
Невозможная проблема оценки?
Вопрос Дисперсия отрицательного биномиального (NB) распределения всегда больше его среднего значения. Когда среднее значение выборки превышает ее дисперсию, попытка подобрать параметры NB с максимальной вероятностью или с оценкой момента не удастся (решения с конечными параметрами не существует). Однако возможно, что выборка, взятая из распределения NB, имеет среднее значение, превышающее дисперсию. …

2
Кластеризация - Интуиция за теоремой Клейнберга о невозможности
Я думал о том, чтобы написать сообщение в блоге об этом интересном анализе Кляйнберга (2002), в котором исследуется сложность кластеризации. Клейнберг обрисовывает в общих чертах три, казалось бы, интуитивных требования к функции кластеризации, а затем доказывает, что такой функции не существует. Существует много алгоритмов кластеризации, которые удовлетворяют двум из трех …


2
Почему CDF образца равномерно распределен
Я читал здесь , что данный образец X1,X2,...,XnX1,X2,...,Xn X_1,X_2,...,X_n из непрерывного распределения с cdf FXFX F_X , выборка, соответствующая Ui=FX(Xi)Ui=FX(Xi) U_i = F_X(X_i) следует стандартному равномерному распределению. Я проверил это, используя качественное моделирование в Python, и мне было легко проверить связь. import matplotlib.pyplot as plt import scipy.stats xs = scipy.stats.norm.rvs(5, …
17 pdf  uniform  cdf  intuition 

5
Должны ли мы учить куртозу в курсе прикладной статистики? Если да, то как?
Центральная тенденция, распространение и асимметрия могут быть определены относительно хорошо, по крайней мере, на интуитивной основе; стандартные математические меры этих вещей также относительно хорошо соответствуют нашим интуитивным представлениям. Но куртоз кажется другим. Это очень сбивает с толку и не очень хорошо вписывается в интуицию о форме распределения. Типичным объяснением эксцесса …

3
Когда я не должен использовать ансамблевой классификатор?
В общем, в проблеме классификации, где цель состоит в том, чтобы точно предсказать членство в классах вне выборки, когда я не должен использовать ансамблевый классификатор? Этот вопрос тесно связан с тем, почему не всегда использовать ансамблевое обучение? , Этот вопрос спрашивает, почему мы не используем ансамбли все время. Я хочу …

3
Есть ли в описательной статистике p-значения?
Меня просят найти p-значения для описательной статистики. Тем не менее, я понимаю, что р-значения для статистики теста. Если я не ошибаюсь, p-значение - это вероятность наблюдения значения, столь же экстремального, как и тестовая статистика, если нулевая гипотеза была верной.

2
Разница между регрессионным анализом и подгонкой кривой
Кто-нибудь может объяснить мне реальные различия между регрессионным анализом и подгонкой кривой (линейной и нелинейной), с примером, если это возможно? Кажется, что оба пытаются найти связь между двумя переменными (зависимыми и независимыми), а затем определяют параметр (или коэффициент), связанный с предлагаемыми моделями. Например, если у меня есть набор данных, таких …

1
Рисование n интервалов равномерно случайным образом, вероятность того, что хотя бы один интервал перекрывается со всеми остальными
Случайным образом нарисуйте nnn интервалов из [0,1][0,1][0,1] , где каждая конечная точка A, B выбрана из равномерного распределения между .[0,1][0,1][0,1] Какова вероятность того, что хотя бы один интервал перекрывается со всеми остальными?

1
Как рассчитать интервалы прогнозирования для LOESS?
У меня есть некоторые данные, которые я использовал, используя модель LOESS в R, давая мне это: Данные имеют один предиктор и один ответ, и они гетероскедастичны. Я также добавил доверительные интервалы. Проблема в том, что интервалы являются доверительными интервалами для линии, тогда как меня интересуют интервалы прогнозирования. Например, нижняя панель …

1
Каковы теоретические гарантии упаковки
Я (примерно) слышал, что: пакетирование - это метод, позволяющий уменьшить дисперсию алгоритма предиктор / оценщик / обучение. Однако я никогда не видел формального математического доказательства этого утверждения. Кто-нибудь знает, почему это математически верно? Это просто кажется настолько широко признанным / известным фактом, что я ожидал бы прямой ссылки на это. …

2
Пример для априора, который в отличие от Джеффриса приводит к апостериорному, который не является инвариантным
Я публикую «ответ» на вопрос, который я задал здесь две недели назад: почему полезен Джефрис? Это действительно был вопрос (и я тоже не имел права публиковать комментарии в то время), поэтому я надеюсь, что это нормально: В приведенной выше ссылке обсуждается, что интересная особенность априорной теории Джеффриса состоит в том, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.