Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как выполнить t-тест Стьюдента, имеющий только размер выборки, среднее значение выборки и среднее значение по популяции?
тест студента требует стандартного отклонения образца . Однако как вычислить если известны только размер выборки и среднее значение выборки?TTtssssss Например, если размер выборки равен а среднее значение выборки равно , я попытаюсь создать список из идентичных выборок со значениями по каждая. Ожидается, что стандартное отклонение выборки равно . Это создаст …

2
Стандартизация до Лассо действительно необходима?
Я прочитал три основные причины стандартизации переменных, прежде чем что-то вроде Lassoрегрессии: 1) Интерпретируемость коэффициентов. 2) Возможность ранжировать важность коэффициента по относительной величине оценок коэффициента после усадки. 3) Нет необходимости перехватывать. Но меня интересует самый важный момент. Есть ли у нас основания полагать, что стандартизация улучшит обобщение модели вне выборки? …

5
Переоснащение модели логистической регрессии
Можно ли переоснастить модель логистической регрессии? Я видел видео, в котором говорилось, что если моя площадь под кривой ROC превышает 95%, то, скорее всего, она будет переопределена, но возможно ли переопределить модель логистической регрессии?

1
Дебора Майо опровергла доказательство Бирнбаумом принципа правдоподобия?
Это в некоторой степени связано с моим предыдущим вопросом: пример, где принцип правдоподобия * действительно * имеет значение? По-видимому, Дебора Майо опубликовала в « Статистической науке» статью, опровергающую доказательство Бирнбаумом принципа правдоподобия. Кто-нибудь может объяснить основной аргумент Бирнбаума и контраргумент Мейо? Она права (логически)?

1
Могут ли степени свободы быть нецелым числом?
Когда я использую GAM, он дает мне остаточный DF, (последняя строка в коде). Что это значит? Выходя за рамки примера GAM, в общем, может ли число степеней свободы быть нецелым числом?26,626.626.6 > library(gam) > summary(gam(mpg~lo(wt),data=mtcars)) Call: gam(formula = mpg ~ lo(wt), data = mtcars) Deviance Residuals: Min 1Q Median 3Q …
27 r  degrees-of-freedom  gam  machine-learning  pca  lasso  probability  self-study  bootstrap  expected-value  regression  machine-learning  linear-model  probability  simulation  random-generation  machine-learning  distributions  svm  libsvm  classification  pca  multivariate-analysis  feature-selection  archaeology  r  regression  dataset  simulation  r  regression  time-series  forecasting  predictive-models  r  mean  sem  lavaan  machine-learning  regularization  regression  conv-neural-network  convolution  classification  deep-learning  conv-neural-network  regression  categorical-data  econometrics  r  confirmatory-factor  scale-invariance  self-study  unbiased-estimator  mse  regression  residuals  sampling  random-variable  sample  probability  random-variable  convergence  r  survival  weibull  references  autocorrelation  hypothesis-testing  distributions  correlation  regression  statistical-significance  regression-coefficients  univariate  categorical-data  chi-squared  regression  machine-learning  multiple-regression  categorical-data  linear-model  pca  factor-analysis  factor-rotation  classification  scikit-learn  logistic  p-value  regression  panel-data  multilevel-analysis  variance  bootstrap  bias  probability  r  distributions  interquartile  time-series  hypothesis-testing  normal-distribution  normality-assumption  kurtosis  arima  panel-data  stata  clustered-standard-errors  machine-learning  optimization  lasso  multivariate-analysis  ancova  machine-learning  cross-validation 

1
Почему glmnet использует «наивную» эластичную сетку из оригинальной бумаги Zou & Hastie?
L=1n∥∥y−Xβ∥∥2+λ1∥β∥1+λ2∥β∥22,L=1n‖y−Xβ‖2+λ1‖β‖1+λ2‖β‖22,\mathcal L = \frac{1}{n}\big\lVert y - X\beta\big\rVert^2 + \lambda_1\lVert \beta\rVert_1 + \lambda_2 \lVert \beta\rVert^2_2,β^∗=(1+λ2)β^.β^∗=(1+λ2)β^.\hat\beta^* = (1+\lambda_2)\hat\beta. Однако в следующей glmnetстатье Friedman, Hastie & Tibshirani (2010) пути регуляризации для обобщенных линейных моделей с помощью координатного спуска не использовали этот масштаб и использовали только краткую сноску Zou и Hastie (2005) назвали это …

2
Сколько рака легких действительно вызвано курением? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто в прошлом году . На табачных изделиях часто можно увидеть статистику того, что девять из десяти случаев рака легких вызваны курением, но является ли …

3
Происхождение термина «регуляризация»
Когда я знакомлю студентов с концепциями, мне часто бывает весело рассказывать им о происхождении терминологии (например, «регрессия» - это термин с интересным происхождением). Я не смог открыть историю / историю термина «регуляризация» в статистическом / машинном обучении. Итак, каково происхождение термина регуляризация ?

3
Разве нельзя сказать, что модели глубокого обучения можно интерпретировать? Особенности узлов?
Для статистических моделей и моделей машинного обучения существует несколько уровней интерпретируемости: 1) алгоритм в целом, 2) части алгоритма в целом, 3) части алгоритма на конкретных входных данных, и эти три уровня разбиты на две части каждая, один для обучения и один для функции eval. Последние две части гораздо ближе, чем …

3
Каково влияние выбора различных функций потерь в классификации для приблизительной оценки 0-1?
Мы знаем, что некоторые объективные функции легче оптимизировать, а некоторые - сложные. И есть много функций потерь, которые мы хотим использовать, но трудно использовать, например, потеря 0-1. Таким образом, мы находим некоторые функции потери прокси для выполнения этой работы. Например, мы используем потерю петли или логистическую потерю, чтобы «приблизить» потерю …

3
Как определить разницу между линейной и нелинейной регрессионными моделями?
Я читал следующую ссылку на нелинейную регрессию SAS Non Linear . Из первого раздела «Нелинейная регрессия и линейная регрессия» я понял, что приведенное ниже уравнение на самом деле является линейной регрессией, верно? Если так, то почему? Y= б1Икс3+ б2Икс2+ б3х + сy=b1x3+b2x2+b3x+cy = b_1x^3 + b_2x^2 + b_3x + c …

9
Когда корреляция может быть полезной без причинно-следственной связи?
Любимая поговорка многих статистиков гласит: «Корреляция не подразумевает причинно-следственную связь». Это, конечно, правда, но одна вещь, которая, похоже, здесь подразумевается, это то, что корреляция имеет мало или вообще не имеет значения. Это правда? Разве бесполезно знать, что две переменные коррелируют? Я не могу себе представить, что это так. Я не …

2
Является ли сходство косинусов идентичным l2-нормированному евклидову расстоянию?
Идентичный смысл, что он будет производить идентичные результаты для ранжирования сходства между вектором ¯u и набором векторами V . У меня есть модель векторного пространства, в которой в качестве параметров используется мера расстояния (евклидово расстояние, косинусное сходство) и метод нормализации (нет, l1, l2). Насколько я понимаю, результаты настроек [косинус, нет] …

4
Что не так с t-SNE против PCA для уменьшения размеров с использованием R?
У меня есть матрица из 336x256 чисел с плавающей запятой (336 бактериальных геномов (столбцы) x 256 нормализованных частот тетрануклеотидов (ряды), например, каждый столбец добавляет до 1). Я получаю хорошие результаты, когда выполняю анализ с использованием принципного анализа компонентов. Сначала я вычисляю кластеры kmeans на данных, затем запускаю PCA и раскрашиваю …
27 r  pca  tsne 


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.