Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Центральная предельная теорема для квадратных корней сумм iid случайных величин
Заинтригованный вопросом на math.stackexchange и исследующий его эмпирически, я задаюсь вопросом о следующем утверждении о квадратном корне из сумм iid случайных величин. Предположим, что - это случайные величины с конечным ненулевым средним и дисперсией и . Центральная предельная теорема гласит: при увеличении . μ σ 2 Y = n ∑ …

1
R / mgcv: Почему тензорные продукты te () и ti () производят разные поверхности?
mgcvПакет Rимеет две функции для установки взаимодействия Тензор продукта: te()и ti(). Я понимаю основное разделение труда между ними (подгонка нелинейного взаимодействия против разложения этого взаимодействия на основные эффекты и взаимодействие). Чего я не понимаю, так это почему te(x1, x2)и ti(x1) + ti(x2) + ti(x1, x2)может дать (немного) разные результаты. MWE …
11 r  gam  mgcv  conditional-probability  mixed-model  references  bayesian  estimation  conditional-probability  machine-learning  optimization  gradient-descent  r  hypothesis-testing  wilcoxon-mann-whitney  time-series  bayesian  inference  change-point  time-series  anova  repeated-measures  statistical-significance  bayesian  contingency-tables  regression  prediction  quantiles  classification  auc  k-means  scikit-learn  regression  spatial  circular-statistics  t-test  effect-size  cohens-d  r  cross-validation  feature-selection  caret  machine-learning  modeling  python  optimization  frequentist  correlation  sample-size  normalization  group-differences  heteroscedasticity  independence  generalized-least-squares  lme4-nlme  references  mcmc  metropolis-hastings  optimization  r  logistic  feature-selection  separation  clustering  k-means  normal-distribution  gaussian-mixture  kullback-leibler  java  spark-mllib  data-visualization  categorical-data  barplot  hypothesis-testing  statistical-significance  chi-squared  type-i-and-ii-errors  pca  scikit-learn  conditional-expectation  statistical-significance  meta-analysis  intuition  r  time-series  multivariate-analysis  garch  machine-learning  classification  data-mining  missing-data  cart  regression  cross-validation  matrix-decomposition  categorical-data  repeated-measures  chi-squared  assumptions  contingency-tables  prediction  binary-data  trend  test-for-trend  matrix-inverse  anova  categorical-data  regression-coefficients  standard-error  r  distributions  exponential  interarrival-time  copula  log-likelihood  time-series  forecasting  prediction-interval  mean  standard-error  meta-analysis  meta-regression  network-meta-analysis  systematic-review  normal-distribution  multiple-regression  generalized-linear-model  poisson-distribution  poisson-regression  r  sas  cohens-kappa 

1
Почему неотрицательность важна для систем совместной фильтрации / рекомендации?
Во всех современных рекомендательных системах, которые я видел, которые основаны на факторизации матрицы, неотрицательная матричная факторизация выполняется для матрицы фильма пользователя. Я могу понять, почему неотрицательность важна для интерпретируемости и / или если вам нужны редкие факторы. Но если вас интересует только прогнозирование, как, например, в конкурсе на призы netflix, …

2
Техника машинного обучения для изучения струнных моделей
У меня есть список слов, принадлежащих к разным категориям. Каждая категория имеет свой собственный шаблон (например, одна имеет фиксированную длину со специальными символами, другая существует из символов, которые встречаются только в этой категории «слова», ...). Например: "ABC" -> type1 "ACC" -> type1 "a8 219" -> type2 "c 827" -> type2 …

3
Среднее обратного экспоненциального распределения
Учитывая случайную величину , что означает среднее значение и дисперсию G = 1Y= Eх р ( λ )Y=Exp(λ)Y = Exp(\lambda) ?G = 1YG=1YG=\dfrac{1}{Y} Я смотрю на обратное гамма-распределение, но среднее значение и дисперсия определены только для и α > 2 соответственно ...α > 1α>1\alpha>1α > 2α>2\alpha>2

2
Соотношение между синусом и косинусом
Предположим, что равномерно распределен на . Пусть и . Покажите, что корреляция между и равна нулю.[ 0 , 2 π ] Y = sin X Z = cos X Y ZXXX[0,2π][0,2π][0, 2\pi]Y=sinXY=sin⁡XY = \sin XZ=cosXZ=cos⁡XZ = \cos XYYYZZZ Кажется, мне нужно знать стандартное отклонение синуса и косинуса и их ковариацию. …

2
Как определить параметры для t-SNE для уменьшения размеров?
Я очень плохо знаком с встраиванием слов. Я хочу визуализировать, как документы выглядят после обучения. Я читал, что t-SNE - это подход к этому. У меня есть 100K документов с 250 размерами в качестве размера вложения. Также доступно несколько пакетов. Однако, для t-SNE, я не знаю, сколько итераций, или значения …

2
Линейная регрессия, условные ожидания и ожидаемые значения
Хорошо, так что немного помутнение некоторых вещей, любая помощь будет высоко ценится. Насколько я понимаю, модель линейной регрессии прогнозируется через условное ожидание E(Y|X)=b+Xb+eЕ(Y|Икс)знак равноб+Иксб+еE(Y|X)=b+Xb+e Предполагаем ли мы, что и являются случайными переменными с некоторым неизвестным распределением вероятности? Насколько я понимаю, только остатки и предполагаемые бета-коэффициенты были случайными величинами. если это …
11 regression 

1
Интуитивно понятно, почему кросс-энтропия является мерой расстояния двух распределений вероятности?
Для двух дискретных распределений и перекрестная энтропия определяется какpppqqq H(p,q)=−∑xp(x)logq(x).H(p,q)=−∑xp(x)log⁡q(x),H(p,q)=-\sum_x p(x)\log q(x). Интересно, почему это будет интуитивно понятная мера расстояния между двумя распределениями вероятностей? Я вижу, что - энтропия , которая измеряет «удивление» . - это мера, которая частично заменяет на . Я до сих пор не понимаю интуитивное значение …

2
Что подразумевается под дисперсией * функций * в * Введение в статистическое обучение *?
На стр. 34 введения в статистическое обучение : \newcommand{\Var}{{\rm Var}} Хотя математическое доказательство выходит за рамки данной книги, можно показать , что ожидаемый тест MSE для заданного значения x0x0x_0 , всегда можно разложить на сумму три основных величин: дисперсия в f^(x0)f^(x0)\hat{f}(x_0) , квадрат смещения из f^(x0)f^(x0)\hat{f}(x_0) и дисперсия членов ошибки …


2
Онлайн ссылки, дающие введение в OLS
Я начал изучать оценки наименьших квадратов (OLS) и все еще в самом начале. Я уже купил несколько книг по эконометрике, но я ничего не нашел в Интернете. Так что мне было интересно, существует ли веб-сайт, домашняя страница или другие онлайн-ресурсы, которые утомительно объясняют оценки наименьших квадратов. Я ищу материал, который …

2
Какова интуиция, лежащая в основе рекуррентной нейронной сети с долговременной памятью (LSTM)?
Идея, лежащая в основе Recurrent Neural Network (RNN), мне ясна. Я понимаю это следующим образом: у нас есть последовательность наблюдений ( ) (или, другими словами, многомерный временной ряд). Каждое отдельное наблюдение является числовым вектором. В рамках RNN-модели мы предполагаем, что следующее наблюдение является функцией предыдущего наблюдения а также предыдущего "скрытого …

1
Корректировки прогноза (линейная регрессия)
Полное раскрытие: я не статистик и не претендую на это. Я скромный ИТ-администратор. Пожалуйста, играйте осторожно со мной. :) Я отвечаю за сбор и прогнозирование использования дискового пространства для нашего предприятия. Мы собираем данные об использовании хранилища ежемесячно и используем простую скользящую двенадцатимесячную линейную регрессию для прогнозов (другими словами, при …

1
Обучение ансамблю: почему эффективна укладка моделей?
Недавно я заинтересовался укладкой моделей как формой обучения ансамблям. В частности, я немного поэкспериментировал с некоторыми игрушечными наборами данных для проблем регрессии. Я в основном реализовал отдельные регрессоры «уровня 0», сохранил выходные прогнозы каждого регрессора в качестве новой функции для «мета-регрессора», чтобы принять в качестве входных данных, и приспособил этот …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.