Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Объяснение конечного поправочного коэффициента
Я понимаю, что, когда выборка из конечной совокупности и нашего размера выборки составляет более 5% совокупности, нам необходимо скорректировать среднее значение выборки и стандартную ошибку, используя эту формулу: FпС= N- нN- 1----√FPC=N−nN−1\hspace{10mm} FPC=\sqrt{\frac{N-n}{N-1}} Где - размер популяции, а - размер выборки.nNNNNnn У меня есть 3 вопроса по этой формуле: Почему …

2
Подмножество R векторов временных рядов
У меня есть временной ряд, и я хочу его поднастроить, сохранив его как временной ряд, сохранив начало, конец и частоту. Например, допустим, у меня есть временной ряд: > qs <- ts(101:110, start=c(2009, 2), frequency=4) > qs Qtr1 Qtr2 Qtr3 Qtr4 2009 101 102 103 2010 104 105 106 107 2011 …
25 r  time-series 



3
Каковы преимущества метрики Вассерштейна по сравнению с дивергенцией Кульбака-Лейблера?
В чем практическая разница между метрикой Вассерштейна и дивергенцией Кульбака-Лейблера ? Метрика Вассерштейна также называется расстоянием перемещения Земли . Из Википедии: Метрика Вассерштейна (или Вазерштейна) - это функция расстояния, определяемая между вероятностными распределениями в данном метрическом пространстве М. а также Дивергенция Кульбака – Лейблера - это мера того, как одно …

2
Как квантильная регрессия «работает»?
Я надеюсь получить интуитивное и доступное объяснение квантильной регрессии. Допустим, у меня есть простой набор данных результата и предикторов .YYYX1,X2X1,X2X_1, X_2 Если, например, я запускаю квантильную регрессию в .25, .5, .75 и получаю обратно .β0,.25,β1,.25...β2,.75β0,.25,β1,.25...β2,.75\beta_{0,.25},\beta_{1,.25}...\beta_{2,.75} Найдены ли значения простым упорядочением значений и выполнением линейной регрессии на основе примеров, которые находятся …

3
Ежедневный анализ временных рядов
Я пытаюсь провести анализ временных рядов, и я новичок в этой области. У меня есть ежедневный подсчет событий с 2006 по 2009 год, и я хочу приспособить модель временного ряда к нему. Вот прогресс, который я сделал: timeSeriesObj = ts(x,start=c(2006,1,1),frequency=365.25) plot.ts(timeSeriesObj) В результате получается сюжет: Чтобы проверить, есть ли сезонность …

1
Задание нескольких (отдельных) случайных эффектов в lme [closed]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 месяцев назад . Я работал в R-пакетах nlme и lme4 , пытаясь указать модели с несколькими случайными эффектами. Я обнаружил, что только nlme …

3
Интерпретация терминов взаимодействия в логит-регрессии с категориальными переменными
У меня есть данные из опроса, в котором респонденты были случайным образом распределены в одну из четырех групп: > summary(df$Group) Control Treatment1 Treatment2 Treatment3 59 63 62 66 В то время как три группы лечения немного различаются по применяемому стимулу, главное различие, о котором я забочусь, - это контрольная и …

5
Введение в причинный анализ
Какие хорошие книги, которые вводят причинный анализ? Я думаю о введении, которое объясняет принципы причинного анализа и показывает, как различные статистические методы могут быть использованы для применения этих принципов.

3
Какова мера точности данных с несколькими метками?
Рассмотрим сценарий, в котором вам предоставляются матрицы KnownLabel и PredictedLabel. Я хотел бы измерить качество матрицы PredictedLabel по сравнению с матрицей KnownLabel. Но проблема здесь заключается в том, что в KnownLabel Matrix есть несколько строк, только одна 1, а в других нескольких строках есть много 1 (эти экземпляры имеют несколько …

5
Процедура кластеризации, где каждый кластер имеет равное количество точек?
У меня есть несколько точек в R p , и я хочу сгруппировать точки так, чтобы:Икс= { х1, . , , , хN}Иксзнак равно{Икс1,,,,,ИксN}X=\{x_1,...,x_n\}рпрпR^p Каждый кластер содержит равное количество элементов . (Предположим, что число кластеров делит n .)ИксИксXNNn Каждый кластер в некотором смысле является «пространственно связным», как кластеры из средних.ККk …

4
Независимая переменная = Случайная переменная?
Я немного сбит с толку, если независимая переменная (также называемая предиктором или признаком) в статистической модели, например в линейной регрессии , является случайной величиной?Y = β 0 + β 1 XXXXY=β0+β1XY=β0+β1XY=\beta_0+\beta_1 X

2
Почему меняется дисперсия выборки, если наблюдения дублируются?
Считается, что дисперсия является мерой распространения. Итак, я думал, что дисперсия 3,5равна дисперсии, 3,3,5,5так как числа распределены одинаково. Но это не так, дисперсия 3,5есть, 2а дисперсия 3,3,5,5есть 1 1/3. Это озадачивает меня, учитывая объяснение, что дисперсия должна быть мерой распространения. Итак, что в этом контексте означает мера распространения ?
25 variance 

2
Как поддержка векторной регрессии работает интуитивно?
Все примеры SVM связаны с классификацией. Я не понимаю, как SVM для регрессии (опорный вектор-регрессор) можно использовать в регрессии. Насколько я понимаю, SVM максимизирует разницу между двумя классами, чтобы найти оптимальную гиперплоскость. Как это могло бы работать в проблеме регрессии?
25 regression  svm 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.