Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Почему анализ временных рядов не считается алгоритмом машинного обучения
Почему анализ временных рядов не считается алгоритмом машинного обучения (в отличие от линейной регрессии). И регрессия, и анализ временных рядов являются методами прогнозирования. Так почему один из них считается алгоритмом обучения, а не другой?

1
Точный критерий Фишера дает неоднородные p-значения
Я пытаюсь применить точный критерий Фишера в задаче с имитацией генетики, но значения p кажутся искаженными вправо. Будучи биологом, я думаю, я просто упускаю что-то очевидное для каждого статистика, поэтому я был бы очень признателен за вашу помощь. Моя установка такова: (настройка 1, маргиналы не фиксированы) Две выборки 0 и …

3
Джефрис Приор для нормального распределения с неизвестным средним и дисперсией
Я читаю о предыдущих распределениях и вычислял Джеффриса для выборки нормально распределенных случайных величин с неизвестным средним и неизвестной дисперсией. Согласно моим расчетам, для Джеффриса справедливо следующее: Здесь - информационная матрица Фишера.яp ( μ , σ2) = dэ т ( я)-----√= де т ( 1 / σ2001 / ( 2 …

1
Должен ли частичный составлять в сумме в множественной регрессии?
Ниже приводится модель, созданная из mtcarsнабора данных: > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) 0.0000 …

1
Как уменьшить количество ложных срабатываний?
Я пытаюсь решить задачу, которая называется « Обнаружение пешеходов», и я тренирую двоичный класс по двум категориям: позитивные - люди, негативные - фон. У меня есть набор данных: количество позитивов = 3752 число отрицательных = 3800 Я использую train \ test split 80 \ 20% и форму scikit-learn RandomForestClassifier с …

1
Почему бы не использовать надежную регрессию каждый раз?
Примеры этой страницы показывают, что выбросы заметно влияют на простую регрессию, и это можно преодолеть с помощью методов надежной регрессии: http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ . Я считаю, что lmrob и ltsReg - это другие надежные методы регрессии. Почему бы не делать надежную регрессию (например, rlm или rq) каждый раз, а не выполнять простую …

2
VC измерение регрессионных моделей
В серии лекций « Изучение данных» профессор упоминает, что измерение VC измеряет сложность модели по тому, на сколько точек данная модель может разбиться. Так что это прекрасно работает для моделей классификации, где мы можем сказать из N точек, если классификатор способен эффективно разбить k точек, мерой измерения VC будет K. …

2
Использование фильтров Калмана для расчета недостающих значений во временных рядах
Меня интересует, как фильтры Калмана могут использоваться для расчета отсутствующих значений в данных временных рядов. Это также применимо, если отсутствуют некоторые последовательные моменты времени? Я не могу найти много по этой теме. Любые объяснения, комментарии и ссылки приветствуются и приветствуются!

1
Какая связь между регуляризацией и методом множителей Лагранжа?
Чтобы не допустить перегрузки людей, люди добавляют термин регуляризации (пропорциональный квадрату суммы параметров модели) с параметром регуляризации к функции стоимости линейной регрессии. Является ли этот параметр таким же, как множитель Лагранжа? Так регуляризация такая же, как метод множителя Лагранжа? Или как эти методы связаны? λλλ\lambdaλλ\lambda

1
Линейное преобразование случайной величины с помощью высокой прямоугольной матрицы
Допустим, у нас есть случайный вектор , взятый из распределения с функцией плотности вероятности . Если мы линейно преобразуем его с помощью матрицы полного ранга, чтобы получить , то плотность определяется каке → Х ( → х )п×п → Y = → X → Y F → Y ( → …

2
Как создать данные о выживании игрушек (время до события) с правильной цензурой
Я хочу создать данные о выживаемости игрушек (время до события), которые подвергаются цензуре и следуют некоторому распределению с пропорциональными опасностями и постоянной базовой опасностью. Я создал данные следующим образом, но я не могу получить расчетные коэффициенты опасности, близкие к истинным значениям, после подбора модели пропорциональных рисков Кокса для смоделированных данных. …

3
Как эффективно генерировать отсортированные равномерно распределенные значения в интервале?
Допустим, я хочу создать набор случайных чисел из интервала (a, b). Сгенерированная последовательность также должна иметь свойство сортировки. Я могу придумать два способа добиться этого. Позвольте nбыть длина последовательности, которая будет сгенерирована. 1-й алгоритм: Let `offset = floor((b - a) / n)` for i = 1 up to n: generate …

2
PDF произведения двух независимых равномерных случайных величин
Пусть ~ и ~ - две независимые случайные величины с заданными распределениями. Каково распределение ?U ( 0 , 2 ) Y U ( - 10 , 10 ) V = X YXИксXU(0,2)U(0,2)U(0,2)YYYU(−10,10)U(-10,10)U(-10,10)V=XYВзнак равноИксYV=XY Я пробовал свертку, зная, что h(v)=∫y=+∞y=−∞1yfY(y)fX(vy)dyчас(v)знак равно∫Yзнак равно-∞Yзнак равно+∞1YеY(Y)еИкс(vY)dYh(v) = \int_{y=-\infty}^{y=+\infty}\frac{1}{y}f_Y(y) f_X\left (\frac{v}{y} \right ) dy Мы …


2
Можно ли строить линию регрессии для ранжированных данных (корреляция Спирмена)?
У меня есть данные, для которых я рассчитал корреляцию Спирмена и хочу визуализировать их для публикации. Зависимая переменная ранжируется, независимая переменная - нет. То, что я хочу визуализировать, является скорее общей тенденцией, чем фактическим наклоном, поэтому я оценил независимую и применил корреляцию / регрессию Спирмена. Но как только я подготовил …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.