Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Преобразование крайне искаженных распределений
Предположим, что у меня есть переменная, распределение которой искажено положительно в очень высокой степени, так что взятия бревна будет недостаточно, чтобы привести его в диапазон асимметрии для нормального распределения. Какие у меня варианты на данный момент? Что я могу сделать, чтобы преобразовать переменную в нормальное распределение?

3
Как проверить, отличаются ли два (ненормальных) распределения?
Я читал о t-тесте Стьюдента, но он работает, когда мы можем предположить, что исходные дистрибутивы обычно распространяются. В моем случае их точно нет. Кроме того, если у меня есть 13 дистрибутивов, нужно ли мне делать 13^2тесты?

3
Пошаговое внедрение PCA в R с использованием учебника Линдси Смит
Я работаю в R с помощью превосходного учебника по PCA Линдси и Смита, и застреваю на последнем этапе. Сценарий R, приведенный ниже, выводит нас на этап (на стр.19), на котором исходные данные восстанавливаются из (в данном случае, единственного) основного компонента, который должен давать прямую линию вдоль оси PCA1 (учитывая, что …
13 r  pca 

1
Геометрическая интерпретация обобщенной линейной модели
Для линейной модели y=xβ+ey=xβ+еy=x\beta+e , мы можем иметь хорошую геометрическую интерпретацию расчетной модели с помощью y^знак равноxβ^+e^y^=xβ^+е^\hat{y}=x\hat{\beta}+\hat{e} . У является проекцией у на пространство , натянутое на х и остаточной е перпендикулярна это пространство , натянутое на х.Y^Y^\hat{y}е^е^\hat{e} Теперь мой вопрос: существует ли какая-либо геометрическая интерпретация обобщенной линейной модели (логистическая …

1
Использование MLE против OLS
Когда предпочтительнее использовать оценку максимального правдоподобия вместо обычных наименьших квадратов? Каковы сильные и слабые стороны каждого? Я пытаюсь собрать практические знания о том, где использовать каждый в общих ситуациях.

4
Есть ли вероятностное расстояние, которое сохраняет все свойства метрики?
Изучая расстояние Кульбака – Лейблера, мы очень быстро узнаем две вещи: оно не учитывает ни неравенство треугольника, ни симметрию, требуемые свойства метрики. Мой вопрос заключается в том, есть ли метрика функций плотности вероятности, которые удовлетворяют всем ограничениям метрики .

3
Должен ли я использовать трюк с ядром, когда это возможно, для нелинейных данных?
Недавно я узнал об использовании трюка Ядра, который отображает данные в пространства более высоких измерений в попытке линеаризовать данные в этих измерениях. Есть ли случаи, когда я должен избегать использования этой техники? Это просто вопрос поиска правильной функции ядра? Для линейных данных это, конечно, не полезно, но для нелинейных данных …

1
Оценка параметров LogLikelihood для линейного фильтра Калмана Гаусса
Я написал некоторый код, который может выполнять фильтрацию Калмана (используя несколько различных фильтров типа Калмана [Information Filter et al.]) Для линейного анализа пространства состояний Гаусса для n-мерного вектора состояния. Фильтры работают отлично, и я получаю хороший вывод. Тем не менее, оценка параметров с помощью логарифмической вероятности сбивает меня с толку. …

1
Существует ли сопряженный априор для распределения Лапласа?
Существует ли сопряженный априор для распределения Лапласа ? Если нет, то есть ли известное выражение в замкнутой форме, аппроксимирующее апостериорный для параметров распределения Лапласа? Я довольно много гуглил, но безуспешно, поэтому мое текущее предположение - «нет» в ответах на вопросы выше ...

2
Форма доверительных интервалов и интервалов прогнозирования для нелинейной регрессии
Предполагается, что полосы достоверности и прогнозирования вокруг нелинейной регрессии симметричны относительно линии регрессии? Это означает, что они не принимают форму песочных часов, как в случае полос для линейной регрессии. Это почему? Вот эта модель: Вот рисунок: F( х ) = ⎛⎝⎜⎜A - D1 + ( хС)В⎞⎠⎟⎟+ DF(Икс)знак равно(A-D1+(ИксС)В)+D F(x) = …

1
Насколько меньшими могут быть значения
Вступление: отметив внимание, которое получил сегодня этот вопрос: « Может ли ANOVA быть значимым, если ни один из парных t-тестов не является? », Я подумал, что смогу перефразировать его интересным способом, который заслуживает своего собственного набора ответов. , Различные несоответствующие результаты (по номинальной стоимости) могут иметь место, когда статистическая значимость …

2
Какова максимальная функция плотности вероятности энтропии для положительной непрерывной переменной заданного среднего значения и стандартного отклонения?
Каково максимальное распределение энтропии для положительной непрерывной переменной с учетом ее первого и второго моментов? Например, гауссово распределение является максимальным распределением энтропии для неограниченной переменной, учитывая ее среднее значение и стандартное отклонение, а гамма-распределение является максимальным распределением энтропии для положительной переменной, учитывая ее среднее значение и среднее значение ее логарифма.

2
Тест Даннетта в R, возвращающий разные значения каждый раз
Я использую библиотеку R 'multcomp' ( http://cran.r-project.org/web/packages/multcomp/ ) для вычисления теста Даннетта . Я использую скрипт ниже: Group <- factor(c("A","A","B","B","B","C","C","C","D","D","D","E","E","F","F","F")) Value <- c(5,5.09901951359278,4.69041575982343,4.58257569495584,4.79583152331272,5,5.09901951359278,4.24264068711928,5.09901951359278,5.19615242270663,4.58257569495584,6.16441400296898,6.85565460040104,7.68114574786861,7.07106781186548,6.48074069840786) data <- data.frame(Group, Value) aov <- aov(Value ~ Group, data) summary(glht(aov, linfct=mcp(Group="Dunnett"))) Теперь, если я запускаю этот сценарий через консоль R несколько раз, я получаю очень немного …

1
Как можно показать, что не существует несмещенной оценки
Предположим, что X0,X1,…,XnX0,X1,…,Xn X_{0},X_{1},\ldots,X_{n} являются случайными переменными, которые следуют за распределением Пуассона со средним λλ \lambda . Как я могу доказать, что нет объективной оценки количества 1λ1λ \dfrac{1}{\lambda} ?

2
ARIMA против ARMA на дифференцированной серии
В R (2.15.2) я однажды установил ARIMA (3,1,3) для временного ряда и один раз ARMA (3,3) для разностных временных рядов. Установленные параметры отличаются, что я приписал методу подбора в ARIMA. Кроме того, подгонка ARIMA (3,0,3) к тем же данным, что и ARMA (3,3), не приведет к идентичным параметрам, независимо от …
13 r  time-series  arima  fitting  arma 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.