Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как разложить временной ряд с несколькими сезонными компонентами?
У меня есть временной ряд, который содержит двойные сезонные компоненты, и я хотел бы разбить ряд на следующие компоненты временного ряда (тренд, сезонный компонент 1, сезонный компонент 2 и нерегулярный компонент). Насколько я знаю, процедура STL для разложения ряда в R допускает только один сезонный компонент, поэтому я попытался разложить …

2
Как следует сравнивать и / или проверять модели смешанных эффектов?
Как (линейные) модели смешанных эффектов обычно сравниваются друг с другом? Я знаю, что могут использоваться тесты отношения правдоподобия, но это не работает, если одна модель не является «подмножеством» другой, верно? Всегда ли оценка моделей df проста? Количество фиксированных эффектов + количество оцененных компонентов дисперсии? Мы игнорируем оценки случайных эффектов? Как …

4
Интерпретация разницы между логнормальным и степенным распределением (распределение по степени сети)
Во-первых, я не статистика. Тем не менее, я делаю статистический анализ сети для моей докторской степени. В рамках сетевого анализа я построил дополнительную интегральную функцию распределения (CCDF) сетевых степеней. Я обнаружил, что, в отличие от обычных сетевых дистрибутивов (например, WWW), дистрибутив лучше всего соответствует логнормальному распределению. Я попытался приспособить его …

4
Почему линейная регрессия и ANOVA дают различное
Я пытался подогнать данные одного временного ряда (без повторов), используя регрессионную модель. Данные выглядят следующим образом: > xx.2 value time treat 1 8.788269 1 0 2 7.964719 6 0 3 8.204051 12 0 4 9.041368 24 0 5 8.181555 48 0 6 8.041419 96 0 7 7.992336 144 0 8 …

2
О «силе» слабых учеников
У меня есть несколько тесно связанных вопросов относительно слабых учеников в обучении ансамблю (например, повышение). Это может показаться глупым, но каковы преимущества использования слабых по сравнению с сильными учениками? (например, почему бы не повысить с "сильными" методами обучения?) Есть ли какая-то «оптимальная» сила для слабых учеников (например, при сохранении всех …

1
Расчет статистической мощности
Насколько я понимаю, мне нужно знать по крайней мере три аспекта (из четырех) моего предлагаемого исследования, чтобы провести анализ мощности, а именно: тип теста - я собираюсь использовать r Пирсона и ANCOVA / Регрессия - GLM уровень значимости (альфа) - я намерен использовать 0,05 ожидаемый размер эффекта - я намерен …

2
Хороший онлайн-ресурс с советами по графическому сопоставлению двух числовых переменных при различных условиях
Контекст: За это время я приобрел набор эвристик о том, как эффективно построить связь между двумя числовыми переменными. Я полагаю, что большинство людей, которые работают с данными, будут иметь подобный набор правил. Примеры таких правил могут быть: Если одна из переменных имеет положительный перекос, рассмотрите возможность построения этой оси в …

2
Каково распределение отношения двух пуассоновских случайных величин?
У меня есть вопрос относительно случайных величин. Предположим , что у нас есть две случайные величины и . Скажем, - это распределение Пуассона с параметром , а - это распределение Пуассона с параметром .Y X λ 1 Y λ 2ИксИксXYYYИксXXλ1λ1\lambda_1YYYλ2λ2\lambda_2 Когда вы строите трещину из и называете ее случайной переменной …

1
Что может вызвать большие различия в коэффициенте корреляции между корреляцией Пирсона и Спирмена для данного набора данных?
Коэффициент Пирсона между двумя переменными довольно высок (г = 0,65). Но когда я ранжирую значения переменных и запускаю корреляцию Спирмена, значение коэффициента намного ниже (r = .30). Какова интерпретация этого?

1
Различия между тяжелым и толстым хвостом
Я думал, что тяжелый хвост = толстый хвост, но некоторые статьи, которые я прочитал, дали мне ощущение, что это не так. Один из них говорит: тяжелый хвост означает, что распределение имеет бесконечный j-й момент для некоторого целого числа j. Кроме того, все dfs в пот-домене притяжения Парето df с тяжелыми …

3
Регрессия опорных векторов для многомерного прогнозирования временных рядов
Кто-нибудь пытался прогнозировать временные ряды, используя регрессию опорных векторов? Я понимаю машины опорных векторов и частично понимаю регрессию опорных векторов, но не понимаю, как их можно использовать для моделирования временных рядов, особенно многомерных временных рядов. Я пытался прочитать несколько статей, но они слишком высокого уровня. Может ли кто-нибудь объяснить в …

2
Лучший подход для выбора модели байесовской или перекрестной проверки?
При попытке выбора между различными моделями или количеством функций, например, для прогнозирования, я могу придумать два подхода. Разделите данные на обучающие и тестовые наборы. Еще лучше использовать начальную загрузку или перекрестную проверку в k-кратном порядке. Каждый раз тренируйтесь на тренировочном наборе и рассчитывайте погрешность на тестовом наборе. Ошибка проверки графика …

4
Как обеспечить свойства ковариационной матрицы при подборе многомерной нормальной модели с использованием максимального правдоподобия?
Предположим, у меня есть следующая модель Yя= ф( хя, θ ) + εяYязнак равное(Икся,θ)+εяy_i=f(x_i,\theta)+\varepsilon_i где , - вектор объясняющих переменных, - параметры нелинейной функции и , где естественно, матрица.Yя∈ RКYя∈рКy_i\in \mathbb{R}^KИксяИксяx_iθθ\thetaееfεя∼ N( 0 , Σ )εя~N(0,Σ)\varepsilon_i\sim N(0,\Sigma)ΣΣ\SigmaК× КК×КK\times K Целью является обычная оценка и . Очевидный выбор - метод максимального …

2
Предложения по улучшению вероятности и статистики шпаргалки
Контекст: Стремясь структурировать центральные элементы, с которыми я столкнулся в теории вероятностей и статике, я создал справочный документ, посвященный основам математики (доступен здесь ). Разделяя этот документ, я надеюсь дать студентам-статистикам исчерпывающее резюме основного материала, преподаваемого в аспирантуре по этим темам. Несмотря на то, что в основном он предназначен в …
22 teaching 

2
Почему нулевая гипотеза всегда является точечной величиной, а не диапазоном при проверке гипотез?
Это связано с другим вопросом, который я задал. Вопрос, который у меня возникает, заключается в том, что при проверке гипотезы, когда альтернативная гипотеза является диапазоном, нулевая гипотеза все еще является точечной величиной. Например, при проверке, является ли коэффициент корреляции больше 0,5, нулевая гипотеза является «корреляция = 0,5» вместо «корреляция <= …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.