Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Определение параметров (p, d, q) для моделирования ARIMA
Я довольно новичок в статистике и R. Я хотел бы знать процесс определения параметров ARIMA для моего набора данных. Можете ли вы помочь мне понять то же самое, используя R и теоретически (если это возможно)? Данные варьируются с 12 января по 14 марта и отображают ежемесячные продажи. Вот набор данных: …
10 r  arima  box-jenkins 

1
Функции генерирования момента и преобразования Фурье?
Является ли функция, генерирующая моменты, преобразованием Фурье функции плотности вероятности? Другими словами, является ли функция, генерирующая момент, всего лишь спектральным разрешением распределения плотности вероятности случайной величины, то есть эквивалентным способом характеризации функции по ее амплитуде, фазе и частоте, а не по параметру? Если да, можем ли мы дать физическую интерпретацию …
10 moments  mgf  cumulants 

2
Замкнутая форма выражения для распределения выборочного эксцесса гауссовского распределения
Существует ли выражение в замкнутой форме для распределения выборочного куртоза данных, взятых из распределения Гаусса? т.е. КP(K^&lt;a)P(K^&lt;a)P(\hat{K}<a) где - примерный эксцесс.K^K^\hat{K}

1
Интерпретация площади под кривой PR
В настоящее время я сравниваю три метода, и в качестве метрик я использую точность, auROC и auPR. И у меня есть следующие результаты: Метод А - согласно: 0,75, auROC: 0,75, AuPR: 0,45 Метод B - согласно: 0,65, auROC: 0,55, AuPR: 0,40 Метод C - согласно: 0,55, auROC: 0,70, AuPR: 0,65 …

2
Каковы хорошие показатели для оценки качества соответствия PCA, чтобы выбрать количество компонентов?
Что является хорошим показателем для оценки качества анализа главных компонентов (PCA)? Я выполнил этот алгоритм на наборе данных. Моей целью было уменьшить количество функций (информация была очень избыточной). Я знаю, что процент сохраняемой дисперсии является хорошим показателем того, сколько информации мы храним, есть ли другие информационные метрики, которые я могу …

2
Расчет согласованности стрельбы NBA
Каков будет правильный способ оценить / определить последовательность стрельбы игрока NBA в 3 очка? Например, у меня есть игрок, который стреляет 37% с 3-х точек и делает 200 попыток в течение всего года. Я подумывал о том, чтобы взять скользящее среднее значение 3% от произвольного количества снимков (скажем, 20). Затем, …

2
Эквивалентность выборочной корреляции и R-статистики для простой линейной регрессии
Часто утверждается, что квадрат выборочной корреляции эквивалентен коэффициенту определения для простой линейной регрессии. Я не смог продемонстрировать это сам и был бы признателен за полное доказательство этого факта.r2r2r^2R2R2R^2

1
Существует ли теорема, в которой говорится, что сходится по распределению к нормали, когда стремится к бесконечности?
Пусть будет любым распределением с определенным средним значением и стандартным отклонением . Центральная предельная теорема говорит, что сходится по распределению к стандартному нормальному распределению. Если мы заменим типовым стандартным отклонением , существует ли теорема о том, что сходится по распределению к t-распределению? Так как для большихXXXμμ\muσσ\sigman−−√X¯−μσnX¯−μσ \sqrt{n}\frac{\bar{X} - \mu}{\sigma} σσ\sigmaSSSn−−√X¯−μSnX¯−μS …

2
Обнаружение аномалий: какой алгоритм использовать?
Контекст: я разрабатываю систему, которая анализирует клинические данные для фильтрации неправдоподобных данных, которые могут быть опечатками. Что я сделал до сих пор: Для количественной оценки правдоподобия до сих пор я пытался нормализовать данные, а затем вычислить значение правдоподобия для точки p на основе ее расстояния до известных точек данных в …

3
Статистический тест для сравнения точности двух приборов
Я сравниваю два устройства контроля температуры, оба из которых предназначены для поддержания температуры тела на уровне точно 37 градусов у анестезированных пациентов. Аппараты были установлены на 500 пациентов, составляющих две группы. Группа A (400 пациентов) - Устройство 1, Группа B (100 пациентов) - Устройство 2. Температура каждого пациента измерялась один …

2
Должен ли я загружаться на уровне кластера или на индивидуальном уровне?
У меня есть модель выживания с пациентами, размещенными в больницах, которая включает случайный эффект для больниц. Случайный эффект имеет гамма-распределение, и я пытаюсь сообщить о «значимости» этого термина в легко понятной шкале. Я нашел следующие ссылки, в которых используется Медианное соотношение рисков (немного похожее на Медианный коэффициент вероятности), и рассчитал …

2
Как влияет формула пророчества Спирмена-Брауна на вопросы разной сложности?
Как на результаты формулы пророчества Спирмена-Брауна влияют вопросы теста с различными трудностями или оценщиками, которые являются легкими или твердыми учениками. В одном уважаемом тексте говорится, что SB затронут, но не дает подробностей. (См. Цитату ниже.) Guion, R.M (2011). Оценка, измерение и прогнозирование кадровых решений, 2-е издание. Стр. 477 «Надежность может …

3
Почему повторные измерения ANOVA предполагают сферичность?
Почему повторные измерения ANOVA предполагают сферичность? Под сферичностью я подразумеваю предположение, что дисперсия всех парных различий между группами должна быть одинаковой. В частности, я не понимаю, почему это должно быть предположение, а не то, что отклонения наблюдаемых групповых оценок сами по себе одинаковы.

1
Необходимое количество симуляций для анализа Монте-Карло
Мой вопрос о необходимом количестве симуляций для метода анализа Монте-Карло. Насколько я вижу, необходимое количество симуляций для любой допустимой процентной ошибки (например, 5) равно EEEn={100⋅zc⋅std(x)E⋅mean(x)}2,n={100⋅zc⋅std(x)E⋅mean(x)}2, n = \left\{\frac{100 \cdot z_c \cdot \text{std}(x)}{E \cdot \text{mean}(x)} \right\}^2 , где - стандартное отклонение результирующей выборки, а - коэффициент уровня достоверности (например, для 95% …

1
Почему не нормально распределенные ошибки ставят под угрозу достоверность наших утверждений о значимости?
При рассмотрении моделей OLS существует предположение о нормальности, а именно то, что ошибки распределяются нормально. Я просматривал Cross Validated, и кажется, что Y и X не должны быть нормальными, чтобы ошибки были нормальными. Мой вопрос заключается в том, почему, когда у нас есть ошибки, которые обычно не распределяются, действительность наших …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.