Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Метрика оценки прогноза для панельных / продольных данных
Я хотел бы оценить несколько различных моделей, которые обеспечивают предсказания поведения на ежемесячном уровне. Данные сбалансированы, и 100 000 и T = 12. В результате посещение концерта происходит в определенном месяце, поэтому оно равно нулю для ~ 80% людей в любом месяце, но есть длинный правый хвост для активных пользователей. …

2
Являются ли t-тест и односторонний ANOVA тестом Вальда?
Считается, что t-тест для проверки того, равняется ли среднее значение нормально распределенной выборки константе, является тестом Вальда путем оценки стандартного отклонения среднего значения выборки с помощью информации Фишера о нормальном распределении по среднему значению выборки. Но тестовая статистика в t-тесте имеет t-распределение Стьюдента, а тестовая статистика в тесте Вальда асимптотически …

2
Насколько точен IQR для обнаружения выбросов
Я пишу сценарий, который анализирует время выполнения процессов. Я не уверен в их распространении, но хочу знать, выполняется ли процесс «слишком долго». До сих пор я использовал 3 стандартных отклонения времени последнего запуска (n> 30), но мне сказали, что это не дает ничего полезного, если данные не являются нормальными (что, …

2
Сравнить классификаторы на основе AUROC или точности?
У меня есть проблема двоичной классификации, и я экспериментирую с различными классификаторами: я хочу сравнить классификаторы. какой из них лучше измерить AUC или точность? И почему? Raondom Forest: AUC: 0.828 Accuracy: 79.6667 % SVM: AUC: 0.542 Accuracy: 85.6667 %

1
Нулевая гипотеза эквивалентности
Предположим, Икс1, X2,, , ,, XNИкс1,Икс2,,,,,ИксNX_1, X_2, \, ... \, , X_n - простая случайная выборка из нормального( μ , σ2)(μ,σ2)(\mu,\sigma^2) распределения. Я заинтересован в проведении следующей проверки гипотезы: ЧАС0:| μ |≤ cЧАС1: | μ | >с ,ЧАС0:|μ|≤сЧАС1:|μ|>с, H_0: | \mu| \le c \\ H_1: |\mu| > c, для данной …

1
Нег Бином и Приор Джеффриса
Я пытаюсь получить априор Джеффриса для отрицательного биномиального распределения. Я не вижу, где я иду не так, поэтому, если кто-то может помочь указать на это, это будет оценено. Итак, ситуация такова: я должен сравнить предыдущие распределения, полученные с использованием бинома и отрицательного бинома, где (в обоих случаях) есть испытаний и …

2
пространственная автокорреляция для данных временных рядов
У меня есть 20-летний набор данных ежегодного количества видов для множества полигонов (~ 200 непрерывных многоугольников неправильной формы). Я использовал регрессионный анализ для определения тенденций (изменение количества в год) для каждого полигона, а также для агрегации данных полигонов на основе границ управления. Я уверен, что в данных имеется пространственная автокорреляция, …

4
Байесовские неинформативные априоры против частых нулевых гипотез: каковы отношения?
Я наткнулся на это изображение в блоге здесь . Я был разочарован тем, что чтение заявления не выявило для меня того же выражения лица, что и для этого парня. Итак, что подразумевается под утверждением о том, что нулевая гипотеза состоит в том, как часто участники выражают неинформативный априор? Это правда? …

2
Есть ли в этом модельном подходе
Мне недавно сказали, что процесс, которому я следовал (компонент тезиса MS), мог быть замечен как переоснащение. Я хочу лучше понять это и посмотреть, согласны ли другие. Целью этой части статьи является Сравните производительность деревьев градиентной ускоренной регрессии со случайными лесами в наборе данных. Посмотрите на производительность последней выбранной модели (GBM …

8
Визуализация данных больших размеров
У меня есть образцы двух классов, которые являются векторами в многомерном пространстве, и я хочу построить их в 2D или 3D. Я знаю о методах уменьшения размерности, но мне нужен действительно простой и легкий в использовании инструмент (в matlab, python или в готовом .exe). Также мне интересно, будет ли представление …

2
Могу ли я включить размер эффекта в качестве независимой переменной в метарегрессию?
Мой вопрос заключается в том, могу ли я использовать размер эффекта в качестве зависимой переменной и другой размер эффекта в качестве независимой переменной в мета-регрессии?XИксXYYY Например, я провел метаанализ влияния упражнений на проблемы с алкоголем и обнаружил значительные результаты и высокую гетерогенность. Я хочу провести мета-регрессию и использовать величину эффекта …

1
Ковариационная матрица для гауссовского процесса и распределения Уишарта
Я читаю эту статью о обобщенных процессах Wishart (GWP). В статье вычисляются ковариации между различными случайными величинами (по гауссовскому процессу ) с использованием экспоненциальной ковариационной функции в квадрате, т. Е. . Затем говорится, что эта ковариационная матрица следует за GWP.К( х , х') = exp( - | ( х - …

2
Что такое хорошая визуализация для пуассоновских регрессий?
Я хочу связать дефекты кода с такими показателями сложности кода, как близость. Одна из распространенных моделей состоит в том, чтобы рассматривать это как процесс Пуассона, где продолжительность - это то, сколько времени затрачивается на кодирование, а плотность - это функция сложности кода. Я могу сделать регрессию и получить значения значимости …

8
Какое статистическое программное обеспечение подходит для преподавания начального курса статистики в социальных науках для студентов?
Я ищу пакет статистического программного обеспечения, который я могу использовать во вводном курсе статистики для программы изучения социальных наук. Студенты не имеют предварительных знаний статистики и опыта работы с языками программирования. Цель состоит в том, чтобы познакомить их с основными статистическими понятиями (как средние значения, дисперсия, сумма квадратов, p-значения, ... …

5
Что делать с коллинеарными переменными
Отказ от ответственности: это для домашнего проекта. Я пытаюсь найти лучшую модель для цен на алмазы, в зависимости от нескольких переменных, и у меня пока что есть довольно хорошая модель. Однако я столкнулся с двумя переменными, которые явно коллинеарны: >with(diamonds, cor(data.frame(Table, Depth, Carat.Weight))) Table Depth Carat.Weight Table 1.00000000 -0.41035485 0.05237998 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.