Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Проверка гипотез на обратной ковариационной матрице
Предположим, я наблюдаю iid и хочу проверить vech для согласованной матрицы и вектора . Известны ли работы по этой проблеме?Икся∼ N( μ , Σ )Икся~N(μ,Σ)x_i \sim \mathcal{N}\left(\mu,\Sigma\right)( Σ - 1 ) = a A aЧАС0: A ЧАС0:A H_0: A\ ( Σ- 1) =а(Σ-1)знак равноa\left(\Sigma^{-1}\right) = aAAAaaa Очевидная (для меня) попытка …

2
R эквивалентно опции кластера при использовании отрицательной биномиальной регрессии
Я пытаюсь повторить работу коллеги и перемещаю анализ из Stata в R. Модели, которые она использует, вызывают параметр «cluster» в функции nbreg для кластеризации стандартных ошибок. См. Http://repec.org/usug2007/crse.pdf для довольно полного описания того, что и почему этого параметра Мой вопрос: как вызвать эту же опцию для отрицательной биномиальной регрессии в …

1
Есть ли обобщение следа Пиллая и следа Хотеллинга-Лоули?
В условиях многомерной множественной регрессии (векторный регрессор и регрессия) четыре основных критерия общей гипотезы (лямбда Вилка, Пиллаи-Бартлетт, Хотеллинг-Лоули и самый большой корень Роя) зависят от собственных значений матрицы , где H и E - «объясненная» и «общая» вариационные матрицы.HE−1HE−1H E^{-1}HHHEEE Я заметил , что ПИЛЛАИ и Хотеллинг-Lawley статистические данные могут …

1
Что означают взаимодействия сплайн и не сплайн терминов?
Если я подгоняю свои данные к чему-то вроде lm(y~a*b), в синтаксисе R, где aэто двоичная переменная и bчисловая переменная, то a:bтермин взаимодействия - это разница между наклоном y~bat a= 0 и at a= 1. Теперь, скажем, отношения между yи bкриволинейные. Если я сейчас подхожу lm(y~a*poly(b,2)), то a:poly(b,2)1изменение в y~bусловных изменениях …

3
В чем разница между статистикой и информатикой?
Мы всегда говорим, что статистика имеет дело только с данными. Но мы также знаем, что информатика также получает знания от анализа данных. Например, биоинформатики могут полностью обходиться без биостатистики. Я хочу знать, в чем принципиальная разница между статистикой и информатикой.

2
Регуляризация нормы и нормы эмпирического исследования
Существует много способов выполнения регуляризации - например, регуляризация на основе норм , и . Согласно Friedman Hastie & Tibsharani , лучший регуляризатор зависит от проблемы: а именно от природы истинной целевой функции, конкретной используемой основы, отношения сигнал / шум и размера выборки.L0L0L_0L1L1L_1L2L2L_2 Есть ли эмпирические исследования, сравнивающие методы и эффективность …

1
Структура щелчков мышью (или клавиатурой) и прогнозирование активности пользователя компьютера
Можно ли прогнозировать активность пользователя компьютера только на основании временной последовательности щелчков мыши (список времени щелчков мышью )?[t1,t2,t3,…][t1,t2,t3,…][t_1,t_2,t_3,\ldots] Например, из-за того, что вы работаете, проводите время в Facebook, смотрите фотографии, играете в компьютерную игру. Если они представляют собой более детальные прогнозы (например, игра StarCraft против Counter Strike против SimCity), то …

6
Как оценить прогностическую силу множества категориальных предикторов бинарного исхода? Рассчитать вероятности или логистическую регрессию?
Я пытаюсь определить, будут ли простые вероятности работать для моей проблемы или будет лучше использовать (и узнать о) более сложные методы, такие как логистическая регрессия. Переменная ответа в этой задаче является двоичным ответом (0, 1). У меня есть несколько переменных предикторов, которые являются категориальными и неупорядоченными. Я пытаюсь определить, какие …

2
Что такое достоверный последующий анализ для трехфакторных повторных измерений ANOVA?
Я выполнил трехсторонние повторные измерения ANOVA; какие специальные анализы действительны? Это полностью сбалансированный дизайн (2x2x2) с одним из факторов, имеющих повторное измерение внутри субъекта. Мне известны многовариантные подходы к повторным измерениям ANOVA в R, но мой первый инстинкт - перейти к простому стилю aov () ANOVA: aov.repeated <- aov(DV ~ …

3
Выявление приоры ... с деньгами!
Предположим , у меня есть «экспертов», из которых я хотел бы, чтобы вызвать предварительное распределение по некоторой переменной X . Я хотел бы мотивировать их реальными деньгами . Идея состоит в том, чтобы выявить априоры, наблюдать n реализаций случайной величины X , а затем разделить некоторый заранее определенный «кошелек» среди …
10 bayesian  prior 

1
Почему мы не можем доверять нашей интуиции с вероятностью?
Если когда-либо был случай, когда это стало ясно, это проблема Монти Холла. Даже великий Пол Эрдос был одурачен этой проблемой. Мой вопрос, на который может быть трудно ответить, заключается в том, что насчет вероятности того, что мы можем быть настолько уверены в ответе, что получаем интуитивный аргумент и все же …

2
В чем разница между последовательной корреляцией и наличием единичного корня?
Возможно, я смешиваю свои концепции временных рядов и не временных рядов, но в чем разница между регрессионной моделью, демонстрирующей последовательную корреляцию, и моделью, показывающей единичный корень? Кроме того, почему вы можете использовать тест Дурбина-Ватсона для проверки последовательной корреляции, но вы должны использовать тест Дики-Фуллера для единичных корней? (Мой учебник говорит, …

6
Квартили в Excel
Меня интересует определение квартиля, которое обычно используется, когда вы занимаетесь базовой статистикой. У меня есть книга типа Stat 101, и она просто дает интуитивное определение. «Около четверти данных приходится на первый квартиль или ниже ...» Но он дает пример, в котором он вычисляет Q1, Q2 и Q3 для набора данных. …
10 excel  quantiles 

3
Как сравнить точность двух разных моделей, используя статистическую значимость
Я работаю над прогнозированием временных рядов. У меня есть два набора данных: и . У меня есть три модели прогнозирования: M1, M2, M3 . Все эти модели обучаются с использованием выборок в наборе данных D1 , и их производительность измеряется с использованием выборок в наборе данных D2 . Допустим, показатели …

3
Остатки для логистической регрессии и расстояния Кука
Существуют ли какие-либо особые предположения относительно ошибок логистической регрессии, такие как постоянная дисперсия слагаемых ошибок и нормальность остатков? Также обычно, когда у вас есть точки, у которых расстояние Кука больше 4 / n, вы их удаляете? Если вы удалите их, как вы можете определить, лучше ли модель с удаленными точками?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.