Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как повторное взвешивание данных о разнообразии Американского Сообщества повлияет на погрешность?
Справочная информация. В настоящее время моя организация сравнивает свои статистические данные о разнообразии рабочей силы (например,% инвалидов,% женщин,% ветеранов) с общей доступностью рабочей силы для этих групп на основе обследования американского сообщества (проект обследования Бюро переписи населения США). Это неточный ориентир, потому что у нас очень специфический набор рабочих мест, …

2
В продольном исследовании я должен вменять результат Y, измеренный во время 2, для людей, которые были потеряны для наблюдения?
Я повторил измерения в 2 раза в выборке людей. В момент 1 - 18 тысяч человек, а в момент 2 - 13 тысяч человек (5000 потерянных для последующего наблюдения). Я хочу регрессировать результат Y, измеренный в момент времени 2 (и результат не может быть измерен в момент времени 1) на …

2
Подходящая мера для поиска наименьшей ковариационной матрицы
В учебнике, который я читаю, они используют положительную определенность (полуположительную определенность) для сравнения двух ковариационных матриц. Идея заключается в том , что если имеет полидисперсность , то меньше , чем . Но я изо всех сил пытаюсь получить интуицию этих отношений?A−BA−BA-BBBBAAA Здесь есть похожая тема: /math/239166/what-is-the-intuition-for-using-definiteness-to-compare-matrices Какова интуиция для использования …

4
Идея смешанной модели и байесовский метод
В смешанной модели мы предполагаем, что случайные эффекты (параметры) являются случайными величинами, которые следуют нормальному распределению. Это выглядит очень похоже на байесовский метод, в котором все параметры предполагаются случайными. Так является ли модель случайных эффектов частным случаем байесовского метода?

2
Робастный регрессионный вывод и сэндвич-оценки
Можете ли вы дать мне пример использования сэндвич-оценок для выполнения надежного регрессионного вывода? Я могу видеть пример ?sandwich, но я не совсем понимаю, как мы можем перейти от lm(a ~ b, data)( r- кодированного) к оценке и к значению p, полученному в результате регрессионной модели с использованием матрицы дисперсии-ковариации, возвращаемой …
10 r  regression  lm  sandwich 

3
Сравнение вложенных бинарных моделей логистической регрессии, когда большое
Чтобы лучше задать мой вопрос, я предоставил некоторые из выводов как из 16 переменных моделей ( fit), так и из 17 переменных моделей ( fit2) ниже (все предикторные переменные в этих моделях являются непрерывными, где единственное различие между этими моделями состоит в том, fitчто содержит переменную 17 (var17)): fit Model …

2
Составление сводной статистики со средним, сд, мин и макс?
Я из области экономики и обычно в дисциплине сводная статистика переменных представлена ​​в таблице. Тем не менее, я хочу построить их. Я мог бы изменить коробчатый график так, чтобы он отображал среднее, стандартное отклонение, минимум и максимум, но я не хочу этого делать, поскольку прямоугольные диаграммы традиционно используются для отображения …

1
Быстрая интеграция с eCDF в R
У меня есть интегральное уравнение вида где - эмпирический cdf, а - функция , У меня есть сжатие отображения, и поэтому я пытаюсь решить интегральное уравнение с помощью последовательности теоремы Банаха о неподвижной точке.Р н гT1( х ) = ∫Икс0г( Т1( у) ) d F^N( у)T1(Икс)знак равно∫0Иксг(T1(Y)) dF^N(Y) T_1(x) = …

2
Проверьте, выпадают ли люди или уменьшают ставки после повторных проигрышей
У меня есть данные о серии выигрышных и проигрышных ставок за 5 раундов ставок с истощением после каждого раунда. Я использую дерево решений, подобное следующему, для отображения данных. Узлы к вершине дерева - это те, которые имеют выигрышные ставки, а узлы к нижней части дерева имеют ряд проигрышных ставок. Я …

2
Как сравнить среднее значение двух выборок, данные которых соответствуют экспоненциальному распределению
У меня есть два образца данных, базовый образец и образец лечения. Гипотеза состоит в том, что образец лечения имеет более высокое среднее значение, чем базовый образец. Оба образца имеют экспоненциальную форму. Поскольку данные довольно велики, у меня есть только среднее значение и количество элементов для каждого образца на момент проведения …

1
Есть ли «стандарт» для обозначения статистической модели?
Например, в руководстве BUGS или в следующей книге Lee and Wagenmakers ( pdf ) и во многих других местах используется тип обозначения, который мне кажется очень гибким в том смысле, что его можно использовать для краткого описания большинства статистических моделей. Примером этого обозначения является следующее: yi∼Binomial(pi,ni)log(pi1−pi)=bibi∼Normal(μp,σp)yi∼Binomial(pi,ni)log⁡(pi1−pi)=bibi∼Normal(μp,σp) y_i \sim \text{Binomial}(p_i,n_i) \\ …

4
Я хочу показать
Пусть - случайная величина на вероятностном пространстве Покажите, чтоИкс: Ω → NX:Ω→NX:\Omega \to \mathbb N( Ω , B, P)(Ω,B,P)(\Omega,\mathcal B,P)Е( Х) = ∑n = 1∞п( Х≥ н ) .E(X)=∑n=1∞P(X≥n).E(X)=\sum_{n=1}^\infty P(X\ge n). мое определение из равно Е( Х)E(X)E(X)Е( Х) = ∫ΩИксdп,E(X)=∫ΩXdP.E(X)=\int_\Omega X \, dP. Спасибо.

2
Понимание хеширования функций
Википедия предоставляет следующий пример при описании хеширования функций ; но отображение не соответствует определенному словарю Например, toдолжен быть преобразован в 3соответствии со словарем, но он закодирован как 1вместо. Есть ли ошибка в описании? Как работает функция хеширования? Тексты: John likes to watch movies. Mary likes too. John also likes to …

1
Пересчитать логарифмическое правдоподобие из простой модели R lm
Я просто пытаюсь пересчитать с помощью dnorm () логарифмическую вероятность, обеспечиваемую функцией logLik из модели lm (в R). Это работает (почти идеально) для большого количества данных (например, n = 1000): > n <- 1000 > x <- 1:n > set.seed(1) > y <- 10 + 2*x + rnorm(n, 0, 2) …

2
относительно условной независимости и ее графического представления
При изучении выбора ковариации я однажды прочитал следующий пример. Что касается следующей модели: Его ковариационная матрица и обратная ковариационная матрица имеют следующий вид: Я не понимаю, почему независимость и определяется здесь обратной ковариацией?уИксxxYyy Какая математическая логика лежит в основе этих отношений? Кроме того, левый график на следующем рисунке, как утверждается, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.