Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Почему нормализующий фактор требуется в теореме Байеса?
Теорема Байеса имеет вид P(model|data)=P(model)×P(data|model)P(data)P(model|data)=P(model)×P(data|model)P(data) P(\textrm{model}|\textrm{data}) = \frac{P(\textrm{model}) \times P(\textrm{data}|\textrm{model})}{P(\textrm{data})} Это все хорошо. Но я где-то читал: По сути, P (данные) - это не что иное, как нормализующая константа, то есть константа, которая заставляет апостериорную плотность интегрироваться в единицу. Мы знаем, что0≤P(model)≤10≤P(model)≤10 \leq P(\textrm{model}) \leq 1 и . 0 ≤ …

4
«Общая площадь под функцией плотности вероятности равна 1» - относительно чего?
Концептуально я понимаю значение фразы «общая площадь под PDF равна 1». Это должно означать, что шансы на результат в общем интервале возможностей составляют 100%. Но я не могу понять это с «геометрической» точки зрения. Если, например, в PDF ось x представляет длину, общая площадь под кривой не станет больше, если …

2
Выбор между -test и -test
Справочная информация: Я делаю презентацию для коллег по работе по проверке гипотез, и понимаю, что большинство из них прекрасно, но есть один аспект, который я связываю себя в узлах, пытаясь понять, а также объяснить это другим. Это то, что я думаю, я знаю (пожалуйста, исправьте, если не так!) Статистические данные, …

2
Работает ли система Caret Train для glmnet перекрестной проверки как для альфы, так и для лямбды?
Является ли caretпакет R перекрестной проверки как для модели, так alphaи lambdaдля glmnetнее? Запуск этого кода, eGrid <- expand.grid(.alpha = (1:10) * 0.1, .lambda = (1:10) * 0.1) Control <- trainControl(method = "repeatedcv",repeats = 3,verboseIter =TRUE) netFit <- train(x =train_features, y = y_train, method = "glmnet", tuneGrid = eGrid, trControl …

2
Указание модели разницы в различиях с несколькими периодами времени
Когда я оцениваю модель разности различий с двумя периодами времени, эквивалентная модель регрессии а. Yist=α+γs∗Treatment+λdt+δ∗(Treatment∗dt)+ϵistYist=α+γs∗Treatment+λdt+δ∗(Treatment∗dt)+ϵistY_{ist} = \alpha +\gamma_s*Treatment + \lambda d_t + \delta*(Treatment*d_t)+ \epsilon_{ist} где TreatmentTreatmentTreatment - манекен, равный 1, если наблюдение относится к группе лечения и представляет собой манекен, который равен 1 в период времени после того, как лечение …

4
Генерация случайных величин из смеси нормальных распределений
Как я могу сделать выборку из распределения смеси, и в частности из смеси нормальных распределений в R? Например, если я хотел сделать выборку из: 0,3× N( 0 , 1 )+0,5× N( 10 , 1 )+0.2× N( 3 , .1 )0.3×N(0,1)+0.5×N(10,1)+0.2×N(3,.1) 0.3\!\times\mathcal{N}(0,1)\; + \;0.5\!\times\mathcal{N}(10,1)\; + \;0.2\!\times\mathcal{N}(3,.1) как я мог это сделать?

3
Гентлеровский подход к байесовской статистике
Недавно я начал читать «Введение в байесовскую статистику», 2-е издание, Bolstad. У меня был вводный класс статистики, который охватывал в основном статистические тесты, и я почти прошел класс регрессионного анализа. Какие еще книги я могу использовать, чтобы дополнить мое понимание этой? Я прошел через первые 100-125 страниц. После этого книга …

2
Почему обратное распространение не работает, когда вы инициализируете весовые значения одного и того же значения?
Почему обратное распространение не работает, когда вы инициализируете все веса одним и тем же значением (скажем, 0,5), но работает нормально, когда заданы случайные числа? Разве алгоритм не должен вычислять ошибку и работать оттуда, несмотря на то, что веса изначально одинаковы?

2
Что происходит, когда я включаю квадратную переменную в регрессию?
Я начну с моей регрессии OLS: где D - фиктивная переменная, оценки становятся отличными от нуля с низким значением p. Затем я предварительно провожу тест СБРОСА Рэмси и нахожу, что у меня есть некоторая неправильная оценка уравнения, поэтому я включаю квадрат x: y = β 0 + β 1 x …

3
Как интерпретировать термин перехват в GLM?
Я использую R и анализирую свои данные с помощью GLM с биноминальной ссылкой. Я хочу знать, что означает перехват в выходной таблице. Перехват для одной из моих моделей существенно отличается, однако переменная - нет. Что это значит? Что такое перехват? Я не знаю, просто ли я запутываю себя, но, обыскав …


5
Зачем беспокоиться о приближении низкого ранга?
Если у вас есть матрица с n строками и m столбцами, вы можете использовать SVD или другие методы для вычисления аппроксимации низкого ранга данной матрицы. Однако в приближении низкого ранга все равно будет n строк и m столбцов. Как могут быть использованы низкоранговые аппроксимации для машинного обучения и обработки естественного …

4
Статистическая интуиция / смысл данных
Я студент второго курса, изучаю математику, и я много говорил с одним из моих профессоров о разнице между математическими и статистическими способностями. Одним из ключевых отличий, которые он затронул, было «чувство данных», которое он объяснил как сочетание технических способностей, работая в рамках набора, который я неформально назову «ограничениями здравого смысла», …

5
Есть ли R-функция, которая будет вычислять матрицу косинусных различий? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто в прошлом году . Я хотел бы сделать тепловую карту с кластеризацией строк на основе косинусных расстояний. Я использую R и heatmap.2()для создания фигуры. …

4
Каково распределение округленных в меньшую сторону средних пуассоновских случайных величин?
Если у меня есть случайные величины , которые распределены по Пуассону с параметрами , каково распределение (т. Целое число среднего значения)?λ 1 , λ 2 , … , λ n Y = ⌊ ∑ n i = 1 X iX1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_nλ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_nY=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor Сумма Пуассона - это тоже Пуассон, но …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.