Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Какова связь между вероятностью профиля и доверительными интервалами?
Для построения этой диаграммы я сгенерировал случайные выборки разного размера из нормального распределения со средним значением = 0 и sd = 1. Затем были рассчитаны доверительные интервалы с использованием альфа-срезов в диапазоне от 0,001 до 0,999 (красная линия) с помощью функции t.test (), вероятность профиля была рассчитана с использованием кода, …

5
Предполагают ли статистики, что нельзя завалить растение или я просто использую неправильные условия поиска для криволинейной регрессии?
Почти все, что я читал о линейной регрессии и GLM, сводится к следующему: где - не возрастающая или неубывающая функция а - параметр, который вы оценить и проверить гипотезы о. Существуют десятки функций связи и преобразований и чтобы сделать линейной функцией от .f ( x , β ) x β …

4
Как можно разработать правило остановки в анализе мощности двух независимых пропорций?
Я разработчик программного обеспечения, работающий над системами A / B-тестирования. Я не обладаю достаточным опытом в области статистики, но последние несколько месяцев собираю знания. Типичный тестовый сценарий предполагает сравнение двух URL-адресов на веб-сайте. Посетитель посещает, LANDING_URLа затем случайным образом перенаправляется либо на, URL_CONTROLлибо URL_EXPERIMENTAL. Посетитель представляет собой образец, и условие …

2
Почему информационная матрица Фишера является положительной полуопределенной?
Пусть . Информационная матрица Фишера определяется как:θ∈Rnθ∈Rn\theta \in R^{n} I(θ)i,j=−E[∂2log(f(X|θ))∂θi∂θj∣∣∣θ]I(θ)i,j=−E[∂2log⁡(f(X|θ))∂θi∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Как я могу доказать, что информационная матрица Фишера является положительной полуопределенной?

1
Центральная предельная теорема и закон больших чисел
У меня есть вопрос новичка относительно центральной предельной теоремы (CLT): Мне известно, что CLT утверждает, что среднее значение случайных величин iid приблизительно нормально распределено (для , где - индекс слагаемых), или что стандартизированная случайная величина будет иметь стандартное нормальное распределение.nn → ∞n→∞n \to \inftyNnn Теперь закон большого числа гласит, что …

2
Большое расхождение в оценке наклона, когда группы рассматриваются как случайные и фиксированные в смешанной модели
Я понимаю, что мы используем модели случайных эффектов (или смешанных эффектов), когда считаем, что некоторые параметры модели изменяются случайным образом в зависимости от некоторого фактора группировки. У меня есть желание подогнать модель, в которой ответ был нормализован и центрирован (не идеально, но довольно близко) по группирующему фактору, но независимая переменная …

1
Чем экстремальный случайный лес отличается от случайного леса?
Является ли ER более эффективной реализацией (что-то вроде Extreme Gradient Boostingповышения градиента) - важно ли различие с практической точки зрения? Существует пакет R, который их реализует. Это новый алгоритм, который преодолевает «универсальную» реализацию (пакет RandomForest от R) не только с точки зрения эффективности или также в некоторых других областях? Экстремальный …

3
Дисперсионно-ковариационная матрица в лмер
Я знаю, что одним из преимуществ смешанных моделей является то, что они позволяют задавать дисперсионно-ковариационную матрицу для данных (составная симметрия, авторегрессия, неструктурированная и т. Д.). Однако lmerфункция в R не позволяет легко определить эту матрицу. Кто-нибудь знает, какую структуру lmerиспользует по умолчанию и почему нет способа ее легко указать?

5
Вероятность рисования данного слова из пакета букв в скрэббл
Предположим, у вас была сумка с плитками, на каждой из которых была буква. Есть тайлы с буквой 'A', с 'B' и т. Д., И плитки с подстановочными знаками (у нас есть ). Предположим, у вас был словарь с конечным числом слов.NNnNANAn_ANВNВn_BN*N*n_*n = nA+ nВ+ … + NZ+ n*Nзнак равноNA+NВ+...+NZ+N*n = …

9
Попарное расстояние Махаланобис
Мне нужно рассчитать выборочное расстояние Махаланобиса в R между каждой парой наблюдений в матрице ковариат n×pn×pn \times p . Мне нужно решение, которое является эффективным, то есть только n(n−1)/2n(n−1)/2n(n-1)/2 Е. Рассчитываются расстояний, и желательно, чтобы они были реализованы в C / RCpp / Fortran и т. Д. Я предполагаю, что …
18 r  algorithms  distance 

1
Как бороться с высокой корреляцией среди предикторов при множественной регрессии?
Я нашел ссылку в статье, которая выглядит так: Согласно Tabachnick & Fidell (1996), независимые переменные с двумерной корреляцией более 0,70 не должны включаться в множественный регрессионный анализ. Проблема: я использовал в дизайне множественной регрессии 3 переменные, коррелированные> 0,80, VIF около 0,2-2,3, Допуск ~ 4-5. Я не могу исключить ни одну …

3
Периоды в истории статистики
Историю многих областей науки можно разделить на небольшое количество временных интервалов, которые часто начинаются с какого-то важного открытия. Но я никогда не видел ничего подобного в статистике. Очевидно, что есть несколько важных дат, которые можно рассматривать как отправные точки нового периода (Паскаль + Ферма, Байес, Пирсон, Тьюки, ..). Можем ли …
18 history 

4
Как создать нецелое количество последовательных успехов Бернулли?
Данный: Монета с неизвестным уклоном ppp (голова). Строго положительная вещественная a>0a>0a > 0 . Проблема: Генерация случайной переменной Бернулли со смещением papap^{a} . Кто-нибудь знает как это сделать? Например, когда aaa - положительное целое число, можно aaa раз перевернуть монету и посмотреть, все ли результаты были Головами: если они тогда …
18 sampling 

1
Являются ли усеченные числа из генератора случайных чисел все еще «случайными»?
Здесь «усечение» подразумевает снижение точности случайных чисел, а не усечение последовательности случайных чисел. Например, если у меня есть действительно случайных чисел (взятых из любого распределения, например, нормальных, равномерных и т. Д.) С произвольной точностью, и я обрезаю все числа, так что в итоге я получаю набор из чисел, каждое из …

1
, моделирование за период прогнозирования
У меня есть данные временных рядов, и я использовал в качестве модели, чтобы соответствовать данным. является показателем случайная величина, либо 0 (когда я не вижу редкое событие) или 1 (когда я вижу редкое событие). На основании предыдущих наблюдений, которые у меня есть для , я могу разработать модель для используя …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.