Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как мы можем получить нормальное распределение как если диапазон значений нашей случайной величины ограничен?
Допустим, у нас есть случайная величина с диапазоном значений, ограниченных aaa и bbb , где aaa - минимальное значение, а бbb - максимальное значение. Мне сказали , что в n → ∞n→∞n \to \infty , где Nnn нашего размера выборки, распределение выборки по средствам выборки является нормальным распределением. То есть, …

1
Интуиция для степеней свободы LASSO
Zou et al. «О« степенях свободы »Лассо» (2007) показывают, что число ненулевых коэффициентов является объективной и непротиворечивой оценкой степеней свободы Лассо. Это кажется немного нелогичным для меня. Предположим, у нас есть модель регрессии (где переменные имеют среднее значение ноль) y=βx+ε.y=βx+ε.y=\beta x + \varepsilon. Предположим, что неограниченная оценка OLS для равна …


4
Ставка Блэквелла
Я читал о парадоксе ставок Блэквелла на шкафу Futility . Вот резюме: вам представлены два конверта, и . Конверты содержат случайную сумму денег, но вы ничего не знаете о распределении денег. Вы открываете один, проверяете, сколько денег там ( ), и вам нужно выбрать: взять конверт или ?E y x …

3
Что является примером совершенной мультиколлинеарности?
Что является примером идеальной коллинеарности с точки зрения матрицы дизайна ?XXX Я хотел бы привести пример, в котором не может быть оценен, потому что не является обратимым.β^=(X′X)−1X′Yβ^=(X′X)−1X′Y\hat \beta = (X'X)^{-1}X'Y(X′X)(X′X)(X'X)

6
Brexit: был ли «отпуск» статистически значимым? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 3 года назад . В этом посте мы задаем вопрос о природном явлении под названием « попытка …

2
Какая доля повторных экспериментов будет иметь величину эффекта в пределах 95% доверительного интервала первого эксперимента?
Давайте придерживаться идеальной ситуации со случайной выборкой, гауссовым населением, равными дисперсиями, без P-хакерства и т. Д. Шаг 1. Вы проводите эксперимент, скажем, сравнивая два выборочных средних, и вычисляете 95% доверительный интервал для разницы между двумя совокупными средними. Шаг 2. Вы проводите еще много экспериментов (тысячи). Разница между средними значениями будет …

2
Настоящий смысл уверенного эллипса
Читая об истинном значении эллипса с доверительной вероятностью 95%, я, как правило, сталкиваюсь с двумя объяснениями: Эллипс, который содержит 95% данных Не выше, но эллипс, который объясняет дисперсию данных. Я не уверен, что правильно понимаю, но они, похоже, означают, что если поступит новая точка данных, есть 95% вероятность того, что …

1
Как рассчитывается доверительный интервал для функции ACF?
Например, в R, если вы вызываете acf()функцию, она строит коррелограмму по умолчанию и рисует 95% доверительный интервал. Глядя на код, если вы звоните plot(acf_object, ci.type="white"), вы видите: qnorm((1 + ci)/2)/sqrt(x$n.used) в качестве верхнего предела для типа белого шума. Кто-нибудь может объяснить теорию, стоящую за этим методом? Почему мы получаем qnorm …

3
Является ли сумма дискретной и непрерывной случайной величины непрерывной или смешанной?
Если - дискретное, а - непрерывная случайная величина, то что мы можем сказать о распределении X + Y ? Это непрерывное или смешанное?YXXXYYYИкс+ YX+YX+Y Как насчет продукта ?ИксYXYXY

2
ICC как ожидаемая корреляция между двумя случайно выбранными единицами, которые находятся в одной группе
В многоуровневом моделировании внутриклассовая корреляция часто рассчитывается по ANOVA со случайными эффектами yij=γ00+uj+eijyij=γ00+uj+eij y_{ij} = \gamma_{00} + u_j + e_{ij} где - остатки уровня 2, а - остатки уровня 1. Затем мы получаем оценки и для дисперсии и соответственно и включаем их в следующее уравнение:е я J σ 2 U …

4
Как (систематически) настроить скорость обучения с использованием градиентного спуска в качестве оптимизатора?
Посторонний в поле ML / DL; начал курс Udacity Deep Learning, основанный на Tensorflow; выполняя задание 3, задача 4; пытаясь настроить скорость обучения с помощью следующего конфига: Размер партии 128 Количество шагов: достаточно, чтобы заполнить 2 эпохи Размеры скрытых слоев: 1024, 305, 75 Инициализация веса: усеченный в норме с помощью …

1
Выбор переменной против выбора модели
Поэтому я понимаю, что выбор переменной является частью выбора модели. Но из чего конкретно состоит выбор модели? Это больше, чем следующее: 1) выберите дистрибутив для вашей модели 2) выбрать объясняющие переменные,? Я спрашиваю об этом, потому что я читаю статью Burnham & Anderson: AIC против BIC, где они говорят об …

1
Будет ли когда-нибудь несчастный Трибл в Озе?
Вот забавная проблема, принесенная мне студентом. Хотя первоначально он был сформулирован в терминах взаимно уничтожающих пуль, выпущенных из пистолета через равные промежутки времени, я подумал, что вам может понравиться более миролюбивая презентация. В бесконечном плоском мире Оз, Желтая Кирпичная Дорога начинается в центре Изумрудного Города, разматывается по всей сельской местности …

4
определить количество пиков в аудиозаписи
Я пытаюсь выяснить, как определить количество слогов в корпусе аудиозаписей. Я думаю, что хороший прокси может быть пиками в волновом файле. Вот то, что я попробовал с файлом моего разговора на английском языке (мой фактический случай использования на кисуахили). Стенограмма записи этого примера: «Я пытаюсь использовать функцию таймера. Я смотрю …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.