Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


3
Die 100 рулонов без лица появляется более 20 раз
Я пытаюсь обернуть голову вокруг этой проблемы. Плашка бросается 100 раз. Какова вероятность того, что лицо не появится более 20 раз? Моей первой мыслью было использование биномиального распределения P (x) = 1 - 6 смс (100, 1/6, 20), но это, очевидно, неправильно, поскольку мы считаем несколько случаев более одного раза. …

2
Понимание формы доверительного интервала для полиномиальной регрессии (MLR)
Мне трудно понять форму доверительного интервала полиномиальной регрессии. Ниже приведен пример Y^= a + b ⋅ X+ c ⋅ X2Y^знак равноa+б⋅Икс+с⋅Икс2\hat{Y}=a+b\cdot X+c\cdot X^2 . На левом рисунке показана UPV (немасштабированная дисперсия прогноза), а на правом графике показан доверительный интервал и (искусственные) измеренные точки при X = 1,5, X = 2 …

2
Если и являются независимыми нормальными переменными, каждая из которых имеет среднее значение ноль, то также является нормальной переменной
Я пытаюсь доказать утверждение: Если и являются независимыми случайными величинами,X∼N(0,σ21)X∼N(0,σ12)X\sim\mathcal{N}(0,\sigma_1^2)Y∼N(0,σ22)Y∼N(0,σ22)Y\sim\mathcal{N}(0,\sigma_2^2) затем также является нормальной случайной величиной.XYX2+Y2√XYX2+Y2\frac{XY}{\sqrt{X^2+Y^2}} Для особого случая (скажем) у нас есть известный результат, который всякий раз, когда и являются независимыми переменными. На самом деле общеизвестно, что являются независимыми переменными .σ1=σ2=σσ1=σ2=σ\sigma_1=\sigma_2=\sigmaXYX2+Y2√∼N(0,σ24)XYX2+Y2∼N(0,σ24)\frac{XY}{\sqrt{X^2+Y^2}}\sim\mathcal{N}\left(0,\frac{\sigma^2}{4}\right)XXXYYYN(0,σ2)N(0,σ2)\mathcal{N}(0,\sigma^2)XYX2+Y2√,X2−Y22X2+Y2√XYX2+Y2,X2−Y22X2+Y2\frac{XY}{\sqrt{X^2+Y^2}},\frac{X^2-Y^2}{2\sqrt{X^2+Y^2}}N(0,σ24)N(0,σ24)\mathcal{N}\left(0,\frac{\sigma^2}{4}\right) Доказательство последнего результата следует с помощью преобразования где …

2
Повышение модели логистической регрессии
Adaboost - это метод ансамбля, который объединяет многих слабых учеников в сильный. Все примеры adaboost, которые я читал, используют пни / деревья решений как слабые ученики. Могу ли я использовать разных слабых учеников в adaboost? Например, как внедрить adaboost (обычно бустинг) для усиления модели логистической регрессии? Одно из основных отличий …

2
Байесовский оценщик невосприимчив к смещению отбора
Являются ли оценки Байеса невосприимчивыми к смещению отбора? В большинстве работ, в которых обсуждаются оценки в высоком измерении, например, данные о последовательности всего генома, часто возникает проблема смещения отбора. Смещение выбора обусловлено тем фактом, что, хотя у нас есть тысячи потенциальных предикторов, будет выбрано лишь немногие, и для избранных будет …

5
Скрытие регрессионной модели от профессора (линкор регрессии) [закрыто]
Закрыто . Этот вопрос нуждается в деталях или ясности . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Добавьте детали и проясните проблему, отредактировав этот пост . Закрыто 2 года назад . Я работаю над домашним заданием, где мой профессор хотел бы, чтобы мы создали реальную модель …

2
Будет ли это вносить смещение в то, что должно быть случайными числами?
Предположим, файл данных содержит более 80 миллионов единиц и нулей, сгенерированных случайным образом. Из этого файла мы хотим создать список случайных десятичных целых чисел. Это план сделать это преобразование. Разделите 80 миллионов цифр на группы из 4 двоичных цифр. Преобразуйте каждый 4-значный двоичный код в десятичный. Отменить все десятичные значения …

1
Следует ли использовать поправки степеней свободы для определения параметров GLM?
Этот вопрос вдохновлен ответом Мартина здесь . Предположим, что мы подходим к GLM для однопараметрического семейства, такого как биномиальная модель или модель Пуассона, и что это процедура полного правдоподобия (в отличие от квазипуассона). Тогда дисперсия является функцией среднего значения. С биномом: и с Пуассоном .var[X]=E[X]E[1−X]var[X]=E[X]E[1−X]\text{var}[X] = E[X]E[1-X]var[X]=E[X]var[X]=E[X]\text{var}[X] = E[X] В …

3
Сверточная чувствительность шкалы нейронной сети
Для примера, давайте предположим, что мы строим оценку возраста, основанную на изображении человека. Ниже у нас два человека в костюмах, но первый явно моложе второго. (источник: tinytux.com ) Есть множество особенностей, которые подразумевают это, например, структура лица. Однако наиболее характерной особенностью является соотношение размера головы к размеру тела : (источник: …

2
Почему Т-статистике нужны данные для нормального распределения
Я смотрел на эту записную книжку , и я озадачен этим утверждением: Когда мы говорим о нормальности, мы имеем в виду, что данные должны выглядеть как нормальное распределение. Это важно, потому что несколько статистических тестов полагаются на это (например, t-статистика). Я не понимаю, зачем Т-статистике нужны данные для нормального распределения. …

1
Интерпретация производной Радона-Никодима между вероятностными мерами?
Я видел в некоторых моментах использование производной Радона-Никодима одной вероятностной меры по отношению к другой, особенно в дивергенции Кульбака-Лейблера, где она является производной вероятностной меры модели для некоторого произвольного параметра с относительно реального параметра θ 0 :θθ\thetaθ0θ0\theta_0 dPθdPθ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} Где это обе вероятностные меры в пространстве точек данных, обусловленные значением …

1
Многомерная линейная регрессия против нескольких одномерных моделей регрессии
В настройках одномерной регрессии мы пытаемся моделировать Y= Хβ+ П о я с йYзнак равноИксβ+Nояsеy = X\beta +noise где вектор из наблюдений, а матрица проектирования с предикторами. Решение: . n X ∈ R n × m m β 0 = ( X T X ) - 1 X yY∈RNY∈рNy \in …

2
Почему эти таблицы регрессионных анова идентичны?
У меня есть две регрессии одного и того же Y и трехуровневого X. В целом n = 15, с n = 5 в каждой группе или уровне X. Первая регрессия рассматривает X как категоричный, присваивая переменные индикатора уровням 2 и 3 с уровнем один из которых является ссылкой. Индикаторы / …
11 regression  anova 

4
Почему методы регрессии методом наименьших квадратов и максимального правдоподобия не эквивалентны, когда ошибки обычно не распределяются?
Название говорит обо всем. Я понимаю, что наименьшие квадраты и максимальное правдоподобие дадут одинаковый результат для коэффициентов регрессии, если ошибки модели будут нормально распределены. Но что произойдет, если ошибки не распределяются нормально? Почему два метода больше не эквивалентны?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.