Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Используют ли нейронные сети эффективное кодирование?
Мой вопрос касается взаимосвязи между гипотезой эффективного кодирования, изложенной на странице Википедии об эффективных алгоритмах кодирования и обучения нейронной сети. Какова связь между гипотезой эффективного кодирования и нейронными сетями? Существуют ли какие-либо модели нейронных сетей, явно вдохновленные гипотезой эффективного кодирования? Или было бы справедливее сказать, что все алгоритмы обучения нейронной …

1
Определение весов наименьших квадратов: функция R lm против
Может кто-нибудь сказать мне, почему я получаю разные результаты от Rвзвешенных наименьших квадратов и ручного решения с помощью матричной операции ? В частности, я пытаюсь вручную решить , где - диагональная матрица весов, - матрица данных, - ответ вектор. W A bWAx=WbWAx=Wb\mathbf W \mathbf A\mathbf x=\mathbf W \mathbf bWW\mathbf WAA\mathbf …

2
Как отобрать усеченное многочленное распределение?
Мне нужен алгоритм для выборки усеченного полиномиального распределения. Это, Икс⃗ ∼ 1ZпИкс11… РИксККИкс1! … ХК!Икс→~1Zп1Икс1...пКИксКИкс1!...ИксК!\vec x \sim \frac{1}{Z} \frac{p_1^{x_1} \dots p_k^{x_k}}{x_1!\dots x_k!} где - нормализационная константа, имеет положительных компонент и . Я рассматриваю только значения в диапазоне .ZZZИкс⃗ Икс→\vec xККk∑ хя= пΣИксязнак равноN\sum x_i = nИкс⃗ Икс→\vec{x}a⃗ ≤ х⃗ ≤ …

2
Несмещенная оценка параметра Пуассона
Количество несчастных случаев в день - это случайная переменная Пуассона с параметром , в 10 случайно выбранных дней число несчастных случаев было отмечено как 1,0,1,1,2,0,2,0,0,1, что будет быть беспристрастным оценщиком ?e λλλ\lambdaеλeλe^{\lambda} Я попытался сделать это следующим образом: мы знаем, что , но . Тогда каков будет требуемый объективный оценщик?Е( …

1
Что обычного, в обычных наименьших квадратах?
Мой друг недавно спросил, что же такого обычного, в отношении наименьших квадратов. Похоже, мы ни к чему не привели в обсуждении. Мы оба согласились, что OLS является частным случаем линейной модели, она имеет много применений, хорошо известна и является частным случаем многих других моделей. Но действительно ли это все? Поэтому …

1
Является ли сумма большого числа независимых случайных величин Коши нормальной?
По центральной предельной теореме функция плотности вероятности суммы больших независимых случайных величин стремится к нормали. Поэтому можно ли сказать, что сумма большого числа независимых случайных величин Коши также является нормальной?

2
Как улучшить время выполнения для импутации данных R MICE
Мой вопрос вкратце: есть ли способы улучшить время работы R MICE (вменение данных)? Я работаю с набором данных (30 переменных, 1,3 миллиона строк), который содержит (совершенно случайно) недостающие данные. Около 8% наблюдений примерно в 15 из 30 переменных содержат НК. Чтобы вложить недостающие данные, я запускаю функцию MICE, часть пакета …

2
Сила леди, дегустирующая чайный эксперимент
В известном эксперименте Фишера наблюдаемый является количеством скорректированного отгаданнога чашки имеющим два виду чашки и . Обычно интересно вычислить критическую область, чтобы отвергнуть нулевую гипотезу (дама случайным образом угадывает), учитывая размер теста . Это легко сделать с помощью гипергеометрического распределения. Таким же образом я могу вычислить размер теста с учетом …


1
Есть ли другая интерпретация для гамма-распределения с нецелым параметром формы?
Хорошо известно, что случайная величина, являющаяся гамма-распределением с параметром целочисленной формы kКk, эквивалентна сумме квадратов kКk нормально распределенных случайных величин. Но что я могу сказать о гамма-распределенной случайной переменной с нецелым kКk ? Есть ли вообще какая-то другая интерпретация, кроме гамма-распределения?

2
Оценки дерева ВСЕГДА смещены?
Я делаю домашнюю работу по деревьям принятия решений, и один из вопросов, на которые я должен ответить, это «Почему оценки построены из предвзятых деревьев, и как мешки помогают уменьшить их дисперсию?». Теперь я знаю, что переоснащенные модели, как правило, имеют очень низкий уклон, потому что они пытаются уместить все точки …
9 cart  bias 

3
Имитировать переменную Бернулли с вероятностью
Может кто-нибудь сказать мне, как смоделировать , где , используя подбрасывание монеты (столько раз, сколько вам нужно) с ?Bernoulli(ab)Bernoulli(ab)\mathrm{Bernoulli}\left({a\over b}\right)a,b∈Na,b∈Na,b\in \mathbb{N}P(H)=pP(H)=pP(H)=p Я думал об использовании выборки отклонения, но не мог прибить это.

2
Как изменяется косинусное сходство после линейного преобразования?
Есть ли математическая связь между: косинусное сходство двух векторов и , иA Bsim(A,B)sim⁡(A,B)\operatorname{sim}(A, B)AAABBB косинусное сходство для и , неравномерно масштабированное с помощью заданной матрицы ? Здесь - заданная диагональная матрица с неравными элементами на диагонали.A Bsim(MA,MB)sim⁡(MA,MB)\operatorname{sim}(MA, MB)AAABBBМMMMMMM Я попытался просмотреть вычисления, но не смог найти простую / интересную ссылку …

1
Что значит интегрировать по случайной мере?
В настоящее время я смотрю на статью о модели случайных эффектов процесса Дирихле, и спецификация модели выглядит следующим образом: где - параметр масштаба и является базовой мерой. Позже в статье предлагается интегрировать функцию по базовой мере например Базовая мера в процессе Дирихле - это cdf или pdf? Что произойдет, если …

1
Что такое хорошая современная книга / ресурс по продвинутым экспериментам?
Я ищу ресурсы (не обязательно одну книгу), которые бы охватывали некоторые из наиболее сложных случаев экспериментального проектирования и статистического анализа. Некоторые из случаев, которые я хотел бы охватить: 1. Случаи, когда единицы рандомизации отличаются от единиц анализа Пример: у меня есть платформа электронной коммерции с M продавцами и N покупателями. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.