Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как нарисовать подобранный график и реальный график распределения гаммы на одном графике?
Загрузите пакет, необходимый. library(ggplot2) library(MASS) Генерация 10000 номеров, приспособленных к гамма-распределению. x <- round(rgamma(100000,shape = 2,rate = 0.2),1) x <- x[which(x>0)] Нарисуйте функцию плотности вероятности, предположим, что мы не знаем, к какому распределению x подходит. t1 <- as.data.frame(table(x)) names(t1) <- c("x","y") t1 <- transform(t1,x=as.numeric(as.character(x))) t1$y <- t1$y/sum(t1[,2]) ggplot() + geom_point(data …

2
Как сделать выборку из дискретного распределения по неотрицательным целым числам?
У меня есть следующее дискретное распределение, где - известные константы:α,βα,β\alpha,\beta p(x;α,β)=Beta(α+1,β+x)Beta(α,β)for x=0,1,2,…p(x;α,β)=Beta(α+1,β+x)Beta(α,β)for x=0,1,2,… p(x;\alpha,\beta) = \frac{\text{Beta}(\alpha+1, \beta+x)}{\text{Beta}(\alpha,\beta)} \;\;\;\;\text{for } x = 0,1,2,\dots Каковы некоторые подходы для эффективной выборки из этого распределения?

3
Рандомизация неслучайной выборки
Я всегда немного удивлен, увидев психологическую рекламу для участия в экспериментальных исследованиях. Конечно, люди, которые отвечают на эти рекламные объявления, не отбираются случайным образом и, следовательно, являются самостоятельным отбором населения. Поскольку известно, что рандомизация решает проблему самоотбора, мне было интересно, действительно ли рандомизация неслучайной выборки что-то изменила. Что вы думаете …

1
На какой вопрос отвечает ANOVA?
Я хочу выучить ANOVA. Прежде чем я начну изучать, как работает алгоритм (какие вычисления необходимо выполнить) и почему он работает, я сначала хотел бы узнать, какую проблему мы на самом деле решаем с помощью ANOVA, или какой ответ мы пытаемся ответить. Другими словами: что такое ввод и что является выводом …
10 anova 

3
Т-распределение с более тяжелым хвостом, чем нормальное распределение
В моих конспектах говорится: Т-распределение выглядит нормально, хотя и с немного более тяжелыми хвостами. Я понимаю, почему это выглядело бы нормально (из-за центральной предельной теоремы). Но мне трудно понять, как математически доказать, что у него более тяжелые хвосты, чем у нормального распределения, и есть ли способ измерить, насколько он тяжелее …

2
Количество бинов при вычислении взаимной информации
Я хочу количественно определить отношения между двумя переменными, A и B, используя взаимную информацию. Способ вычислить его - связать наблюдения (см. Пример кода Python ниже). Однако какие факторы определяют, какое количество лотков является разумным? Мне нужно, чтобы вычисления были быстрыми, поэтому я не могу просто использовать много контейнеров, чтобы быть …

3
Структура рекуррентной нейронной сети (LSTM, ГРУ)
Я пытаюсь понять архитектуру RNN. Я нашел этот учебник, который был очень полезен: http://colah.github.io/posts/2015-08-Understanding-LSTMs/ Особенно это изображение: Как это вписывается в сеть прямой связи? Является ли это изображение просто еще одним узлом в каждом слое?

2
Точно, как R coxph () обрабатывает повторные измерения?
контекст Я пытаюсь понять, как R coxph () принимает и обрабатывает повторяющиеся записи для субъектов (или пациента / клиента, если вы предпочитаете). Некоторые называют это длинным форматом, другие называют это «повторными измерениями». Посмотрите, например, набор данных, который включает столбец идентификатора в разделе Ответы по адресу: Лучшие пакеты для моделей Кокса …

1
Использование медианы для расчета дисперсии
У меня есть 1-D случайная величина, которая чрезвычайно искажена. Чтобы нормализовать это распределение, я хочу использовать медиану, а не среднее. у меня такой вопрос: могу ли я вычислить дисперсию распределения, используя медиану в формуле вместо среднего? т.е. я могу заменить Var(X)=∑[(Xi−mean(X))2]/nVar(X)=∑[(Xi−mean(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{mean}(X))^2]/n с Var(X)=∑[(Xi−median(X))2]/nVar(X)=∑[(Xi−median(X))2]/n \mathrm{Var}(X) = …
10 variance  mean  median 

3
Использование регрессии для проецирования за пределы диапазона данных, хорошо? никогда не хорошо? иногда хорошо?
Что вы думаете об использовании регрессии для проецирования за пределы диапазона данных? Если мы уверены, что она соответствует форме линейной или мощной модели, не может ли модель быть полезной за пределами диапазона данных? Например, у меня объем зависит от цены. Мы должны быть в состоянии прогнозировать цены вне диапазона данных, …

1
Вариационный Байес в сочетании с Монте-Карло
Я читаю вариационный байесовский алгоритм, и, насколько я понимаю, все сводится к мысли, что вы приближаете (где z - скрытые переменные вашей модели и x наблюдаемые данные) с функцией q ( z ) , делая предположение, что q факторизуется как q i ( z i ), где z i является …

1
Производная перекрестной потери энтропии в word2vec
Я пытаюсь проработать первый набор проблем из материала онлайн-курса cs224d в Стэнфорде, и у меня возникли некоторые проблемы с проблемой 3A: При использовании модели пропуска грамм word2vec с функцией прогнозирования softmax и функцией кросс-энтропийной потери мы хочу вычислить градиенты по отношению к предсказанным векторам слов. Итак, учитывая функцию softmax: веся^= …

2
Тенденции выживания в исследованиях случай-контроль
Я представил статью, которая была отклонена из-за неправильного способа анализа выживания. Рефери не оставил никаких других подробностей или объяснений, кроме: «Анализ выживания по временным тенденциям требует более сложных способов цензуры». Вопрос: Снизился ли избыточный риск смерти среди курильщиков за последние десятилетия? Данные: 25 000 курильщиков в Германии. Они были зачислены …

1
Точна ли эта интерпретация редкости?
Согласно документации removeSparseTermsфункции из tmпакета, это то, что влечет за собой редкость: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse …

6
Как читается нотация ?
Как читается нотация ? Это следует нормальному распределению? Или является нормальным распределением? Или, возможно, примерно нормально ..X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX Что если есть несколько переменных, которые следуют (или каковы бы ни были слова) одному и тому же распределению? Как это написано?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.