Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Эмпирическая альтернатива распределения
BOUNTY: Полная награда будет присуждена кому-либо, кто предоставит ссылку на любой опубликованный документ, который использует или упоминает оценку F~F~\tilde{F} ниже. Мотивация: Этот раздел, вероятно, не важен для вас, и я подозреваю, что он не поможет вам получить награду, но, поскольку кто-то спросил о мотивации, вот над чем я работаю. Я …

1
Дифференциальная энтропия
Дифференциальная энтропия гауссовых RV равна . Это зависит от , который является стандартным отклонением.σlog2(σ2πe−−−√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e})σσ\sigma Если мы нормализуем случайную переменную так, чтобы она имела единичную дисперсию, ее дифференциальная энтропия падает. Для меня это нелогично, поскольку сложность нормализующей постоянной Колмогорова должна быть очень мала по сравнению со снижением энтропии. Можно …

2
Условное ожидание экспоненциальной случайной величины
Для случайной величины ( ) я интуитивно чувствую, что должен равняться поскольку по свойству без памяти распределение такое же, как у но смещено вправо на .X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda)E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]x+E[X]x+E[X]x + \mathbb{E}[X]X|X>xX|X>xX|X > xXXXxxx Однако я изо всех сил пытаюсь использовать свойство без памяти, чтобы дать конкретное доказательство. Любая …

1
Как сгенерировать предсказанные кривые выживших из слабых моделей (используя R coxph)?
Я хочу вычислить предсказанную функцию выживания для модели пропорциональных рисков Кокса с ненадежными терминами [используя пакет выживания]. Похоже, что когда в модели присутствуют слабые члены, предсказанная функция выживания не может быть вычислена. ## Example require(survival) data(rats) ## Create fake weight set.seed(90989) rats$weight<-runif(nrow(rats),0.2,0.9) ## Cox model with gamma frailty on litter …

1
Каковы различия между анализом выживаемости и регрессией Пуассона?
Я работаю над классической проблемой прогнозирования оттока, используя количество посещений сайта данным пользователем, и я подумал, что регрессия Пуассона была подходящим инструментом для моделирования будущего вовлечения этого пользователя. Когда я наткнулся на книгу об анализе выживания и моделировании рисков, я не знаю, какая техника лучше. Я не хочу исследовать обе …

3
Ограниченные машины Больцмана для регрессии?
Я слежу за вопросом, который я задавал ранее по УКР . Я вижу много литературы, описывающей их, но ни одной, которая фактически говорит о регрессии (даже не классификация с помеченными данными). У меня такое ощущение, что он используется только для немаркированных данных. Есть ли ресурсы для обработки регрессии? Или это …

3
Не отрицательная лассо реализация в R
Я ищу какой-нибудь открытый исходный код или существующую библиотеку, которую я могу использовать. Насколько я знаю, пакет glmnet не очень легко расширяется, чтобы охватить неотрицательный случай. Я могу ошибаться, Любой, у кого есть идеи, высоко ценится. Под неотрицательным я подразумеваю, что все коэффициенты должны быть положительными (> 0).
13 r  lasso 

3
Как вы можете обрабатывать нестабильные оценки в линейной регрессии с высокой мультиколлинеарностью, не выбрасывая переменные?
Бета-стабильность в линейной регрессии с высокой мультиколлинеарностью? Скажем, в линейной регрессии переменные и имеют высокую мультиколлинеарность (корреляция составляет около 0,9).х 2Икс1x1x_1Икс2x2x_2 Мы обеспокоены стабильностью коэффициента поэтому мы должны рассмотреть мультиколлинеарность.ββ\beta Решение учебника было бы просто выбросить одну из переменных. Но мы не хотим терять полезную информацию, просто отбрасывая переменные. Какие-либо …

4
Разница временного ряда до Аримы или внутри Аримы
Лучше ли различать ряды (если это необходимо) перед использованием Arima ИЛИ лучше использовать параметр d в Arima? Я был удивлен тем, насколько разные подходящие значения зависят от того, какой маршрут выбран с той же моделью и данными. Или я что-то делаю неправильно? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), end=c(1994,8)) wineindT_diff <-diff(wineindT) #coefficients …
13 r  time-series  arima 

4
Что делать, если значения двух образцов существенно различаются, но разница кажется слишком маленькой, чтобы иметь значение
У меня есть два образца ( в обоих случаях). Средство отличается примерно вдвое от объединенного стандартного. девиация Результирующее значение T составляет приблизительно 10. Хотя приятно знать, что я убедительно показал, что средние значения не одинаковы, мне кажется, это обусловлено большим n. Глядя на гистограммы данных, я, конечно, не чувствую, что, …

2
Как проверить, отбираются ли два многомерных распределения из одной и той же популяции?
Скажем, вам даны два многомерных набора данных, скажем, старый и новый, и предполагается, что они были созданы одним и тем же процессом (для которого у вас нет модели), но, возможно, где-то вдоль линии сбора / создания данные, что-то пошло не так. Вы не захотите использовать новые данные как, скажем, набор …


2
Поиск лучших функций в моделях взаимодействия
У меня есть список белков с их характеристиками. Пример таблицы выглядит так: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 Ряды - это белки, а столбцы - это особенности. У меня также есть список белков, которые также взаимодействуют; например Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 Проблема : для предварительного анализа я хочу знать, …

2
Зачем использовать бета-распределение по параметру Бернулли для иерархической логистической регрессии?
В настоящее время я читаю превосходную книгу Крушке «Анализ байесовских данных». Однако глава об иерархической логистической регрессии (глава 20) несколько сбивает с толку. Рисунок 20.2 описывает иерархическую логистическую регрессию, где параметр Бернулли определяется как линейная функция на коэффициентах, преобразованных через сигмовидную функцию. Похоже, именно таким образом иерархическая логистическая регрессия представлена …

2
Проблема с либсвм е1071?
У меня есть набор данных с двумя перекрывающимися классами, семь точек в каждом классе, точки находятся в двухмерном пространстве. В R, и я бегу svmиз e1071пакета, чтобы построить разделяющую гиперплоскость для этих классов. Я использую следующую команду: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', cost = …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.