Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Сложный регрессионный график в R
Мне нужно нарисовать сложную графику для визуального анализа данных. У меня есть 2 переменные и большое количество случаев (> 1000). Например (число равно 100, если дисперсия меньше "нормальной"): x <- rnorm(100,mean=95,sd=50) y <- rnorm(100,mean=35,sd=20) d <- data.frame(x=x,y=y) 1) Мне нужно построить исходные данные с размером точки, соответствующей относительной частоте совпадений, …

4
Тестирование статистического программного обеспечения
Какие методы / подходы полезны при тестировании статистического программного обеспечения? Мне особенно интересны программы, которые выполняют параметрическую оценку с максимальной вероятностью. Сравнение результатов с результатами других программ или опубликованных источников не всегда возможно, так как большую часть времени, когда я пишу собственную программу, это происходит потому, что необходимые мне вычисления …

1
Альтернативный воронкообразный график, без использования стандартной ошибки (SE)
Перед отправкой моего метаанализа я хочу создать воронкообразный график для проверки на неоднородность и смещение публикаций. У меня есть объединенный размер эффекта и размеры эффекта от каждого исследования, которые принимают значения от -1 до +1. У меня есть размеры выборки n1, n2 для пациентов и контроля из каждого исследования. Поскольку …

2
RNG, R, mclapply и кластер компьютеров
Я запускаю симуляцию на R и кластере компьютеров и имею следующую проблему. На каждом из компьютеров X я запускаю: fxT2 <- function(i) runif(10) nessay <- 100 c(mclapply(1:nessay, fxT2), recursive=TRUE) Есть 32 компьютера, каждый с 16 ядрами. Тем не менее, около 2% случайных чисел идентичны. Какие стратегии вы бы приняли, чтобы …

1
Как количественно оценить избыточность функций?
У меня есть три функции, которые я использую для решения проблемы классификации. Первоначально эти функции создавали логические значения, поэтому я мог оценить их избыточность, посмотрев, насколько перекрываются наборы положительных и отрицательных классификаций. Теперь я расширил возможности для получения реальных значений (баллов), и я хотел бы снова проанализировать их избыточность, но …

4
С адреса электронной почты до квази-случайного числа [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Моя цель: Я хотел бы иметь функцию, которая берет адрес электронной почты и выводит квазислучайное число 1, 2, 3 …

1
Использование пакета статистики в R для кластеризации kmeans
Мне трудно понять один или два аспекта кластерного пакета. Я внимательно следую примеру Quick-R , но не понимаю один или два аспекта анализа. Я включил код, который я использую для этого конкретного примера. ## Libraries library(stats) library(fpc) ## Data mydata = structure(list(a = c(461.4210925, 1549.524107, 936.42856, 0, 0, 0, 0, …
10 r  clustering 

4
Ресурс о концепциях, лежащих в основе статистики, а не о методах, используемых в прикладной статистике
В какой книге наиболее подробно рассматриваются фундаментальные понятия в статистике? Я не прошу книгу о деталях методов расчетов и процедур, меня интересует в основном книга, которая подробно объясняет основные концепции ... интуитивный / иллюстрированный / визуальный подход к основным идеям ... а не нагрузка математических уравнений и т. д. Размер …
10 references 

1
Документированные / воспроизводимые примеры успешного применения эконометрических методов в реальных условиях?
Этот вопрос может показаться очень широким, но вот что я ищу. Я знаю, что есть много прекрасных книг об эконометрических методах и много отличных пояснительных статей об эконометрических методах. Существуют даже превосходные воспроизводимые примеры эконометрики, как описано в этом перекрестном вопросе . На самом деле примеры в этом вопросе очень …

2
Цензура / Усечение в ЯГС
У меня есть вопрос о том, как вписать проблему цензуры в JAGS. Я наблюдаю нормальную двумерную смесь, где значения Х имеют погрешность измерения. Я хотел бы смоделировать истинные базовые «средства» наблюдаемых цензурированных значений. ⌈ хт т у й+ ϵ ⌉ = xО Ь сек е г V е г ε …

2
Разница между реализацией регрессионного гребня в R и SAS
Я читал описание регрессии гребня в Прикладных линейных статистических моделях , 5-е издание, глава 11. Регрессия гребня выполняется на основе данных о жировых отложениях, доступных здесь . Учебник соответствует выходным данным в SAS, где обратные преобразованные коэффициенты заданы в модели как: Y=−7.3978+0.5553X1+0.3681X2−0.1917X3Y=−7.3978+0.5553X1+0.3681X2−0.1917X3 Y=-7.3978+0.5553X_1+0.3681X_2-0.1917X_3 Это видно из SAS как: proc reg …

4
Создание интерфейсов MATLAB и R для C5.0 Росса Куинлана
Я рассматриваю построение интерфейсов MATLAB и R для Ross Куинланом «s C5.0 (для тех , кто не знаком с ним, C5.0 является алгоритм дерева решений и пакет программного обеспечения, расширение C4.5 ), и я пытаюсь получить представление о компонентах, которые мне нужно написать. Единственная документация, которую я нашел для C5.0, …

3
Оценка экспоненциальной модели
Экспоненциальная модель - это модель, описываемая следующим уравнением: yi^=β0⋅eβ1x1i+…+βkxkiyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} Наиболее распространенным подходом, используемым для оценки такой модели, является линеаризация, которая может быть легко выполнена путем вычисления логарифмов обеих сторон. Каковы другие подходы? Меня особенно интересуют те, которые могут обрабатывать в некоторых наблюдениях.yi=0yi=0y_{i}=0 Обновление 31.01.2011 Мне известно о том, что …

3
Как оценить параметры для усеченного распределения Zipf из выборки данных?
У меня проблема с параметром оценки для Zipf. Моя ситуация следующая: У меня есть набор образцов (измеренный из эксперимента, который генерирует вызовы, которые должны следовать распределению Zipf). Я должен продемонстрировать, что этот генератор действительно генерирует вызовы с распределением zipf. Я уже читал эти вопросы и ответы. Как рассчитать коэффициент закона …

1
Построение кусочно-регрессионной линии
Есть ли способ построения линии регрессии кусочной модели, подобной этой, кроме использования linesдля построения каждого сегмента отдельно или использования geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In abline(reg = model) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.