Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


1
Почему люди используют термин «вес доказательств» и чем он отличается от «точечной взаимной информации»?
Здесь «вес доказательств» (WOE) - это общий термин в опубликованной научной и политической литературе, чаще всего встречающийся в контексте оценки риска, определяемый как: w(e:h)=logp(e|h)p(e|h¯¯¯)вес(е:час)знак равножурнал⁡п(е|час)п(е|час¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} где - доказательство, h - гипотеза.eеehчасh Теперь я хочу знать, в чем главное отличие PMI (точечная взаимная информация). pmi(e,h)=logp(e,h)p(e)∗p(h)pmi(e,h)=log⁡p(e,h)p(e)∗p(h)pmi(e,h)=\log\frac{p(e,h)}{p(e)*p(h)}

2
Проблема преобразования из фактора в числовую переменную в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 7 лет назад . Я хотел бы преобразовать факторную переменную в числовую, но as.numericне имеет ожидаемого эффекта. Ниже я получаю сводную статистику для …

2
Сравнение коэффициентов корреляции
У меня есть два набора данных, где у меня есть ~ 250.000 значений для 78 и 35 образцов. Некоторые образцы являются членами семьи, и это может повлиять на данные. Я рассчитал парную корреляцию, и она варьируется между 0,7 и 0,95, но я хотел бы знать, есть ли существенная разница в …

1
Примеры того, когда доверительный интервал и вероятный интервал совпадают
В статье в Википедии о Credible Interval говорится: Для случая одного параметра и данных, которые могут быть сведены в одну достаточную статистику, можно показать, что вероятный интервал и доверительный интервал совпадут, если неизвестный параметр является параметром местоположения (т.е. функция прямой вероятности имеет вид Pr (x | μ) = f (x …

1
Как проверить, являются ли мои данные дискретными или непрерывными?
Мне кажется, что для выбора правильных статистических инструментов я должен сначала определить, является ли мой набор данных дискретным или непрерывным. Не могли бы вы научить меня, как я могу проверить, являются ли данные дискретными или непрерывными с помощью R?

1
Какие остатки и расстояние Кука используются для GLM?
Кто-нибудь знает, какова формула расстояния Кука? В оригинальной формуле расстояния Кука используются нечеткие невязки, но почему R использует стандартное отклонение. Остатки Пирсона при расчете расстояния Кука для GLM. Я знаю, что для GLM не определены стедентифицированные невязки, но как выглядит формула для вычисления расстояния Кука? Предположим следующий пример: numberofdrugs <- …

2
Поиск индекса столбца по его имени в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 лет назад . Во фрейме данных я хотел бы получить индекс столбца по имени. Например: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) Я хочу знать индекс …
11 r 

1
Какие графические методы полезны для визуализации агрегации неопределенностей?
У меня есть набор систем, в которых накапливается неопределенность. Они не всегда чисто аддитивные - иногда они есть, иногда нет. У меня был некоторый успех в использовании фан-диаграмм, гистограмм с доверительными интервалами и коробочных диаграмм для передачи отдельных предметов. Но как я могу показать, как неопределенности накапливаются и объединяются, и …

1
Как остановить Excel от изменения диапазона при перетаскивании формулы вниз? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 7 лет назад . Я пытаюсь нормализовать набор столбцов данных в таблице Excel. Мне нужно получить значения, чтобы самое высокое значение в столбце …
11 excel 

1
Моделирование серии ARIMA (1,1,0)
Я приспособил модели ARIMA к исходному временному ряду, и лучшая модель - ARIMA (1,1,0). Теперь я хочу смоделировать серию из этой модели. Я написал простую модель AR (1), но я не мог понять, как отрегулировать разницу в модели ARI (1,1,0). Следующий код R для серии AR (1): phi= -0.7048 z=rep(0,100) …
11 r  time-series  arima 

2
Дисперсия двух взвешенных случайных величин
Позволять: Стандартное отклонение случайной величиныA=σ1=5A=σ1=5A =\sigma_{1}=5 Стандартное отклонение случайной величиныB=σ2=4B=σ2=4B=\sigma_{2}=4 Тогда дисперсия A + B равна: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Куда: p1,2p1,2p_{1,2} - корреляция между двумя случайными величинами. w1w1w_{1} - вес случайной величины A w2w2w_{2} - вес случайной величины B w1+w2=1w1+w2=1w_{1}+w_{2}=1 На приведенном ниже рисунке показана дисперсия A и B при …

4
Как вы тестируете реализацию k-средних?
Отказ от ответственности: я разместил этот вопрос на Stackoverflow, но я подумал, что это лучше подходит для этой платформы. Как вы тестируете свою собственную реализацию k-средних для многомерных наборов данных? Я думал о том, чтобы запустить уже существующую реализацию (то есть Matlab) для данных и сравнить результаты с моим алгоритмом. …

3
Как выполнить t-тест с огромными образцами?
У меня есть две популяции, одна с N = 38,704 (количество наблюдений) и другая с N = 1 313 662. Эти наборы данных имеют ~ 25 переменных, все непрерывные. Я взял среднее значение каждого в каждом наборе данных и вычислил статистику теста, используя формулу t = средняя разница / стандартная …
11 t-test 

1
Зачем использовать расширение Корниш-Фишер вместо выборочного квантиля?
Расширение Корниш-Фишер позволяет оценивать квантили распределения по моментам. (В этом смысле я рассматриваю его как дополнение к расширению Эджворта , которое дает оценку кумулятивного распределения на основе моментов.) Я хотел бы знать, в каких ситуациях предпочтение будет отдано расширению Корниш-Фишера для эмпирической работы над выборочный квантиль или наоборот. Несколько догадок: …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.