Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Продольное сравнение двух распределений
У меня есть результаты анализов крови 2500 человек четыре раза с шестимесячным интервалом. Результаты в основном состоят из двух показателей иммунного ответа - один в присутствии определенных антигенов туберкулеза, один в отсутствие. В настоящее время каждый тест оценивается как положительный или отрицательный, основываясь на разнице между ответом антигена и ответом …

4
Количественная оценка сюжета QQ
С помощью qq-plot можно визуализировать, насколько похожи два распределения (например, визуализировать сходство распределения с нормальным распределением, а также сравнить два распределения произвольных данных). Существуют ли какие-либо статистические данные, которые генерируют более объективную числовую меру, отражающую их сходство (предпочтительно в нормализованной (0 <= x <= 1) форме)? Коэффициент Джини, например, используется …


2
Пропускная способность ядра в оценке плотности ядра
Я делаю некоторую оценку плотности ядра с установленными весовыми точками (т. Е. Каждый образец имеет вес, который не является необходимым) в N измерениях. Кроме того, эти образцы находятся только в метрическом пространстве (то есть мы можем определить расстояние между ними), но не более того. Например, мы не можем определить среднее …

4
Как искать долины на графике?
Я изучаю некоторые данные о геномном покрытии, которые в основном представляют собой длинный список (несколько миллионов значений) целых чисел, каждый из которых говорит о том, насколько хорошо (или «глубоко») охвачена эта позиция в геноме. Я хотел бы найти «долины» в этих данных, то есть регионы, которые значительно «ниже», чем их …


4
Асимптотическое распределение полинома
Я ищу предельное распределение полиномиального распределения по результатам d. IE, распределение следующее Итn → ∞N- 12ИксNlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Где ИксNXn\mathbf{X_n} - случайная величина векторного значения с плотностью еN( х )fn(x)f_n(\mathbf{x}) для Иксx\mathbf{x} такой, что ΣяИкся= п∑ixi=n\sum_i x_i=n , Икся∈ Z , xя≥ 0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0 и 0 для …

1
Какой тип анализа остатков после подгонки вы используете?
При проведении множественной линейной регрессии OLS, вместо того, чтобы вычерчивать невязки относительно подгоночных значений, я строю (внутренние) вычеркнутые невязки против подгоночных значений (то же самое для ковариат). Эти остатки определены как: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} где - остаток, а - диагональные элементы шляпной матрицы. Чтобы получить эти изученные …

11
Революции в статистике за последние 50 лет? [закрыто]
В настоящее время этот вопрос не очень подходит для нашего формата вопросов и ответов. Мы ожидаем, что ответы будут подтверждены фактами, ссылками или опытом, но этот вопрос, скорее всего, вызовет дебаты, споры, опрос или расширенное обсуждение. Если вы считаете, что этот вопрос можно улучшить и, возможно, вновь открыть, обратитесь за …
10 history 

2
Можно ли напрямую читать столбцы CSV как категориальные данные?
Мне нужно проанализировать с помощью R данные медицинского обследования (с более 100 кодированными столбцами), которое приходит в CSV. Я буду использовать погремушку для некоторого начального анализа, но за кадром это все еще R. Если я читаю файл .csv () , столбцы с числовыми кодами рассматриваются как числовые данные. Я знаю, …

5
Какие другие нормализующие преобразования обычно используются помимо общих, таких как квадратный корень, лог и т. Д.?
При анализе результатов тестов (например, в области образования или психологии) общие методы анализа часто предполагают, что данные обычно распределяются. Однако, возможно, чаще, чем нет, баллы имеют тенденцию иногда сильно отличаться от нормальных. Я знаком с некоторыми основными нормализующими преобразованиями, такими как: квадратные корни, логарифмы, обратные преобразования для уменьшения положительного перекоса, …


2
Получение и интерпретация загруженных доверительных интервалов из иерархических данных
Я заинтересован в получении начального доверительного интервала для количества X, когда это количество измеряется 10 раз в каждом из 10 человек. Один из подходов состоит в том, чтобы получить среднее значение для отдельного человека, а затем загрузить средства (например, пересчитать средства с заменой). Другой подход заключается в том, чтобы выполнить …

1
Оценка изменчивости во времени
У меня есть набор данных, который содержит ~ 7500 анализов крови от ~ 2500 человек. Я пытаюсь выяснить, увеличивается ли вариабельность анализов крови с течением времени между двумя тестами. Например - я беру вашу кровь для базового теста, а затем сразу же беру второй образец. Через полгода я нарисую еще …

2
В чем разница между функциональным анализом данных и анализом многомерных данных
В статистической литературе имеется много ссылок на « функциональные данные » (то есть данные, которые являются кривыми), и параллельно, на « высокоразмерные данные » (то есть, когда данные являются векторами с высокой размерностью). Мой вопрос о разнице между этими двумя типами данных. Говоря о прикладных статистических методологиях, которые применяются в …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.