Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Означает ли среднее значение = медиана, что унимодальное распределение симметрично?
Для унимодального распределения, если среднее = медиана, тогда достаточно ли сказать, что распределение симметрично? Википедия говорит об отношениях между средним и средним: «Если распределение симметрично, то среднее значение равно медиане, а распределение будет иметь нулевую асимметрию. Если, кроме того, распределение является унимодальным, то среднее = медиана = мода. Это случай …

4
Какие именно моменты? Как они получены?
Мы, как правило, знакомимся с методом оценки моментов, «приравнивая моменты совокупности к их выборочному аналогу», пока не оценим все параметры совокупности; так что в случае нормального распределения нам понадобятся только первый и второй моменты, потому что они полностью описывают это распределение. E(X)=μ⟹∑Nя = 1Xя/ n=X¯E(Икс)знак равноμ⟹Σязнак равно1NИкся/Nзнак равноИкс¯E(X) = \mu …

2
Расчет стандартной ошибки после лог-преобразования
Рассмотрим случайный набор чисел, которые обычно распределяются: x <- rnorm(n=1000, mean=10) Нам бы хотелось знать среднее и стандартную ошибку на среднем, поэтому мы делаем следующее: se <- function(x) { sd(x)/sqrt(length(x)) } mean(x) # something near 10.0 units se(x) # something near 0.03 units Большой! Однако, давайте предположим, что мы не …

2
Как интерпретировать PCA на данных временных рядов?
Я пытаюсь понять использование PCA в недавней статье в журнале под названием «Отображение мозговой активности в масштабе с помощью кластерных вычислений» Freeman et al., 2014 (бесплатный pdf доступен на веб-сайте лаборатории ). Они используют PCA для данных временных рядов и используют веса PCA для создания карты мозга. Данные являются данными …

2
Что означает название «логистическая регрессия»?
Я проверяю реализацию логистической регрессии отсюда . После прочтения этой статьи кажется важной частью является поиск наилучших коэффициентов для определения сигмовидной функции. Поэтому мне просто интересно, почему этот метод называется «Логистическая регрессия». Это связано с логарифмической функцией? Может быть, мне нужна историческая справочная информация, чтобы понять это лучше.


2
Обобщенные аддитивные модели - кто исследует их, кроме Саймона Вуда?
Я использую ГАМ все больше и больше. Когда я иду, чтобы дать ссылки на их различные компоненты (выбор параметров сглаживания, различные основы сплайнов, p-значения сглаженных терминов), они все от одного исследователя - Саймона Вуда из Университета Бата в Англии. Он также является сопровождающим mgcvв R, который выполняет свою работу. mgcvэто …

4
Может ли среднее значение плюс одно стандартное отклонение превышать максимальное значение?
Я имею среднее значение 74,10 и стандартное отклонение 33,44 для выборки с минимальным 0 и максимальным 94,33. Мой профессор спрашивает меня, как может означать, что плюс одно стандартное отклонение превышает максимум. Я показал ей много примеров по этому поводу, но она не понимает. Мне нужна ссылка, чтобы показать ей. Это …

1
Как я могу уклониться от позиции geom_point в ggplot2?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я использую ggplot2 в R для создания графиков, подобных следующим: Панели ошибок перекрываются друг с другом, которые выглядят очень грязно. Как я …

2
Как применить теорему Байеса к поиску потерянного в море рыбака
В статье «Постоянно обновляемые шансы» упоминается история рыбака из Лонг-Айленда, который буквально обязан своей жизнью Байесовской статистике. Вот короткая версия: Посреди ночи на лодке два рыбака. Пока один спит, другой падает в океан. Лодка продолжает троллить на автопилоте всю ночь, пока первый парень, наконец, не проснется и не оповестит береговую …

1
Нормализация данных до того, как PCA дает лучший объясненный коэффициент дисперсии
Я нормализовал свой набор данных, а затем провел трехкомпонентный PCA, чтобы получить малые объясненные коэффициенты дисперсии ([0,50, 0,1, 0,05]). Когда я не нормализовал, а отбелил набор данных, а затем провел трехкомпонентную PCA, я получил высокие объясненные коэффициенты дисперсии ([0,86, 0,06,0,01]). Поскольку я хочу сохранить как можно больше данных в 3 …
19 pca 

2
PCA и исследовательский факторный анализ по одному и тому же набору данных: различия и сходства; фактор-модель против PCA
Я хотел бы знать, имеет ли какой-либо логический смысл проводить анализ основных компонентов (PCA) и анализ факторных факторов (EFA) на одном и том же наборе данных. Я слышал, профессионалы прямо рекомендуют: Понять, какова цель анализа, и выбрать PCA или EFA для анализа данных; Сделав один анализ, нет необходимости делать другой …

4
Необходим хороший пример данных с ковариатами, на которые влияют обработки
Я рассмотрел множество наборов данных R, публикаций в DASL и других местах и ​​не нахожу очень много хороших примеров интересных наборов данных, иллюстрирующих анализ ковариации для экспериментальных данных. В статистических учебниках есть множество «игрушечных» наборов данных с надуманными данными. Я хотел бы иметь пример, где: Данные реальные, с интересной историей …

1
Вычислить и наметить границу решения LDA
Я видел сюжет LDA (линейный дискриминантный анализ) с границами решения из «Элемента статистического обучения» : Я понимаю, что данные проецируются на низкоразмерное подпространство. Тем не менее, я хотел бы знать, как мы получаем границы решений в исходном измерении, чтобы я мог проецировать границы решений на подпространство более низкого измерения (как …

2
Построение дискретного р.в., имеющего в качестве опоры все рациональные числа в
Это конструктивистское продолжение этого вопроса . Если мы не можем иметь дискретную равномерную случайную переменную, имеющую в качестве поддержки все рациональные числа в интервале [0,1][0,1][0,1] , то следующая лучшая вещь: Построим случайную величину QQQ которая имеет эту опору, Q∈Q∩[0,1]Q∈Q∩[0,1]Q\in \mathbb{Q}\cap[0,1] и которая следует некоторому распределению. И мастер во мне требует, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.