Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Является ли теория минимальной дисперсии объективной оценки переоценена в аспирантуре?
В последнее время я был очень смущен, когда дал ответ на вопрос о минимальной дисперсии несмещенных оценок для параметров равномерного распределения, что было совершенно неверным. К счастью, меня сразу же поправили кардинал и Генри, и Генри дал правильные ответы для ОП . Это заставило меня задуматься. Я изучил теорию лучших …

6
Опции анализа неосновных данных
Я профессионально использую SAS около 5 лет. Он установлен на моем ноутбуке, и мне часто приходится анализировать наборы данных с 1000-2000 переменных и сотнями тысяч наблюдений. Я искал альтернативы SAS, которые позволили бы мне проводить анализ наборов данных аналогичного размера. Мне любопытно, что другие люди используют для таких ситуаций, как …
18 r  sas  large-data 

3
Какова роль МДС в современной статистике?
Недавно я столкнулся с многомерным масштабированием. Я пытаюсь лучше понять этот инструмент и его роль в современной статистике. Итак, вот несколько руководящих вопросов: На какие вопросы он отвечает? Какие исследователи часто заинтересованы в его использовании? Существуют ли другие статистические методы, которые выполняют аналогичные функции? Какая теория развивается вокруг этого? Какое …

1
Модель выборки для краудсорсинга данных?
Я работаю над открытым приложением для обследования здоровья, которое планируется использовать в развивающихся странах. Основная идея заключается в том, что собеседования проводятся краудсорсингом - они проводятся неорганизованными добровольцами, которые отправляют формы данных собеседований, которые они проводили, используя свои мобильные устройства, и каждое обследование сопровождается GPS-данными места проведения опроса. Традиционные обследования, …
18 sampling 

2
Какое значение «
Какое значение приведено в сводке модели Кокша в R? Например,R2R2R^2 Rsquare= 0.186 (max possible= 0.991 ) Я по глупости включил его в рукопись в качестве значения и рецензент вскочил на него, сказав, что он не знал об аналоге статистики из классической линейной регрессии, разрабатываемой для модели Кокса, и, если она …

5
Какую сводную статистику использовать с категориальными или качественными переменными?
Просто чтобы уточнить, когда я имею в виду сводную статистику, я имею в виду среднее значение, диапазоны среднего квартиля, дисперсию, стандартное отклонение. Имеет ли смысл найти среднее значение, медиану, квартильный диапазон, дисперсию и стандартное отклонение при суммировании одномерного, категориального или качественного , с учетом как номинального, так и ординального случаев? …

1
Апостериорные тесты после Крускала-Уоллиса: тест Данна или Бонферрони с поправками Манна-Уитни?
У меня есть некоторая негауссовская распределенная переменная, и мне нужно проверить, есть ли существенные различия между значениями этой переменной в 5 разных группах. Я выполнил односторонний дисперсионный анализ Крускала-Уоллиса (который оказался значительным), и после этого мне пришлось проверить, какие группы значительно различались. Поскольку группы отсортированы (значения переменной в первой группе …

6
Почему статистика полезна, когда многие важные вещи - одноразовые?
Я не знаю, только ли это я, но я очень скептически отношусь к статистике в целом. Я могу понять это в играх в кости, в покер и т. Д. Очень маленькие, простые, в основном автономные повторяющиеся игры - это хорошо. Например, приземление монеты на своем краю достаточно мало, чтобы принять …

3
Сумма экспоненциальных случайных величин следует за гаммой, спутанной с параметрами
Я узнал, что сумма экспоненциальных случайных величин следует за гамма-распределением. Но везде, где я читаю, параметризация отличается. Например, Wiki описывает отношения, но не говорит, что на самом деле означают их параметры? Форма, масштаб, скорость, 1 / скорость? Экспоненциальное распределение: ~xxxexp(λ)exp(λ)exp(\lambda) f(x|λ)=λe−λxf(x|λ)=λe−λxf(x|\lambda )=\lambda {{e}^{-\lambda x}} E[x]=1/λE[x]=1/λE[x]=1/ \lambda var(x)=1/λ2var(x)=1/λ2var(x)=1/{{\lambda}^2} Распределение гаммы:Γ(shape=α,scale=β)Γ(shape=α,scale=β)\Gamma(\text{shape}=\alpha, \text{scale}=\beta) …

4
Если колеи плохие, почему в автомобилях есть колеи?
Похоже, что эксперты по визуализации данных обычно не одобряют калибровочные диаграммы (см. Здесь: что вы называете диаграммой, которая выглядит как половина круговой диаграммы со стрелкой, указывающей процент? ). Основная причина заключается в том, что на калибровочной диаграмме низкое отношение данных к чернилам. С тех пор, как я познакомился с этими …

2
Почему обработка естественного языка не входит в область машинного обучения? [закрыто]
В настоящее время этот вопрос не очень подходит для нашего формата вопросов и ответов. Мы ожидаем, что ответы будут подтверждены фактами, ссылками или опытом, но этот вопрос, скорее всего, вызовет дебаты, споры, опрос или расширенное обсуждение. Если вы считаете, что этот вопрос можно улучшить и, возможно, вновь открыть, обратитесь за …

2
Как я могу получить значительный общий ANOVA, но без значительных парных различий с процедурой Тьюки?
Я выступал с R ANOVA, и я получил значительные различия. Однако, проверяя, какие пары значительно отличались, используя процедуру Тьюки, я не получил ни одну из них. Как это может быть возможным? Вот код: fit5_snow<- lm(Response ~ Stimulus, data=audio_snow) anova(fit5_snow) > anova(fit5_snow) Analysis of Variance Table Response: Response Df Sum Sq …

2
Как линейный дискриминантный анализ уменьшает размеры?
Есть слова из «Элементы статистического обучения» на странице 91: K-центроиды в p-мерном входном пространстве охватывают самое большее K-1-мерное подпространство, и если p намного больше K, это приведет к значительному уменьшению размера. У меня есть два вопроса: Почему K-центроиды в p-мерном входном пространстве охватывают самое большее K-1-мерное подпространство? Как расположены центроиды …

2
Как рассчитать растерянность несогласных с латентным распределением Дирихле?
Я запутался в том, как рассчитать растерянность несдерживаемой пробы при выполнении скрытого распределения дирихле (LDA). Бумаги на эту тему очень легки, заставляя меня думать, что я упускаю что-то очевидное ... Недоумение считается хорошим показателем производительности для LDA. Идея состоит в том, что вы сохраняете выборку несогласных, обучаете свой LDA остальным …

4
Использование смещения в биномиальной модели для учета увеличения числа пациентов
Два связанных вопроса от меня. У меня есть фрейм данных, который содержит количество пациентов в одном столбце (от 10 до 17 пациентов) и 0 и 1, показывающие, произошел ли инцидент в тот день. Я использую биномиальную модель, чтобы регрессировать вероятность инцидента на количество пациентов. Тем не менее, я хотел бы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.