Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


2
Сравнение кластеров: индекс Рэнда и вариация информации
Мне было интересно, есть ли у кого-нибудь понимание или интуиция, стоящие за разницей между вариацией информации и индексом Рэнда для сравнения кластеризаций. Я прочитал статью Марины Мелии « Сравнение кластеризаций - расстояние, основанное на информации » (Журнал многомерного анализа, 2007), но, кроме того, что я заметил разницу в определениях, я …

1
Почему Левен проверяет равенство дисперсий, а не отношение F?
SPSS использует тест Левена для оценки однородности отклонений в процедуре независимого группового t-теста. Почему тест Левена лучше, чем простое отношение F отношения дисперсий двух групп?

2
Когда ковариация расстояния менее подходит, чем линейная ковариация?
Я только что познакомился (смутно) с броуновской / дистанционной ковариацией / корреляцией . Это кажется особенно полезным во многих нелинейных ситуациях при тестировании на зависимость. Но это, кажется, не используется очень часто, хотя ковариация / корреляция часто используются для нелинейных / хаотических данных. Это заставляет меня думать, что у ковариации …

5
Современные нейронные сети, которые строят свою собственную топологию
Ограничение стандартных алгоритмов нейронной сети (например, backprop) заключается в том, что вам необходимо принять решение о том, сколько скрытых слоев и нейронов на слой вы хотите. Как правило, скорость обучения и обобщения очень чувствительны к этому выбору. Это было причиной, почему алгоритмы нейронной сети, такие как каскадная корреляция , вызывают …

5
Как правильно проверить значимость результатов классификации
Есть много ситуаций, когда вы можете обучить несколько разных классификаторов или использовать несколько разных методов извлечения признаков. В литературе авторы часто приводят среднюю ошибку классификации по набору случайных разбиений данных (т. Е. После дважды вложенной перекрестной проверки), а иногда также дают отклонения по ошибке по разбиениям. Однако одного этого недостаточно, …

6
Примеры скрытых проблем моделей Маркова?
Я прочитал довольно много скрытых марковских моделей и смог сам написать довольно простую версию. Но есть два основных способа, которыми я, кажется, учусь. Один из них - прочитать и внедрить его в код (что и делается), а второй - понять, как он применяется в различных ситуациях (чтобы я мог лучше …

3
Как рассчитать предел погрешности в результатах NPS (Net Promoter Score)?
Я позволю Википедии объяснить, как рассчитывается NPS : Чистый балл промоутера получают, задавая клиентам один вопрос по шкале от 0 до 10, где 10 - «крайне вероятно», а 0 - «совсем не вероятно»: «Насколько вероятно, что вы порекомендуете нашу компанию друг или коллега? Основываясь на своих ответах, клиенты делятся на …

4
Что означает «беспристрастность»?
Что значит сказать, что «дисперсия является необъективной оценкой». Что означает преобразование смещенной оценки в несмещенную оценку с помощью простой формулы. Что именно делает это преобразование? Кроме того, какова практическая польза от этого преобразования? Вы конвертируете эти баллы при использовании определенного вида статистики?

3
Расхождение с регрессом ANOVA (aov против lm в R)
У меня всегда было впечатление, что регрессия - это просто более общая форма ANOVA и результаты будут идентичны. Однако недавно я провел и регрессию, и ANOVA для одних и тех же данных, и результаты значительно различаются. То есть в регрессионной модели значимы как основные эффекты, так и взаимодействие, в то …
21 r  regression  anova 

3
Почему мы должны заботиться о быстром смешивании в цепочках MCMC?
При работе с цепью Маркова Монте-Карло, чтобы сделать вывод, нам нужна цепь, которая быстро перемешивается, т.е. быстро перемещается через опору заднего распределения. Но я не понимаю, зачем нам это свойство, потому что из того, что я понимаю, принятые кандидаты должны и будут сконцентрированы в части высокой плотности заднего распределения. Если …
21 mcmc 

1
Как я могу предсказать значения из новых входных данных линейной модели в R?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я создал линейную модель в R: mod = lm(train_y ~ train_x). Я хочу передать ему список X и получить его предсказанный / …

1
Эффективный расчет обратной матрицы в R
Мне нужно рассчитать обратную матрицу и использовать solveфункцию. Хотя он хорошо работает на маленьких матрицах, он solveимеет тенденцию быть очень медленным на больших матрицах. Мне было интересно, есть ли какая-либо другая функция или комбинация функций (через SVD, QR, LU или другие функции разложения), которые могут дать мне более быстрые результаты.

5
Пример сильного коэффициента корреляции с высоким значением p
Мне было интересно, возможно ли иметь очень сильный коэффициент корреляции (скажем, 0,9 или выше), с высоким значением р (скажем, 0,25 или выше)? Вот пример низкого коэффициента корреляции с высоким значением p: set.seed(10) y <- rnorm(100) x <- rnorm(100)+.1*y cor.test(x,y) кор = 0,03908927, р = 0,6994 Высокий коэффициент корреляции, низкое значение …

4
Что такое проклятие размерности?
В частности, я ищу ссылки (документы, книги), которые будут строго показывать и объяснять проклятие размерности. Этот вопрос возник после того, как я начал читать эту белую бумагу по Лафферти и Вассермана. В третьем абзаце упоминается «хорошо известное» уравнение, из которого следует, что наилучшая скорость сходимости равна n−4/(4−d)n−4/(4−d)n^{-4/(4-d)} ; если кто-то …
21 theory 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.