Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Предположения обобщенной линейной модели
Я сделал обобщенную линейную модель с одной переменной ответа (непрерывной / нормально распределенной) и 4 пояснительными переменными (3 из которых являются факторами, а четвертая - целым числом). Я использовал распределение ошибок по Гауссу с функцией тождественной связи. В настоящее время я проверяю, что модель удовлетворяет предположениям обобщенной линейной модели, а …

3
Статистическая мера, если изображение состоит из пространственно связанных отдельных областей
Рассмотрим эти два изображения в градациях серого: На первом изображении показан извилистый речной узор. Второе изображение показывает случайный шум. Я ищу статистическую меру, которую я могу использовать для определения вероятности того, что изображение показывает речную картину. Изображение реки имеет две области: река = высокое значение и везде другое = низкое …

2
Объясняя квантильную регрессию нестатистам
Недавно я представил статью, в которой использовал квантильную регрессию, в психологический журнал. Хотя я и думал, что уже достаточно размышлял над четким изложением квантильной регрессии, рецензенты попросили более подробных объяснений техники квантильной регрессии, поскольку знакомы только со стандартной регрессией МНК. Итак, как лучше всего объяснить квантильную регрессию в эмпирической статье …

1
Линейное моделирование смешанных эффектов с данными двойниковых исследований
Предположим, у меня есть некоторая переменная ответа которая была измерена от го брата в м семействе. Кроме того, некоторые поведенческие данные были собраны в то же время от каждого субъекта. Я пытаюсь проанализировать ситуацию с помощью следующей линейной модели смешанных эффектов: j i x i jyijyijy_{ij}jjjiiixijxijx_{ij} yij=α0+α1xij+δ1ixij+εijyij=α0+α1xij+δ1ixij+εijy_{ij} = \alpha_0 + …

1
Что означают стрелки в биплоте PCA?
Рассмотрим следующий биплот PCA: library(mvtnorm) set.seed(1) x <- rmvnorm(2000, rep(0, 6), diag(c(5, rep(1,5)))) x <- scale(x, center=T, scale=F) pc <- princomp(x) biplot(pc) Есть куча красных стрелок, что они означают? Я знал, что первая стрелка, помеченная «Var1», должна указывать самое изменяющееся направление набора данных (если мы считаем их 2000 точками данных, …
14 r  pca  linear-algebra  biplot 

4
Что такое случайность?
В вероятности и статистике часто используются понятия «случайность» и «случайность». Часто понятие случайной величины используется для моделирования событий, которые происходят случайно. Мой вопрос касается термина «случайный». Что случайное? Действительно ли случайность существует? Мне любопытно, что люди, которые имеют большой опыт работы со случайными событиями, думают и верят в случайность.

4
Проверка значимости улучшения точности
Предположим, у меня есть алгоритм, который классифицирует вещи на две категории. Я могу измерить точность алгоритма, скажем, на 1000 тестовых вещей - предположим, 80% вещей классифицированы правильно. Предположим, что я каким-то образом модифицирую алгоритм, чтобы 81% вещей были классифицированы правильно. Может ли статистика сказать мне что-нибудь о том, является ли …

2
Градиентный спуск против функции lm () в R?
Я просматриваю видео в бесплатном онлайн-курсе Эндрю Нг по машинному обучению в Стэнфорде. Он рассматривает Gradient Descent как алгоритм для решения функций линейной регрессии и записи в Octave для его выполнения. Предположительно я мог бы переписать эти функции в R, но мой вопрос в том, разве функция lm () уже …

9
Ссылка с распределениями с различными свойствами
Я часто задаю себе вопросы типа: «Я знаю, что эта переменная лежит в ( 0 , 1 ), и большая часть массы лежит в а затем непрерывно уменьшается к 1. Какое распределение я могу использовать для ее моделирования? "xxx(0,1)(0,1)(0,1)(0,.20)(0,.20)(0,.20) На практике я снова и снова использую одни и те же …

3
Центральная предельная теорема против закона больших чисел
Центральная предельная теорема утверждает, что среднее значение iid-переменных, когда переходит в бесконечность, становится нормально распределенным.NNN Это поднимает два вопроса: Можем ли мы вывести из этого закон больших чисел? Если закон больших чисел гласит, что среднее значение выборки значений случайной величины равно истинному среднему значению при переходе в бесконечность, то, кажется, …

4
Оценка точки разрыва в ломаной / кусочно-линейной модели со случайными эффектами в R [код и выходные данные включены]
Может кто-нибудь сказать мне, как заставить R оценить точку разрыва в кусочно-линейной модели (как фиксированный или случайный параметр), когда мне также нужно оценить другие случайные эффекты? Ниже я привел пример с игрушкой, который соответствует регрессии хоккейной клюшки / сломанной палки со случайными отклонениями наклона и случайной дисперсией y-точки пересечения для …

8
Как сделать кусочно-линейную регрессию с несколькими неизвестными узлами?
Есть ли пакеты для кусочно-линейной регрессии, которые могут автоматически определять несколько узлов? Благодарю. Когда я использую пакет Strucchange. Я не мог обнаружить точки изменения. Я понятия не имею, как он обнаруживает точки изменения. Из графиков я мог видеть, что есть несколько моментов, которые могут помочь мне выбрать их. Может ли …

4
Как начать читать о майнинге данных?
Я новичок, который собирается начать читать о интеллектуальном анализе данных. У меня есть базовые знания по ИИ и статистике. Поскольку многие говорят, что машинное обучение также играет важную роль в интеллектуальном анализе данных, нужно ли читать о машинном обучении, прежде чем я смогу продолжить изучение данных?

4
Реализация k-средних с пользовательской матрицей расстояний на входе
Может кто-нибудь указать мне реализацию k-средних (было бы лучше, если бы в Matlab), который может принимать матрицу расстояний на входе? Для стандартной реализации Matlab требуется матрица наблюдения на входе, и пользовательское изменение меры подобия невозможно.

3
Как рассчитать вероятность, связанную с нелепо большими Z-показателями?
Пакеты программ для обнаружения сетевых мотивов могут возвращать чрезвычайно высокие Z-оценки (самый высокий показатель, который я видел, составляет 600 000+, но Z-оценки более 100 встречаются довольно часто). Я планирую показать, что эти Z-оценки являются поддельными. Огромные Z-оценки соответствуют чрезвычайно низким вероятностям. Значения связанных вероятностей приведены, например, на странице википедии нормального …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.