Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Последовательность Халтона против последовательности Соболя?
Из ответа на предыдущий вопрос я был направлен на последовательность Халтона для создания набора векторов, которые покрывали равномерное пространство выборки довольно равномерно. Но страница в Википедии упоминает, что более высокие простые числа часто очень сильно коррелируют в начале ряда. Это, кажется, имеет место для любой пары старших чисел с относительно …

2
Почему производные функции используются в нейронных сетях?
Например, кто-то хочет предсказать цены на жилье и имеет две входные характеристики: длину и ширину дома. Иногда, один также включает в себя «производные» полиномиальные входные объекты, такие как площадь, которая является длиной * шириной. 1) Какой смысл включать производные функции? Разве нейронная сеть не должна изучать связь между длиной, шириной …

1
Как Kinect использует случайные леса?
Я читал на этом сайте, что, по-видимому, Kinect каким-то образом использует алгоритм случайных лесов для машинного обучения. Кто-нибудь может объяснить, для чего он использует случайные леса и как работает их подход?

2
Квантильный регрессионный прогноз
Я заинтересован в использовании квантильной регрессии для некоторых из моих моделей, но хотел бы получить некоторые разъяснения о том, что я могу достичь с помощью этой методологии. Я понимаю , что я могу получить более надежный анализ IV / DV отношений , особенно когда сталкивается с выбросами и гетероскедастичностью, но …

5
Почему утверждается, что выборка часто является более точной, чем перепись?
Изучая курс выборки, я встречаю следующие два утверждения: 1) Ошибка выборки приводит к большей изменчивости, ошибки выборки приводят к смещению. 2) Из-за ошибки несэмплирования выборка часто является более точной, чем CENSUS. Я не знаю, как понять эти два утверждения. Какова основная логика для получения этих двух утверждений?


4
Сидак или Бонферрони?
Я использую обобщенную линейную модель в SPSS, чтобы посмотреть на различия в среднем количестве гусениц (ненормальное, используя распределение Твиди) на 16 различных видах растений. Я хочу провести несколько сравнений, но я не уверен, стоит ли мне использовать коррекционный тест Сидака или Бонферрони. В чем разница между двумя тестами? Один лучше …

1
Как рассчитать доверительный интервал для ранговой корреляции Спирмена?
В Википедии есть преобразование Фишера от ранга Спирмена до приблизительного z-показателя. Возможно, эта z-оценка отличается от нулевой гипотезы (ранг корреляции 0)? Эта страница имеет следующий пример: 4, 10, 3, 1, 9, 2, 6, 7, 8, 5 5, 8, 6, 2, 10, 3, 9, 4, 7, 1 rank correlation 0.684848 "95% …

5
lme4 или другой код пакета с открытым исходным кодом R, эквивалентный asreml-R
Я хочу приспособить смешанную модель, используя lme4, nlme, пакет байсовой регрессии или любой доступный. Смешанная модель в соглашениях о кодировании Asreml-R прежде чем углубляться в детали, мы можем захотеть узнать подробности о соглашениях asreml-R для тех, кто не знаком с кодами ASREML. y = Xτ + Zu + e ........................(1) …
13 r 

3
Как проверить, изменилась ли ковариационная матрица за два момента времени?
Моя задача - проверить, есть ли изменение ковариационной матрицы из 6 переменных. Значения 6 переменных измеряются дважды от одного и того же субъекта (3 года между измерениями). Как я могу это сделать? Я делал большую часть своей работы, используя SAS.

1
Квантили из комбинации нормальных распределений
У меня есть информация о распределении антропометрических размеров (таких как размах плеч) для детей разных возрастов. Для каждого возраста и измерения у меня есть среднее стандартное отклонение. (У меня также есть восемь квантилей, но я не думаю, что смогу получить от них то, что хочу.) Для каждого измерения я хотел …

6
Пакет R для определения отношений между переменными [закрыт]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 4 года назад . Есть ли пакет R, который я могу использовать, чтобы выяснить, существуют ли отношения между переменными? Обычно, когда я ищу …

2
Работа с мультиколлинеарностью
Я узнал, что, используя vif()метод carупаковки, мы можем вычислить степень мультиколлинеарности входных данных в модели. Из википедии , если vifзначение больше, чем 5тогда, мы можем считать, что вход страдает от проблемы мультиколлинеарности. Например, я разработал модель линейной регрессии с использованием lm()метода и vif()дает следующее. Как мы можем видеть, входы ub, …

3
Кластеризация вероятностных распределений - методы и метрики?
У меня есть несколько точек данных, каждая из которых содержит 5 векторов агломерированных дискретных результатов, результаты каждого вектора, сгенерированные различным распределением (конкретный вид, в котором я не уверен, мое лучшее предположение - Вейбулл, с параметром формы, изменяющимся где-то в пределах экспоненциальной степени) закон (от 1 до 0, примерно).) Я собираюсь …

1
PCA и оценки компонентов, основанные на сочетании непрерывных и двоичных переменных
Я хочу применить PCA к набору данных, который состоит из переменных смешанного типа (непрерывных и двоичных). Чтобы проиллюстрировать процедуру, я вставил минимальный воспроизводимый пример в R ниже. # Generate synthetic dataset set.seed(12345) n <- 100 x1 <- rnorm(n) x2 <- runif(n, -2, 2) x3 <- x1 + x2 + rnorm(n) …
13 r  pca 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.