Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Бонферрони или Тьюки? Когда количество сравнений становится большим?
Чтение в поле Обнаружение статистики с использованием SPSS (3-е издание) Я был немного поражен специальными тестами в ANOVA. Для тех, кто хочет контролировать частоту ошибок типа I, он предлагает Бонферрони или Тьюки и говорит (стр. 374): Бонферрони обладает большей силой, когда количество сравнений невелико, тогда как Тьюки более мощен при …

8
Совместные пакеты для R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Не могли бы вы порекомендовать простой в использовании или комплексный пакет совместного анализа для R?

3
Ресурсы для пользователя R, который должен изучить SAS
Я использую R. Каждый день. Я думаю, с точки зрения data.frames, семейства функций apply (), объектно-ориентированного программирования, векторизации и геометрии / эстетики ggplot2. Я только начал работать в организации, которая в основном использует SAS. Я знаю, что есть книга об изучении R для пользователей SAS , но каковы хорошие ресурсы …
18 r  sas 

4
Изменение нулевой гипотезы в линейной регрессии
У меня есть некоторые данные, которые сильно коррелируют. Если я запускаю линейную регрессию, я получаю линию регрессии с наклоном, близким к единице (= 0,93). Что я хотел бы сделать, это проверить, значительно ли отличается этот уклон от 1,0. Я ожидаю, что это не так. Другими словами, я хотел бы изменить …

2
Руководство по обеспечению качества и контролю качества (QA / QC) для базы данных
Фон Я наблюдаю за вводом данных из первичной литературы в базу данных . Процесс ввода данных подвержен ошибкам, особенно потому, что пользователи должны интерпретировать экспериментальный дизайн, извлекать данные из графиков и таблиц и преобразовывать результаты в стандартизированные единицы. Данные вводятся в базу данных MySQL через веб-интерфейс. Более 10 000 точек …

3
Получение формулы для пределов прогнозирования в линейной модели (т. Е. Интервалы прогнозирования)
Давайте возьмем следующий пример: set.seed(342) x1 <- runif(100) x2 <- runif(100) y <- x1+x2 + 2*x1*x2 + rnorm(100) fit <- lm(y~x1*x2) Это создает модель y на основе x1 и x2, используя регрессию OLS. Если мы хотим предсказать y для данного x_vec, мы можем просто использовать формулу, которую мы получаем из …

3
Подводные камни линейных смешанных моделей
Каковы основные ловушки использования линейных моделей со смешанными эффектами? Каковы наиболее важные вещи, которые нужно проверить / остерегаться при оценке соответствия вашей модели? При сравнении моделей одного и того же набора данных, что наиболее важно искать?

5
У этой величины, связанной с независимостью, есть имя?
Очевидно, события A и B независимы, если Pr = Pr Pr . Давайте определим связанное количество Q:( A ) ( B )(A∩B)(A∩B)(A\cap B)(A)(A)(A)(B)(B)(B) Q≡Pr(A∩B)Pr(A)Pr(B)Q≡Pr(A∩B)Pr(A)Pr(B)Q\equiv\frac{\mathrm{Pr}(A\cap B)}{\mathrm{Pr}(A)\mathrm{Pr}(B)} Таким образом, A и B независимы тогда и только тогда, когда Q = 1 (при условии, что знаменатель ненулевой). У Q есть имя? Я чувствую, …

4
Могу ли я просто удалить одну из двух переменных-предикторов, которые имеют высокую линейную корреляцию?
Используя коэффициент корреляции Пирсона, у меня есть несколько переменных, которые сильно коррелированы ( и для 2 пар переменных, которые есть в моей модели).ρ = 0,978ρзнак равно0,978\rho = 0.978ρ = 0,989ρзнак равно0,989\rho = 0.989 Причина , некоторые из переменных имеют высокую корреляцию потому , что одна переменная используется в вычислении для …

4
Удаление границ на графиках R для достижения оси Tufte
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Рассмотрим следующий график: x <- 1:100 y1 <- rnorm(100) y2 <- rnorm(100)+100 par(mar=c(5,5,5,5)) plot(x,y1,pch=0,type="b",col="red",yaxt="n",ylim=c(-8,2),ylab="") axis(side=2, at=c(-2,0,2)) mtext("red line", side = 2, line=2.5, …

5
Основные статьи о матричных разложениях
Недавно я прочитал книгу Скилликорна о разложении матриц, и был немного разочарован, поскольку она была нацелена на студенческую аудиторию. Я хотел бы составить (для себя и других) краткую библиографию основных работ (обзоров, но также прорывных работ) по разложению матриц. Я имею в виду, прежде всего, что-то о SVD / PCA …

2
Как визуализировать трехмерную матрицу непредвиденных обстоятельств?
У меня есть такие данные: > table(A,B,C) , , C = FALSE B A FALSE TRUE FALSE 177 42 TRUE 6 8 , , C = TRUE B A FALSE TRUE FALSE 5 31 TRUE 4 10 Как я могу построить это на одном графике, возможно, без наложения какой-либо иерархии?


10
Наборы данных социальных сетей
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я ищу наборы данных социальных сетей (Twitter, FriendFeed, Facebook, LastFM и т. Д.) Для задач классификации, предпочтительно в формате ARFF. Мои поиски …

5
Использование lmer для прогноза
Здравствуйте, у меня есть две проблемы, которые звучат как естественные кандидаты для многоуровневых / смешанных моделей, которые я никогда не использовал. Более простой и тот, который я надеюсь попробовать в качестве введения, заключается в следующем: данные выглядят как множество строк в форме x y innergroup outergroup где x - числовой …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.