Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Проблемы с фиктивными переменными
Я запускаю большую регрессию OLS, где все независимые переменные (около 400) являются фиктивными переменными. Если все они включены, то существует идеальная мультиколлинеарность (фиктивная переменная ловушка), поэтому я должен опустить одну из переменных перед запуском регрессии. Мой первый вопрос: какая переменная должна быть опущена? Я читал, что лучше опустить переменную, которая …

4
Как получить значения, используемые в plot.gam в mgcv?
Я хотел бы узнать значения, (x, y)используемые при построении графиков plot(b, seWithMean=TRUE)в пакете mgcv . Кто-нибудь знает, как я могу извлечь или вычислить эти значения? Вот пример: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)

2
Как сделать репрезентативную выборку из большого общего набора данных?
Каковы статистические методы для создания выборочного набора, который является репрезентативным для всего населения (с известным уровнем достоверности)? Также, Как проверить, соответствует ли образец общему набору данных? Возможно ли это без разбора всего набора данных (который может быть миллиардами записей)?

6
Нахождение точки изменения в данных из кусочно-линейной функции
Приветствую, Я провожу исследование, которое поможет определить размер наблюдаемого пространства и время, прошедшее с момента Большого взрыва. Надеюсь, вы можете помочь! У меня есть данные, соответствующие кусочно-линейной функции, для которой я хочу выполнить две линейные регрессии. Есть момент, когда наклон и точка пересечения меняются, и мне нужно (написать программу) найти …

1
Как бороться с опросным вопросом с множественным ответом?
У меня есть набор данных, спрашивающий людей, были ли они в определенных местах (например, A, B, C, D), и они могут сделать больше чем один выбор, затем образец взят из их носа, чтобы видеть, заражены ли они некоторыми болезнь. Мне нужно выяснить относительный риск заражения при посещении определенного места, сейчас …
10 logistic 

4
Учитывая цепочку 10D MCMC, как я могу определить ее апостериорные моды в R?
Вопрос: С 10-мерной цепочкой MCMC, скажем, я готов передать вам матрицу розыгрышей: 100 000 итераций (строк) по 10 параметрам (столбцам), как лучше всего определить апостериорные моды? Я особенно обеспокоен несколькими режимами. Фон:Я считаю себя статистически подкованным статистиком, но когда коллега задал мне этот вопрос, мне стало стыдно, что я не …

5
Омега в квадрате для измерения эффекта в R?
Книга статистики, которую я читаю, рекомендует омега в квадрате, чтобы измерить результаты моих экспериментов. Я уже доказал, используя сплит-дизайн (сочетание внутри-предметов и между-предметов), что мои внутри-предметы факторы статистически значимы с р <0,001 и F = 17. Теперь я смотрю, насколько велика разница ... есть ли где-нибудь реализация омега-квадрата для R …

1
Вывод логистической модели в R
Я пытаюсь интерпретировать следующий тип логистической модели: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) Является ли вывод predict(mdl)ожидаемых шансов на успех для каждой точки данных? Есть ли простой способ табулировать шансы для каждого факторного уровня модели, а не для всех точек данных?

3
Для задачи классификации, если переменная класса имеет неравномерное распределение, какой метод мы должны использовать?
например если у меня есть переменная кредитного скоринга класса с двумя классами хороший и плохой, где # (хорошо) = 700 и # (плохо) = 300. Я не хочу сокращать свои данные. какую технику я должен использовать? Я использовал SVM, но он дает плохие прогнозы.


1
Какой тип нормализации данных следует использовать с KNN?
Я знаю, что существует более двух типов нормализации. Например, 1- Преобразование данных с использованием z-показателя или t-показателя. Это обычно называется стандартизацией. 2- Изменение масштаба данных для получения значений от 0 до 1. Теперь вопрос, нужно ли мне нормализовать Какой тип нормализации данных следует использовать с KNN? и почему?


4
Какие из следующих курсов статистики являются наиболее применимыми и полезными в финансовой / технической индустрии? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 3 года назад . Я нахожусь в процессе выбора 3 классов статистики для моего кластера курсов прикладной …

2
Генерация случайных величин, удовлетворяющих ограничениям
Мне нужно сгенерировать список случайных величин учетом ограничений, которые можно выразить в виде где - это матрица если имеет записей. Во всех случаях, с которыми я имею дело, , например будет около 14 000, а будет 50. Я не уверен, какой метод я буду использовать для случайной выборки, будь то …

3
Как создать диаграмму гистограммы, где столбцы расположены рядом в R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я хочу создать bardiagram для этих данных в R (читать из файла CVS): Эксперимент_Имя метрикиА МетрикаБ Just_X 2 10 Just_X_and_Y 3 20 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.