Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
R только альтернативы ошибок [закрыт]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 12 месяцев назад . Я слежу за курсом по байесовской статистике с использованием BUGS и R. Теперь я уже знаю BUGS, это здорово, …
13 r  bayesian  bugs 

2
Boxplot в отношении двух факторов, использующих ggplot2 в R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я очень плохо знаком с R и любыми пакетами в R. Я посмотрел документацию по ggplot2, но не смог найти это. Я …
13 r  boxplot  ggplot2 

4
Используется ли среднеквадратическая ошибка для оценки относительного превосходства одного оценщика над другим?
Предположим, у нас есть два оценщика и для некоторого параметра . Чтобы определить, какая оценка «лучше», мы смотрим на MSE (среднеквадратическая ошибка)? Другими словами, мы смотрим на где - это смещение оценки, а - дисперсия оценки? Какой MSE больше, тем хуже оценка?α 2 x M S E = β 2 …
13 estimation  mse 

4
Использование ANOVA на проценты?
У меня есть таблица с четырьмя группами (4 группы ИМТ) в качестве независимой переменной (фактора). У меня есть зависимая переменная «процент курящих матерей во время беременности». Допустимо ли для этого использовать ANOVA или мне нужно использовать хи-квадрат или какой-то другой тест?
13 anova 

1
Оптимальный алгоритм решения n-вооруженных бандитских задач?
Я читал о ряде алгоритмов для решения проблем с n-вооруженными бандитами, таких как -greedy, softmax и UCB1, но у меня возникли некоторые проблемы при выборе лучшего подхода для минимизации сожалений.εε\epsilon Существует ли известный оптимальный алгоритм для решения проблемы вооруженного бандита? Есть ли выбор алгоритма, который, кажется, работает лучше всего на …

6
Эндогенность и ненаблюдаемая гетерогенность
В чем разница между эндогенностью и ненаблюдаемой гетерогенностью? Я знаю, что эндогенность происходит, например, из пропущенных переменных? Но, насколько я понимаю, ненаблюдаемая неоднородность вызывает ту же проблему. Но где именно лежит разница между этими двумя понятиями?

2
Осложнения наличия очень маленькой выборки в модели структурного уравнения
Я использую модель структурного уравнения (SEM) в Amos 18. Я искал 100 участников для моего эксперимента (использовался свободно), которого, вероятно, было недостаточно для успешного проведения SEM. Мне неоднократно говорили, что SEM (наряду с EFA, CFA) является статистической процедурой "большой выборки". Короче говоря, я не добрался до 100 участников (какой сюрприз!), …

4
Каково практическое применение дисперсии?
Я учу себя теории вероятностей, и я не уверен, что понимаю какое-либо использование дисперсии, в отличие от стандартного отклонения. В практических ситуациях, на которые я смотрю, дисперсия больше, чем диапазон, поэтому она не кажется интуитивно полезной.
13 variance 

4
Сравнивая важность различных наборов предикторов
Я советовал студенту-исследователю с конкретной проблемой, и я хотел, чтобы на этом сайте присутствовали другие. Контекст: Исследователь имел три типа предикторных переменных. Каждый тип содержал различное количество переменных-предикторов. Каждый предиктор был непрерывной переменной: Социальные: S1, S2, S3, S4 (т.е. четыре предиктора) Когнитивный: С1, С2 (т.е. два предиктора) Поведение: B1, B2, …


3
Предсказатель с большей дисперсией «лучше»?
У меня есть концептуальный вопрос "базовая статистика". Будучи студентом, я хотел бы знать, думаю ли я об этом совершенно неправильно и почему, если это так: Допустим, я гипотетически пытаюсь взглянуть на взаимосвязь между «проблемами управления гневом» и сказать «развод» (да / нет) в рамках логистической регрессии, и у меня есть …

4
Как рассчитать соотношение между / внутри группы переменных?
У меня есть матрица из 1000 наблюдений и 50 переменных, каждая из которых измеряется по 5-балльной шкале. Эти переменные организованы в группы, но в каждой группе нет одинакового количества переменных. Я хотел бы рассчитать два типа корреляций: Корреляция в группах переменных (среди характеристик): некоторая мера того, измеряют ли переменные в …

2
Обучение под наблюдением с «редкими» событиями, когда редкость обусловлена ​​большим количеством контр-фактических событий
Предположим, вы наблюдаете «совпадения» между покупателями и продавцами на рынке. Вы также можете наблюдать характеристики как покупателей, так и продавцов, которые вы хотели бы использовать для прогнозирования будущих совпадений и выработки рекомендаций для обеих сторон рынка. Для простоты предположим, что есть N покупателей и N продавцов, и каждый из них …

2
Количество значащих цифр, чтобы положить в таблицу?
Существует ли обоснованное правило для количества значимых цифр для публикации? Вот несколько конкретных примеров / вопросов: Есть ли способ связать количество значащих цифр с коэффициентом вариации? Например, если оценка составляет 12,3, а CV - 50%, означает ли это, что информация, представленная «.3», приближается к нулю? Если доверительный интервал имеет диапазон …
13 tables 

5
Можно ли использовать квадрат Чи для сравнения пропорций?
Я читал, что тест хи-квадрат полезен, чтобы увидеть, значительно ли образец отличается от набора ожидаемых значений. Например, вот таблица результатов опроса относительно любимых цветов людей (всего n = 15 + 13 + 10 + 17 = 55 респондентов): red,blue,green,yellow 15,13,10,17 Тест хи-квадрат может сказать мне, значительно ли этот образец отличается …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.