Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Boxplot для нескольких раздач?
Мне нужно нарисовать 20 распределений в одном графике в R, и это не выглядит хорошо (загромождено) для меня с обычным блокпостом (20 блоков) даже с boxwex = 0,3. Не могли бы вы подсказать мне, как я могу построить вид коробчатого графика в R для 20 распределений, с точками для медианы …
9 r  boxplot 

1
Как выбрать количество сплитов в rpart ()?
Я использовал rpart.controlдля minsplit=2, и получил следующие результаты от rpart()функции. Чтобы избежать перегрузки данных, нужно ли использовать разделение 3 или разделение 7? Разве я не должен использовать сплит 7? Пожалуйста, дайте мне знать. Переменные, фактически используемые в построении дерева: [1] ct_a ct_b usr_a Root node error: 23205/60 = 386.75 n= …
9 r  cart  rpart 

2
Понимание результатов регрессии гребня
Я новичок в Ридж регрессии. Когда я применил линейную регрессию гребня, я получил следующие результаты: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at …

2
В какой настройке вы ожидаете, что модель, найденная LARS, будет наиболее отличаться от модели, найденной при исчерпывающем поиске?
Немного больше информации; Предположим, что вы знаете заранее, сколько переменных выбрать и что вы установили штраф за сложность в процедуре LARS, чтобы иметь ровно столько переменных с ненулевыми коэффициентами, вычислительные затраты не являются проблемой (общее количество переменных мало, скажем, 50), что все переменные (у, х) непрерывны. В какой настройке модель …

4
Кластеризация с асимметричными измерениями расстояния
Как кластеризовать объект с асимметричной мерой расстояния? Например, предположим, что вы кластеризуете набор данных с днями недели как функцией - расстояние от понедельника до пятницы не совпадает с расстоянием от пятницы до понедельника. Как вы включаете это в меру расстояния алгоритма кластеризации?

2
Какие полезные рекомендации / советы для изучения Emacs Speaks Statistics (с R)?
Я использую R в течение нескольких лет, но я всегда использовал графический интерфейс, такой как Tinn-R, JGR и совсем недавно R-Studio. Хотя мне нравится интерфейс R-Studio, я чувствую, что для более длинных программ с небольшим количеством графических изображений или вообще без них я мог бы более эффективно кодировать, используя преимущества …
9 r  software 

1
Как я могу вычислить апостериорную оценку плотности из априорной и вероятностной?
Я пытаюсь понять, как использовать теорему Байеса для вычисления апостериорного значения, но я застреваю с вычислительным подходом, например, в следующем случае мне не ясно, как взять произведение предыдущего и вероятности, а затем вычислить задний: Для этого примера меня интересует вычисление апостериорной вероятности и я использую стандартную норму перед µ p …

1
Как сложить две переменные, которые находятся в разных масштабах?
Если у меня есть две переменные, следующие за двумя разными распределениями и имеющие разные стандартные отклонения ... Как мне нужно преобразовать две переменные, чтобы при суммировании двух результатов не «приводился» более изменчивый. Например ... Переменная A менее изменчива, чем переменная B (в диапазоне от 0 до 3000), а переменная B …

2
Исправление для множественных сравнений в пределах предметов / повторных измерений ANOVA; чрезмерно консервативный?
Меня поражает, что доступные поправки для множественных сравнений в контексте повторных измерений ANOVA являются чрезмерно консервативными. Это действительно так? Если да, то какие цитаты я могу использовать, чтобы поддержать этот момент и узнать больше?

5
Обнаружение частей песни
Надеюсь, это не слишком субъективно ... Я ищу какое-то направление в попытках обнаружить разные «части» песни, независимо от музыкального стиля. Я понятия не имею, где искать, но, полагаясь на мощь других сайтов StackOverflow, я подумал, что кто-то здесь может помочь указать направление. В самых основных терминах можно обнаружить разные части …

1
Распространение ошибки с использованием рядов Тейлора 2-го порядка
Я читаю текст «Математическая статистика и анализ данных» Джона Райса. Речь идет о приближении ожидаемое значение и дисперсию случайной величины . Мы можем рассчитать ожидаемое значение и дисперсию случайной величины и мы знаем соотношение . Таким образом, можно приблизить ожидаемое значение и дисперсию используя разложение в ряд Тейлора about .YYYXXXY=g(X)Y=g(X)Y …

1
Множественное вложение для пропущенных данных подсчета во временном ряду из группового исследования
Я пытаюсь решить проблему, связанную с вменением недостающих данных из исследования данных панели (не уверен, правильно ли я использую «исследование данных панели» - как я узнал это сегодня.) У меня есть данные общего количества смертей за 2003 год до 2009 года, все месяцы, мужчины и женщины, для 8 различных районов …


2
Парные, повторные измерения ANOVA или смешанная модель?
Меня попросили проанализировать некоторые данные клинического испытания, изучив два метода измерения артериального давления. У меня есть данные от 50 субъектов, каждый из которых использует от 2 до 57 измерений, используя каждый метод. Мне интересно, как лучше поступить. Очевидно, что мне нужно решение, которое будет учитывать тот факт, что измерение артериального …
9 r  anova  mixed-model  stata 

3
Руководство по открытию новых знаний в данных
Я планирую что-то, чтобы подчеркнуть себя или кого-то еще. Обычно вопрос начинает этот процесс, и часто спрашивающий надеется на конкретный ответ. Как я могу узнать интересные вещи о данных менее предвзятым способом? Прямо сейчас я примерно следую этому методу: Сводные статистические данные. Stripchart. Разброс сюжета. Может быть, повторить с интересным …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.