Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Когда полезна интерактивная визуализация данных?
Готовясь к выступлению, которое я скоро дам, я недавно начал копаться в двух основных (бесплатных) инструментах для интерактивной визуализации данных: GGobi и mondrian - оба предлагают широкий спектр возможностей (даже если они немного глючат). Я хочу попросить вас помочь в формулировании (как для себя, так и для моей будущей аудитории). …

2
Статистический ландшафт
Кто-нибудь написал краткий обзор различных подходов к статистике? В первом приближении у вас есть частые и байесовские статистические данные. Но когда вы смотрите ближе, у вас также есть другие подходы, такие как вероятностный и эмпирический байесовский. И тогда у вас есть подразделения внутри групп, такие как субъективные байесовские объективные байесовские …

3
Логистическая регрессия и структура набора данных
Я надеюсь, что смогу правильно задать этот вопрос. У меня есть доступ к данным play-by-play, так что это скорее проблема с лучшим подходом и правильным построением данных. Я рассчитываю рассчитать вероятность выигрыша в игре в НХЛ, учитывая количество очков и оставшееся время в регламенте. Я полагаю, что мог бы использовать …

7
Медиана справедливее, чем значит?
Я недавно прочитал совет, что вы должны использовать медиану, а не средство для устранения выбросов. Пример: следующая статья http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ имеет 16 отзывов на данный момент: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median …
17 mean  median  average 

8
Оценка качества кластеризации
У меня есть алгоритм кластеризации (не k-средних) с входным параметром (количество кластеров). После выполнения кластеризации я бы хотел получить количественную оценку качества этой кластеризации. Алгоритм кластеризации имеет одно важное свойство. Для если я введу точек данных без какого-либо существенного различия между ними в этом алгоритме, в результате я получу один …
17 clustering 

2
Зачем использовать масштабирование Платта?
Для калибровки уровня достоверности по вероятности в контролируемом обучении (скажем, для сопоставления достоверности из SVM или дерева решений с использованием данных с избыточной дискретизацией) одним из методов является использование масштабирования Платта (например, получение калиброванных вероятностей из повышения ). В основном каждый использует логистическую регрессию для отображения до [ 0 ; …

2
Непараметрический байесовский анализ в R
Я ищу хороший учебник по кластеризации данных при Rиспользовании иерархического процесса Дирихле (HDP) (один из последних и популярных непараметрических байесовских методов). Существует DPpackage(ИМХО, самый полный из всех доступных) Rдля непараметрического байесовского анализа. Но я не могу понять примеры, приведенные в R Newsсправочном руководстве или в пакете, достаточно хорошо, чтобы кодировать …

5
Простой, надежный, открытый и совместимый текстовый формат для хранения данных
В предыдущем вопросе я спрашивал об инструментах для редактирования файлов CSV . Гэвин ссылается на комментарий к R Help Дункана Мердока, в котором говорится, что формат обмена данными является более надежным способом хранения данных, чем CSV. Для некоторых приложений необходима выделенная система управления базами данных. Однако для небольших проектов анализа …

6
R: вычислить корреляцию по группам
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. В R у меня есть кадр данных, содержащий метку класса C (фактор) и два измерения, M1 и M2 . Как рассчитать соотношение …
17 r  correlation 

9
В чем разница между статистикой и биостатистикой?
Мне пришло в голову, что, хотя за последние годы я собрал воедино некоторые идеи о различиях между статистикой и биостатистикой, я никогда не слышал формального объяснения. В чем разница между этими двумя дисциплинами (в настоящее время)? И почему это различие началось в первую очередь? РЕДАКТИРОВАТЬ: Я не был достаточно конкретным …

1
Несбалансированный смешанный эффект ANOVA для повторных измерений
У меня есть данные от пациентов, получавших 2 разных вида лечения во время операции. Мне нужно проанализировать его влияние на частоту сердечных сокращений. Измерение частоты сердечных сокращений проводится каждые 15 минут. Учитывая, что продолжительность операции может быть разной для каждого пациента, у каждого пациента может быть от 7 до 10 …

3
Можете ли вы сказать, что статистика и вероятность подобны индукции и дедукции?
Я прочитал эту ветку , и мне кажется, что можно сказать, что: статистика = индукция? вероятность = вычет? Но мне интересно, могут ли быть еще какие-то подробности по сравнению, которое я пропускаю. Например, статистика равна индукции, или это только частный случай? Кажется, что вероятность - это частный случай дедукции (поскольку …

2
Если переменные ширины ядра часто хороши для регрессии ядра, почему они вообще не хороши для оценки плотности ядра?
Этот вопрос вызван обсуждением в другом месте . Переменные ядра часто используются в локальной регрессии. Например, loess широко используется и работает как сглаживающая регрессия, и основан на ядре переменной ширины, который адаптируется к разреженности данных. С другой стороны, считается, что переменные ядра приводят к плохим оценкам в оценке плотности ядра …

4
Объединение двух доверительных интервалов / точечных оценок
Предположим, что у одного есть две независимые выборки из одной и той же совокупности, и для двух выборок использовались разные методы для получения точечной оценки и доверительных интервалов. В тривиальных случаях разумный человек просто объединяет две выборки и использует один метод для проведения анализа, но давайте пока предположим, что необходимо …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.