Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Анализ временной шкалы
Я провожу исследование взаимосвязи между порядком рождения человека и последующим риском ожирения, используя данные нескольких одногодичных когорт (например, http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/ ). Основная проблема заключается в том, что порядок рождения связан с другими характеристиками, такими как возраст матери, количество младших и / или старших братьев и сестер и интервал между родами, которые …
10 timelines 

3
Присвоение меток классов кластерам k-средних
У меня есть очень простой вопрос о кластеризации. После того, как я нашел k кластеров с их центроидами, как мне интерпретировать классы точек данных, которые я кластеризовал (назначая значимые метки классов каждому кластеру). Я не говорю о проверке найденных кластеров. Можно ли это сделать с помощью небольшого набора точек данных, …
10 k-means 

1
Статистика по машинному обучению, документы для начала?
У меня есть опыт работы в области компьютерного программирования и теории элементарных чисел, но я не изучал реальную статистику, и недавно «обнаружил», что удивительный мир целого ряда методов на самом деле является статистическим миром. Кажется, что матричные факторизации, матричное пополнение, многомерные тензоры, вложения, оценка плотности, байесовский вывод, марковские разбиения, вычисления …

3
Как визуализировать байесовскую доброту, пригодную для логистической регрессии
Для задачи байесовской логистической регрессии я создал апостериорное предиктивное распределение. Я выбираю из прогнозирующего распределения и получаю тысячи выборок (0,1) для каждого наблюдения, которое у меня есть. Визуализация пригодности менее интересна, например: На этом графике показаны 10 000 образцов + наблюдаемая исходная точка (слева можно разглядеть красную линию: да, это …

3
В чем преимущество вменения перед построением нескольких моделей в регрессии?
Интересно, может ли кто-нибудь дать некоторое представление о том, является ли лучше объяснение почему отсутствующие данные, чем простое построение различных моделей для случаев с отсутствующими данными. Особенно в случае [обобщенных] линейных моделей (возможно, я вижу, что в нелинейных случаях все иначе) Предположим, у нас есть базовая линейная модель: Y= β1Икс1+ …

4
Как проверить, хороша ли моя регрессионная модель
Один из способов найти точность модели логистической регрессии с использованием «glm» - это найти график AUC. Как проверить то же самое для регрессионной модели, найденной с переменной непрерывного ответа (family = 'gaussian')? Какие методы используются для проверки соответствия моей регрессионной модели данным?

3
Серьезная углубленная проблема вероятностей подбрасывания монет
Допустим, я делаю 10 000 бросков монеты. Я хотел бы знать вероятность того, сколько сальто потребуется, чтобы получить 4 или более последовательных головы подряд. Счет будет работать следующим образом: один последовательный раунд бросков будет считаться только головами (4 головы или более). Когда хвост поражает и ломает полосу голов, счет начинается …

2
Оценка плотности ядра по асимметричным распределениям
Пусть - наблюдения, полученные из неизвестного (но, безусловно, асимметричного) распределения вероятностей.{ х1, … , ХN}{x1,…,xN}\{x_1,\ldots,x_N\} Я хотел бы найти распределение вероятностей с помощью KDE Однако я попытался использовать ядро ​​Гаусса, но оно работало плохо, поскольку оно симметрично. Таким образом, я видел, что были выпущены некоторые работы с ядрами Gamma и …

3
Учитывая монету с неизвестным уклоном, эффективно генерировать отличия от справедливой монеты
Учитывая монету с неизвестным смещением , как я могу генерировать переменные - настолько эффективно, насколько это возможно - которые распределены Бернулли с вероятностью 0,5? То есть, используя минимальное количество сальто на сгенерированный вариант.ppp

1
Интерпретация графиков условной плотности
Я хотел бы знать, как правильно интерпретировать графики условной плотности. Я вставил две ниже, которые я создал в R с cdplot. Например, равна ли вероятность того, что Result равен 1, когда Var 1 равен 150 приблизительно 80%? Темно-серая область - это то, что является условной вероятностью того, что Resultона равна …


2
В чем разница между логит-трансформированной линейной регрессией, логистической регрессией и логистической смешанной моделью?
Предположим, у меня есть 10 учеников, каждый из которых пытается решить 20 математических задач. Задачи оцениваются правильно или неправильно (в длинных данных), и результаты каждого учащегося можно суммировать с помощью показателя точности (в подчиненных данных). Модели 1, 2 и 4 ниже дают разные результаты, но я понимаю, что они делают …

3
Пределы основанных на деревьях методов ансамбля в маленьких n, больших p проблемах?
Основанные на деревьях методы ансамбля, такие как Случайный лес и последующие производные (например, условный лес), предназначены для использования в так называемых задачах «маленький n , большой p » для определения относительной важности переменной. Действительно, похоже, что это так, но мой вопрос в том, как далеко может быть взята эта способность? …

2
Путаница, связанная с различием процессов кригинга и гаусса
Мне трудно понять, в чем разница между кригингом и гауссовскими процессами. Я имею в виду, что вики говорят, что они одинаковы, но их формулы для предсказания такие разные. Я немного запутался, почему их называют похожими. Разъяснения?

3
Построить дерево вероятностей пути для поездок через веб-сайт
В настоящее время я делаю анализ на веб-сайте, который требует, чтобы я создал схему дерева решений, показывающую вероятный маршрут, по которому люди идут, когда они приходят на веб-сайт. Я имею дело с a, data.frameкоторый показывает пути всех клиентов к сайту, начиная с домашней страницы. Например, клиент может выбрать следующий путь: …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.