Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как осмыслить ошибку в регрессионной модели?
Я посещаю занятия по анализу данных, и некоторые из моих укоренившихся идей потрясены. А именно, идея о том, что ошибка (эпсилон), как и любой другой вид дисперсии, применима только (как я думал) к группе (выборке или целому населению). Теперь нас учат, что одним из допущений регрессии является то, что дисперсия …

1
Может ли значение взаимного получения информации быть больше 1?
У меня есть очень основные сомнения. Извините, если это немного раздражает. Я знаю, что значение Взаимной информации должно быть больше 0, но должно ли оно быть меньше 1? Это ограничено каким-либо верхним значением? Спасибо, Амит.

1
Поиск подходящих правил для новых данных с помощью arules
Я использую R (и пакет arules) для майнинга транзакций для правил ассоциации. То, что я хочу сделать, это создать правила, а затем применить их к новым данным. Например, скажем, у меня много правил, одно из которых каноническое {Beer=YES} -> {Diapers=YES}. Тогда у меня есть новые транзакционные данные, где одна из …

1
Оценка вероятности успеха с учетом контрольной группы
Предположим, у вас следующая ситуация: Со временем вы наблюдали 1000 игроков в боулинг, каждый из которых сыграл относительно небольшое количество игр (скажем, от 1 до 20). Вы отметили процент забастовок для каждого из этих игроков по количеству игр, в которые играл каждый из них. Заходит новый игрок в боулинг, играет …

1
Распространение 2-классовых моделей на мультиклассовые задачи
В этой статье об Adaboost приведены некоторые предложения и код (стр. 17) для расширения моделей с 2 ​​классами до задач класса K. Я хотел бы обобщить этот код так, чтобы я мог легко подключить различные 2-классовые модели и сравнить результаты. Поскольку большинство моделей классификации имеют интерфейс формулы и predictметод, некоторые …

6
Скрытые марковские модели с алгоритмом Баума-Уэлча с использованием питона
Я ищу некоторую реализацию Python (в чистом Python или обертывание существующих материалов) HMM и Baum-Welch. Некоторые идеи? Я только что искал в Google, и я нашел очень плохой материал в отношении других методов машинного обучения. Зачем?

3
Должен ли я использовать биномиальный cdf или обычный cdf при подбрасывании монет?
Монета должна быть проверена на справедливость. 30 голов появляются после 50 сальто. Если предположить, что монета справедлива, какова вероятность того, что вы получите как минимум 30 голов за 50 бросков? Правильный способ решить эту проблему, по словам моего учителя, это сделать normalcdf(min = .6, max = ∞, p = .5, …

2
Регрессия, основанная, например, на днях недели
Мне нужна небольшая помощь, чтобы двигаться в правильном направлении. Прошло много времени с тех пор, как я изучал статистику, и, похоже, жаргон изменился. Представьте, что у меня есть набор данных, связанных с автомобилем, таких как Время в пути от города А до города Б Расстояние от города А до города …

1
Отображение событий на временной шкале в R
Существует ли библиотека графиков для R, которая могла бы превратить данные времени начала и окончания в график временной шкалы, например, так: Ось Y означает только то, что она складывается с параллелизмом, но не всегда представляет параллелизм (см. Разрыв в середине). Каждый серый прямоугольник - это событие - строка из кадра …

1
Понимание доказательства леммы, используемой в неравенстве Хеффдинга
Я изучаю лекционные заметки Ларри Вассермана по статистике, в которых в качестве основного текста используются Казелла и Бергер. Я работаю над его комплектом лекций 2 и застрял в выводе леммы, используемой в неравенстве Хеффдинга (стр. 2-3). Я воспроизводлю доказательства в примечаниях ниже, и после доказательства я укажу, где я застрял. …

1
Загадка парикмахера
Моя парикмахерская Стейси всегда выглядит счастливой, но ей часто не хватает времени. Сегодня Стейси была запоздалой на мое назначение и очень извинялась. Во время стрижки я подумала: как долго должны проходить ее стандартные встречи? (если предпочтение клиента на чистые круглые числа может быть проигнорировано, на мгновение). Следует учитывать определенный «волновой …

3
Сколько самых больших слагаемых в
Рассмотрим ∑Ni=1|Xi|∑i=1N|Xi|\sum_{i=1}^N |X_i| где X1,…,XNX1,…,XNX_1, \ldots, X_N - iid и CLT имеет место. Сколько самых больших терминов составляют половину общей суммы? Например, 10 + 9 + 8 ≈≈\approx (10 + 9 + 8 ……\dots + 1) / 2: 30% терминов достигают примерно половины общего числа. определять sumbiggest( j;X1…XN)≡sum of the …

4
Как лучше всего анализировать данные о продолжительности пребывания в РКИ в больнице?
Мне интересно знать, существует ли консенсус относительно оптимального способа анализа данных о продолжительности пребывания в больнице (LOS) из РКИ. Это, как правило, распределение с очень правильным перекосом, при котором большинство пациентов выписывается в течение нескольких дней или недели, но у остальных пациентов остаются довольно непредсказуемые (а иногда и довольно продолжительные) …

1
Инкрементальный IDF (обратная частота документов)
В приложении для интеллектуального анализа текста одним простым подходом является использование эвристики для создания векторов в виде компактных разреженных представлений документов. Это хорошо для настройки пакета, когда весь корпус известен априори, так как для требуется весь корпусi d fт ф- я деtf−idftf-idfя деidfidf я д е( т ) = журнал| …

2
Возможные расширения диагностических участков по умолчанию для lm (в R и в целом)?
Я начал немного копаться в функции plot.lm , эта функция дает шесть графиков для lm: График остатков от установленных значений График Scale-Location для sqrt (| остатки |) по отношению к подобранным значениям Нормальный график QQ, график расстояний Кука против меток строк График остатков против рычагов график расстояний Кука от плеча …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.