Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как выбрать ядро ​​для ядра PCA?
Какими способами можно выбрать, какое ядро ​​приведет к хорошему разделению данных при окончательном выводе данных ядром PCA (анализ основных компонентов), и как оптимизировать параметры ядра? Условия Лаймана, если это возможно, будут высоко оценены, и ссылки на статьи, которые объясняют такие методы, также были бы хорошими.

4
Учебник по усилению обучения
Я ищу учебник / лекционные заметки в обучении подкреплению. Мне нравится «Введение в статистическое обучение» , но, к сожалению, они не охватывают эту тему. Я знаю, что книга Саттона и Барто является стандартным справочником, и, возможно, НДП также хороша, но они датированы 1997-98 гг., И я надеялся найти более современную …

2
Алгоритмы машинного обучения для панельных данных
В этом вопросе. Существует ли метод построения деревьев решений, который учитывает структурированные / иерархические / многоуровневые предикторы? - они упоминают метод данных панели для деревьев. Существуют ли специальные методы данных панели для поддержки векторных машин и нейронных сетей? Если да, не могли бы вы привести несколько статей для алгоритмов и …

2
понимание р-значения в множественной линейной регрессии
Что касается p-значения множественного линейного регрессионного анализа, введение с веб-сайта Minitab приведено ниже. Значение p для каждого члена проверяет нулевую гипотезу о том, что коэффициент равен нулю (без эффекта). Низкое значение p (<0,05) означает, что вы можете отклонить нулевую гипотезу. Другими словами, предиктор с низким значением p, скорее всего, станет …

2
Распределение вероятностей для шумной синусоиды
Я рассчитываю аналитически рассчитать распределение вероятностей точек выборки из осциллирующей функции, когда есть некоторая ошибка измерения. Я уже рассчитал распределение вероятностей для части «без шума» (я поставлю это в конце), но я не могу понять, как включить «шум». Численная оценка Чтобы быть более понятным, представьте, что есть некоторая функция которой …

2
Как сравнить два алгоритма ранжирования?
Я хочу сравнить два алгоритма ранжирования. В этих алгоритмах клиент указывает некоторые условия в своем поиске. В соответствии с требованиями клиента, этот алгоритм должен назначать оценку для каждого элемента в базе данных и извлекать элементы с наивысшими оценками. Я прочитал различные темы, связанные с моим вопросом на этом сайте, и …

5
Хребет & ЛАССО норм
Этот пост следует за этим: Почему оценка гребня становится лучше, чем OLS, добавляя константу к диагонали? Вот мой вопрос: Насколько я знаю, в регуляризации хребта используется (евклидово расстояние). Но почему мы используем квадрат этой нормы? (прямое применение приведет к получению квадратного корня от суммы квадрата бета).ℓ 2ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2 Для сравнения, мы …

2
Почему R требует много времени для подбора модели с многоуровневым фактором?
Я подхожу к модели с многовариантным множителем, и R требует очень много времени, чтобы соответствовать этой модели. Почему это? Например, если я подгоняю регрессию к прогнозированию зарплат игроков и включаю предиктор факторов для всех национальностей игроков, это займет больше времени, чем подгонка модели для зарплат игроков с непрерывным предиктором, таким …

1
Какое распределение приводит к добавлению двух распределений Парето
Мне интересно, какое распределение приводит к добавлению двух (или более) распределений Парето первого типа вида . Экспериментально это выглядит как двухрежимный степенной закон, асимптотический для разности альфа.x−αx−αx^{-\alpha}

1
Соответствует ли каждая полуположительная определенная матрица ковариационной матрице?
Хорошо известно, что ковариационная матрица должна быть полуположительно определенной, однако верно ли обратное? То есть каждая полуположительная определенная матрица соответствует ковариационной матрице?


1
Разница между сериями с дрейфом и сериями с трендом
Ряд с дрейфом может быть смоделирован как где - дрейф (постоянный), а . YT= c + ϕ yт - 1+ εTyt=c+ϕyt−1+εty_t = c + \phi y_{t-1} + \varepsilon_tсccϕ = 1ϕ=1\phi=1 Ряд с трендом можно смоделировать как где - дрейф (постоянная), - детерминированный тренд времени, а .YT= с + δt + …

1
Каковы условия регулярности для теста отношения правдоподобия?
Может ли кто-нибудь сказать мне, каковы условия регулярности для асимптотического распределения теста отношения правдоподобия? Куда бы я ни посмотрел, везде написано «В условиях регулярности» или «В вероятностных закономерностях». Какие именно условия? Что существуют первая и вторая логарифмические производные правдоподобия, а информационная матрица не равна нулю? Или что-то еще целиком?

2
Непараметрическая мера силы ассоциации между порядковым и непрерывным случайным числом
Я бросаю здесь проблему, как я получил это. У меня есть две случайные величины. Один из которых является непрерывным (Y), а другой - дискретным и будет обозначаться как ординал (X). Я поместил ниже график, который я получил вместе с запросом. Человек, который посылает мне данные, хочет измерить силу связи между …

2
Можно ли оценить GLM в Python / scikit-learn, используя распределения Пуассона, Гаммы или Твиди как семейство для распределения ошибок?
Пытаюсь выучить немного Python и Sklearn, но для своей работы мне нужно запустить регрессии, которые используют распределения ошибок из семейств Пуассона, Гаммы и особенно семейства Твиди. Я ничего не вижу в документации о них, но они есть в нескольких частях дистрибутива R, поэтому мне было интересно, видел ли кто-нибудь где-нибудь …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.