Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Реализация регрессии гребня: Выбор интеллектуальной сетки для ?
Я реализую Ridge Regression в модуле Python / C, и я столкнулся с этой "маленькой" проблемой. Идея заключается в том, что я хочу выбрать эффективные степени свободы, более или менее равномерно распределенные (например, график на странице 65 «Элементы статистического обучения» ), например: где - собственные значения матрицы из до \ …

4
Как можно составить график результатов порядка субъективного ранга?
Я ищу способ визуализации субъективных рейтингов, отдельно от моих непараметрических тестов. Я попросил 12 участников оценить 8 различных предметов в соответствии с различным субъективным критерием (отдельные оценки для каждого). Для любого индивидуального набора рейтингов я ищу хороший способ визуализации трендов высокого уровня рейтинга. Я пробовал графики как на столбцах, так …


2
Частота и приоры
Робби Маккиллиам говорит в комментарии к этому сообщению: Следует отметить, что, с точки зрения частых, нет никаких причин, по которым вы не можете включить в модель предыдущие знания. В этом смысле представление «частых» проще: у вас есть только модель и некоторые данные. Нет необходимости отделять предшествующую информацию от модели Кроме …

5
Меры сходства между кривыми?
Я хотел бы вычислить меру сходства между двумя упорядоченными наборами точек - теми, что под Пользователем, и теми, что под Учителем : Точки - это кривые в трехмерном пространстве, но я думал, что проблема упрощается, если я нанесу их в двух измерениях, как на картинке. Если точки перекрываются, сходство должно …

2
Таблицы непредвиденных обстоятельств: какие тесты делать и когда?
Я хотел бы видеть продолжение этой дискуссии о старом чи-кв против точных тестовых дебатов Фишера, немного расширяя сферу. Существует множество тестов на взаимодействие в таблице непредвиденных обстоятельств, которых достаточно, чтобы у меня закружилась голова. Я надеюсь получить объяснение того, какой тест я должен использовать и когда, и, конечно, объяснение того, …


2
Как мне интерпретировать мою регрессию с помощью первых разностных переменных?
У меня есть два временных ряда: Прокси для премии за рыночный риск (ERP; красная линия) Безрисковая ставка по государственному облигации (синяя линия) Я хочу проверить, может ли безрисковая ставка объяснить ERP. Таким образом, я в основном последовал совету Цая (2010, 3-е издание, стр. 96): Финансовый временной ряд: Установите модель линейной …

2
Как сделать обобщенную линейную модель с несколькими зависимыми переменными в R?
У меня есть шесть зависимых переменных (данные подсчета) и несколько независимых переменных, я вижу, что в MMR скрипт выглядит так: my.model <- lm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn) Но, поскольку мои данные рассчитаны, я хочу использовать обобщенную линейную модель, и я попробовал это: my.model <- glm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ …

3
Сравнение двух результатов точности классификатора для статистической значимости с t-тестом
Я хочу сравнить точность двух классификаторов по статистической значимости. Оба классификатора работают на одном наборе данных. Это наводит меня на мысль, что я должен использовать один образец t-критерия из того, что я читал . Например: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 Это правильный тест для …

1
Входные параметры для использования скрытого распределения Дирихле
При использовании тематического моделирования (скрытое распределение Дирихле) количество тем является входным параметром, который необходимо указать пользователю. Мне кажется, что мы также должны предоставить набор кандидатских тем, по которым процесс Dirichlet должен сэмплировать? Правильно ли мое понимание? На практике, как настроить этот набор кандидатов?

4
Условия ошибки скользящей средней модели
Это основной вопрос о моделях Box-Jenkins MA. Как я понимаю, модель MA - это, в основном, линейная регрессия значений временного ряда относительно предыдущих слагаемых ошибок . То есть наблюдение сначала регрессирует к своим предыдущим значениям а затем одно или несколько значений используются в качестве терминов ошибки для MA модель.YYYet,...,et−net,...,et−ne_t,..., e_{t-n}YYYYt−1,...,Yt−nYt−1,...,Yt−nY_{t-1}, …

5
Быстрый метод поиска лучших метапараметров SVM (это быстрее, чем поиск по сетке)
Я использую модели SVM для краткосрочного прогнозирования загрязнителей воздуха. Для обучения новой модели мне нужно найти соответствующие метапараметры для модели SVM (я имею в виду C, гамма и т. Д.). Документация libsvm (и многие другие книги, которые я читал) предлагает использовать поиск по сетке для поиска этих параметров - поэтому …

4
Подтверждение распределения остатков в линейной регрессии
Предположим, мы запустили простую линейную регрессию , сохранили невязки и нарисовали гистограмму распределения невязок. Если мы получим что-то похожее на знакомый дистрибутив, можем ли мы предположить, что наш термин ошибки имеет такое распределение? Скажем, если мы выяснили, что остатки похожи на нормальное распределение, имеет ли смысл предполагать нормальность погрешности в …

1
Доверительный интервал на основе бутстрэпа
Изучая доверительный интервал на основе бутстрапа, я однажды прочитал следующее утверждение: Если распределение начальной загрузки перекошено вправо, основанный на начальной загрузке доверительный интервал включает поправку для перемещения конечных точек еще дальше вправо; это может показаться нелогичным, но это правильное действие. Я пытаюсь понять логику, лежащую в основе приведенного выше утверждения.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.