Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Имеет ли смысл использовать переменную даты в регрессии?
Я не привык использовать переменные в формате даты в R. Мне просто интересно, можно ли добавить переменную даты в качестве объясняющей переменной в модели линейной регрессии. Если это возможно, как мы можем интерпретировать коэффициент? Это влияние одного дня на итоговую переменную? Посмотрите мою суть с примером того, что я пытаюсь …

4
Интуиция для функции кумулятивного риска (анализ выживания)
Я пытаюсь получить интуицию для каждой из основных функций в актуарной науке (специально для модели пропорциональных рисков Кокса). Вот что у меня так далеко: f(x)f(x)f(x) : начиная с момента начала, распределение вероятностей, когда вы умрете. F(x)F(x)F(x) : только совокупное распределение. В момент времени , какой процент населения погибнет?TTT S(x)S(x)S(x) :1−F(x)1−F(x)1-F(x) …

8
Любые предложения для хорошего вводного учебника для студентов по статистике?
Я надеюсь, что вы можете дать мне несколько предложений. Я преподаю в очень разнообразном колледже (состоящем из групп меньшинств), и студенты в основном специализируются на психологии. Большинство учеников только что закончили среднюю школу, но некоторые из них - это старшие ученики старше 40 лет. У большинства учеников есть проблемы с …

3
Какой тест Дики-Фуллера для временного ряда моделируется с помощью перехвата / дрейфа и линейного тренда?
Укороченная версия: У меня есть временной ряд климатических данных, которые я проверяю на стационарность. Основываясь на предыдущих исследованиях, я ожидаю, что модель, лежащая в основе (или, так сказать, «генерирующая») данных, будет иметь член перехвата и положительный линейный тренд времени. Чтобы проверить эти данные на стационарность, должен ли я использовать тест …

2
Как предсказать или расширить линии регрессии в ggplot2?
У меня есть фрейм данных, который содержит два временных ряда: даты и номера версий выпусков Emacs и Firefox. Используя одну команду ggplot2, легко создать диаграмму, которая использует лесс (таким образом, который выглядит немного забавно, что я не против), чтобы превратить точки в линии. Как я могу продлить линии в будущее? …

2
Как мне организовать мою стендовую презентацию?
В настоящее время я делаю постерную презентацию и хотел бы получить совет (или ссылку на совет) по некоторым аспектам графики. Примеры плакатов, о которых я говорю, см. В дополнительном материале для статей ASA Data Expo в Томе 20, выпуск 2 Журнала вычислительной и графической статистики (другой пример здесь ( Hendrix …

1
Предсказание темы с использованием скрытого распределения Дирихле
Я использовал LDA на корпусе документов и нашел несколько тем. Вывод моего кода - две матрицы, содержащие вероятности; вероятности для одной темы и вероятность для другой темы. Но я на самом деле не знаю, как использовать эти результаты, чтобы предсказать тему нового документа. Я использую выборку Гиббса. Кто-нибудь знает как? …

1
Повышение И Упаковка Деревьев (XGBoost, LightGBM)
Есть много постов в блогах, видео на YouTube и т. Д. Об идеях создания мешков или повышения деревьев. Мое общее понимание таково, что псевдокод для каждого из них: Bagging: Возьмите N случайных выборок x% выборок и y% функций Установите вашу модель (например, дерево решений) на каждый из N Прогнозировать с …

2
Важность функции с фиктивными переменными
Я пытаюсь понять, как я могу получить важность функции категориальной переменной, которая была разбита на фиктивные переменные. Я использую Scikit-Learn, который не обрабатывает категориальные переменные для вас, как R или H2O. Если я разобью категориальную переменную на фиктивные переменные, я получу отдельные значения свойств для каждого класса в этой переменной. …

5
В чем разница между прогнозами «в выборке» и «вне выборки»?
Я не понимаю, в чем именно заключается разница между прогнозированием "в выборке" и "вне выборки"? Прогноз в выборке использует подмножество доступных данных для прогнозирования значений за пределами периода оценки. Вместо этого в прогнозном прогнозе используются все доступные данные. Верны ли они ? Очень конкретно правильное следующее определение? Внутри выборочного прогноза …

2
Понимание теста Колмогорова-Смирнова в R
Я пытаюсь понять вывод тестовой функции Колмогорова-Смирнова (два примера, двухсторонние). Вот простой тест. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) : cannot compute …

2
Классификация с градиентным ускорением: как сохранить прогноз в [0,1]
Вопрос Я изо всех сил пытаюсь понять, как прогнозирование сохраняется в интервале [0,1][0,1][0,1] при выполнении бинарной классификации с градиентным повышением. Предположим , что мы работаем над бинарной проблемы классификации, и наша целевая функция является потеря журнала, −∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog⁡(Hm(xi))+(1−yi)log⁡(1−Hm(xi))-\sum y_i \log(H_m(x_i)) + (1-y_i) \log(1-H_m(x_i)) где yyy - целевая переменная ∈{0,1}∈{0,1}\in \{0,1\} а …

1
Как найти / оценить функцию плотности вероятности по функции плотности в R
Предположим, что у меня есть переменная, как Xс неизвестным распределением. В Mathematica, используя SmoothKernelDensityфункцию, мы можем получить оценочную функцию плотности. Эту оценочную функцию плотности можно использовать вместе с PDFфункцией для вычисления функции плотности вероятности значения, например, Xв PDF[density,X]предположении, что «плотность» является результатом SmoothKernelDensity. Было бы хорошо, если бы такая функция …
17 r  pdf  cdf 

2
Будет ли возможен / практичен случайный лес с несколькими выходами?
Случайные леса (RF) - это конкурентный метод моделирования / добычи данных. Модель RF имеет один выход - переменную выход / прогноз. Наивный подход к моделированию нескольких выходов с RFs должен был бы построить RF для каждой выходной переменной. Таким образом, у нас есть N независимых моделей, и там, где есть …

2
Как бороться с ошибкой, такой как «Коэффициенты: 14 не определены из-за особенностей» в R?
При выполнении GLM, и вы получаете ошибку «не определено из-за особенностей» в выводе anova, как можно предотвратить возникновение этой ошибки? Некоторые полагают, что это происходит из-за коллинеарности между ковариатами или что один из уровней отсутствует в наборе данных (см .: интерпретация «не определено из-за особенностей» в lm ) Если бы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.