Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Выбор функций и настройка параметров с помощью каретки для случайного леса
У меня есть данные с несколькими тысячами функций, и я хочу сделать рекурсивный выбор функций (RFE), чтобы удалить неинформативные. Я делаю это с помощью карета и РСЕ. Однако я начал думать, если я хочу получить наилучшее соответствие регрессии (например, случайный лес), когда мне следует выполнить настройку параметров ( mtryдля RF)? …

1
Стратифицированная классификация со случайными лесами (или другой классификатор)
Итак, у меня есть матрица размером около 60 x 1000. Я рассматриваю ее как 60 объектов с 1000 объектов; 60 объектов сгруппированы в 3 класса (a, b, c). 20 предметов в каждом классе, и мы знаем истинную классификацию. Я хотел бы провести обучение под наблюдением на этом наборе из 60 …

1
Что нормы и как они относятся к регуляризации?
В последнее время я видел много статей о разреженных представлениях, и большинство из них используют норму и выполняют некоторую минимизацию. Мой вопрос: что норма и смешанная норма? И как они имеют отношение к регуляризации?ℓ p ℓ p , qℓpℓp\ell_pℓpℓp\ell_pℓp,qℓp,q\ell_{p, q} благодаря

4
Каковы стандартные статистические тесты, чтобы увидеть, соответствуют ли данные экспоненциальному или нормальному распределению?
Каковы стандартные статистические тесты, чтобы увидеть, соответствуют ли данные экспоненциальному или нормальному распределению?


3
В чем разница между линейно зависимой и линейно коррелированной?
Пожалуйста, объясните, в чем разница, если две переменные линейно зависимы или линейно коррелированы . Я посмотрел статью в Википедии, но не нашел подходящего примера. Пожалуйста, объясните это на примере.

1
Многомерное нормальное распределение коэффициента регрессии?
Читая учебник по регрессии, я обнаружил следующий абзац: Наименьших квадратов оценка вектора коэффициентов линейной регрессии ( )ββ\beta β^= ( XTИкс)- 1ИксTYβ^знак равно(ИксTИкс)-1ИксTY \hat{\beta} = (X^{t}X)^{-1}{X^t}y которая, если рассматривать ее как функцию данных (рассматривая предикторы X как константы), является линейной комбинацией данных. Используя центральную предельную теорему, можно показать, что распределение β …

2
На что это указывает, когда корреляция Спирмена на определенную величину меньше Пирсона?
У меня есть куча связанных наборов данных. Корреляции Пирсона между их парами обычно определенно больше, чем корреляции Спирмена. Это говорит о том, что любая корреляция является линейной, но можно ожидать, что даже если бы Пирсон и Спирмен были одинаковыми. Что это означает, когда существует определенный разрыв между корреляцией Пирсона и …

3
Связь между двумя временными рядами: ARIMA
Учитывая следующие два временных ряда ( x , y ; см. Ниже), каков наилучший метод для моделирования взаимосвязи между долгосрочными тенденциями в этих данных? Оба временных ряда имеют важные тесты Дурбина-Уотсона, когда они моделируются как функция времени, и ни один из них не является стационарным (как я понимаю, термин, или …

1
Как мне подогнать нелинейную модель смешанных эффектов для данных повторных измерений, используя nlmer ()?
Я пытаюсь проанализировать данные повторных измерений и пытаюсь заставить их работать R. Мои данные по существу следующие, у меня есть две группы лечения. Каждый субъект в каждой группе тестируется каждый день и получает оценку (процент правильных на тесте). Данные в длинном формате: Time Percent Subject Group 1 0 GK11 Ethanol …

1
Доказательство того, что если существует более высокий момент, то существует и более низкий момент
-й момент случайной величины является конечным , если rrrXXXE(|Xr|)&lt;∞E(|Xr|)&lt;∞ \mathbb E(|X^r|)< \infty Я пытаюсь показать , что для любого натурального , то -го момента также конечно.s&lt;rs&lt;rs<rsssE[|Xs|]E[|Xs|]\mathbb E[|X^s|]

4
Бутстрап, Монте-Карло
Мне задали следующий вопрос в рамках домашней работы: Разработайте и внедрите имитационное исследование, чтобы изучить производительность начальной загрузки для получения 95% доверительных интервалов по среднему значению однофакторной выборки данных. Ваша реализация может быть в R или SAS. Аспектами эффективности, которые вы, возможно, захотите рассмотреть, являются покрытие доверительного интервала (т. Е. …

3
Как выполнить повторную выборку в R, не повторяя перестановок?
Если в R установить set.seed (), а затем использовать функцию примера для рандомизации списка, могу ли я гарантировать, что не сгенерирую такую ​​же перестановку? то есть ... set.seed(25) limit &lt;- 3 myindex &lt;- seq(0,limit) for (x in seq(1,factorial(limit))) { permutations &lt;- sample(myindex) print(permutations) } Это производит [1] 1 2 0 …

5
Как получить область эллипса из двумерных нормальных распределенных данных?
У меня есть данные, которые выглядят так: Я попытался применить нормальное распределение (оценка плотности ядра работает лучше, но мне не нужна такая большая точность), и это работает довольно хорошо. Плотность графика составляет эллипс. Мне нужно получить эту функцию эллипса, чтобы решить, находится ли точка в области эллипса или нет. Как …
12 r  regression  pdf  bivariate 

2
Случайные Леса показывают смещение предсказания?
Я думаю, что это простой вопрос, хотя причины, почему или почему нет, могут и не быть. Причина, по которой я спрашиваю, состоит в том, что я недавно написал свою собственную реализацию RF, и, хотя она работает хорошо, она работает не так, как я ожидал (на основе набора данных о конкурсе …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.