Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Определение отфильтрованных объектов после выбора функции с помощью Scikit Learn.
Вот мой код для выбора метода в Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Но после получения нового X (зависимая переменная - X_new), как узнать, какие переменные удалены …

1
Перекрестная проверка регрессии лассо в R
Функция R cv.glm (library: boot) вычисляет предполагаемую K-кратную ошибку прогнозирования перекрестной проверки для обобщенных линейных моделей и возвращает дельту. Имеет ли смысл использовать эту функцию для регрессии лассо (library: glmnet) и, если да, то как ее можно выполнить? Библиотека glmnet использует перекрестную проверку для получения лучшего параметра поворота, но я …

3
связь между
Очень простой вопрос, касающийся OLS регрессийр2р2R^2 запустить регрессию OLS y ~ x1, у нас есть р2р2R^2 , скажем, 0,3 запустить регрессию OLS y ~ x2, у нас есть еще один р2р2R^2 , скажем, 0,4 Теперь мы запустим регрессию y ~ x1 + x2, какое значение может иметь R в квадрате …

1
Тестирование значимости коэффициента Шарпа
Как правильно проверить значение коэффициентов Шарпа или коэффициентов информации? Коэффициенты Шарпа будут основаны на различных индексах акций и могут иметь различные периоды просмотра. В одном из описанных мной решений просто применяется t-критерий Стьюдента с установленным значением df длительности периода оглядки назад. Я не решаюсь применять вышеуказанный метод из-за следующих проблем: …

2
Что такое бакетизация?
Я собирался найти четкое объяснение "сгибания" в машинном обучении без удачи. Что я понимаю до сих пор, так это то, что бекетирование аналогично квантованию в цифровой обработке сигналов, когда диапазон непрерывных значений заменяется одним дискретным значением. Это правильно? Каковы плюсы и минусы (помимо очевидного влияния потери информации) применения букетизации? Существуют …

2
Разница между PCA и спектральной кластеризацией для небольшого выборочного набора булевых функций
У меня есть набор данных из 50 образцов. Каждый образец состоит из 11 (возможно, коррелированных) булевых функций. Я хотел бы кое-что визуализировать эти образцы на двухмерном графике и изучить, есть ли кластеры / группировки среди 50 образцов. Я попробовал следующие два подхода: (a) Запустите PCA на матрице 50x11 и выберите …

2
Вложенная перекрестная проверка - чем она отличается от выбора модели с помощью kfold CV на тренировочном наборе?
Я часто вижу людей, говорящих о перекрестной проверке 5x2 как частном случае вложенной перекрестной проверки . Я предполагаю, что первое число (здесь: 5) относится к числу сгибов во внутренней петле, а второе число (здесь: 2) относится к числу сгибов во внешней петле? Итак, чем это отличается от «традиционного» подхода к …

3
Нормаль, деленная на дает вам t-распределение - доказательство
пусть и .Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) Если и независимо распределены, то переменная следует распределению со степенями свободы .ZZZWWWY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss Я ищу доказательства этого факта, ссылка достаточно хороша, если вы не хотите записывать полный аргумент.

1
Является ли ковариация стандартизированных переменных корреляцией?
У меня есть основной вопрос. Скажем , у меня есть две случайные величины, ИксИксX и . Я могу стандартизировать их путем вычитания среднего значения и деления на стандартное отклонение, то естьX s t a n d a r d i z e d = ( X - E ( X …

1
О чем сообщает lsmeans для обобщенной линейной модели, такой как смешанная модель Пуассона (в соответствии с блеском)?
Я анализирую данные отслеживания глаз из разработанного эксперимента. Упрощенная версия моих данных выглядит следующим образом (Вы можете получить данные dput () здесь ), head(lookDATA) participant fixationImage fixationCount 1 9 Automobile 81 2 9 Bird 63 3 9 Chair 82 4 9 Dog 64 5 9 Face 90 6 9 Plant …

2
Хорошие примеры разделов статистики в прикладных статьях академического журнала
Я биостатист, работаю в прикладной области, и я отвечаю за написание раздела методов статистики для статей, над которыми я сотрудничаю. Читая много научных статей, я натолкнулся на множество примеров плохо написанных разделов статистики (в основном они скучные, неинформативные и лишенные точности, детализации и понимания используемой методологии). Независимо от предмета и …

2
Оценить апостериорное прогнозирующее распределение в байесовской линейной регрессии
Я запутался в том, как оценивать апостериорное предиктивное распределение для байесовской линейной регрессии, за пределами основного случая, описанного здесь на странице 3 и скопированного ниже. р ( у~∣ у) = ∫р ( у~∣ β, σ2) p ( β, σ2∣ у)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, …

2
Можете ли вы рассчитать мощность теста Колмогорова-Смирнова в R?
Можно ли провести силовой анализ для двустороннего теста Колмогорова Смирнова в R? Я проверяю, отличаются ли два эмпирических распределения с помощью ks.test (), и собираюсь добавить анализ мощности. Мне не удалось найти какой-либо встроенный анализ мощности для испытаний KS в R. Есть предложения? Изменить : это случайно сгенерированные распределения, которые …

1
Почти уверенная конвергенция не подразумевает полной конвергенции
Мы говорим, что X1,X2,…X1,X2,…X_1, X_2, \ldots полностью сходятся к если для каждого .ϵ &gt; 0XXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty Лемма Бореля Кантелли прямо доказывает, что полная сходимость подразумевает почти уверенную сходимость. Я ищу пример, где почти наверняка сходимость не может быть доказана с помощью Бореля Кантелли. Это последовательность случайных величин, которая …

1
Формула для байесовского А / Б тестирования не имеет никакого смысла
Я использую формулу из байесовского ab-тестирования , чтобы вычислить результаты теста AB, используя байесовскую методологию. Pr ( pВ&gt; рA) = ∑я = 0αВ- 1B ( αA+ я , βВ+ βA)( βВ+ i ) B ( 1 + i , βВ) B ( αA, βA)Pr(пВ&gt;пA)знак равноΣязнак равно0αВ-1В(αA+я,βВ+βA)(βВ+я)В(1+я,βВ)В(αA,βA) \Pr(p_B > p_A) = …
10 r  bayesian  ab-test 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.