Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Использование RNN (LSTM) для прогнозирования векторов временных рядов (Theano)
У меня очень простая проблема, но я не могу найти правильный инструмент для ее решения. У меня есть некоторая последовательность векторов одинаковой длины. Теперь я хотел бы обучить LSTM RNN на выборке из этих последовательностей, а затем сделать это для предсказания новой последовательности векторов длины на основе нескольких векторов праймирования …

1
Геометрическое понимание СПС в предметном (двойственном) пространстве
Я пытаюсь получить интуитивное понимание того, как анализ главных компонентов (PCA) работает в предметном (двойном) пространстве . Рассмотрим двумерный набор данных с двумя переменными, x1x1x_1 и x2x2x_2 , и nnn точками данных (матрица данных XX\mathbf X имеет n×2n×2n\times 2 и предполагается, что она центрирована). Обычное представление PCA состоит в том, …

3
Смещение логистической регрессии редких событий: как смоделировать недооцененные p с минимальным примером?
У CrossValidated есть несколько вопросов о том, когда и как применять коррекцию смещения редкого события, разработанную King and Zeng (2001) . Я ищу что-то другое: минимальную демонстрацию, основанную на симуляции, которая существует. В частности, король и дзенг «... в данных по редким событиям смещения вероятностей могут быть существенно значимыми с …

1
Что сделать вывод из этого лассо-сюжета (glmnet)
Ниже приведен график glmnet с альфа-значением по умолчанию (1, следовательно, лассо) с использованием mtcarsнабора данных в R с использованием mpgв качестве DV и других в качестве переменных-предикторов. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Что мы можем сделать вывод из этого графика относительно различных переменных, особенно am, cylи wt(красные, черные и светло - голубые линий)? …

3
Почему Пирсон параметрический, а Спирмен непараметрический
По-видимому, коэффициент корреляции Пирсона параметрический, а число Спирмена непараметрическое. У меня проблемы с пониманием этого. Насколько я понимаю, Пирсон вычисляется как и вычисляется таким же образом, за исключением того, что мы подставляем все значения в их ранги.рх у= c o v ( X, Y)σИксσYрИксYзнак равносоv(Икс,Y)σИксσY r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Википедия говорит …

5
Как использовать разложение Холецкого или альтернативу для моделирования коррелированных данных
Я использую разложение Холецкого для моделирования коррелированных случайных величин с учетом матрицы корреляции. Дело в том, что результат никогда не воспроизводит структуру корреляции так, как он задан. Вот небольшой пример на Python, чтобы проиллюстрировать ситуацию. import numpy as np n_obs = 10000 means = [1, 2, 3] sds = [1, …

3
Путаница с ложным уровнем обнаружения и многократным тестированием (на Colquhoun 2014)
Я прочитал эту замечательную статью Дэвида Колкхуна: исследование уровня ложных открытий и неправильного толкования р-значений (2014). По сути, он объясняет, почему частота ложных обнаружений (FDR) может достигать даже если мы контролируем ошибку типа I с α = 0,05 .30 %30%30\%α = 0,05αзнак равно0,05\alpha=0.05 Однако я все еще не понимаю, что …

3
Как работает формула для генерации коррелированных случайных величин?
Если у нас есть 2 нормальные некоррелированные случайные величины то мы можем создать 2 коррелированные случайные величины с формулойИкс1, X2X1,X2X_1, X_2 Y= ρ X1+ 1 - ρ2-----√Икс2Y=ρX1+1−ρ2X2Y=\rho X_1+ \sqrt{1-\rho^2} X_2 и тогда у будет корреляция с .ρ X 1YYYρρ\rhoИкс1X1X_1 Может кто-нибудь объяснить, откуда взялась эта формула?

5
Существуют ли версии t-SNE для потоковой передачи данных?
Мое понимание t-SNE и приближения Барнса-Хата заключается в том, что все точки данных необходимы для того, чтобы все силовые взаимодействия могли быть рассчитаны одновременно, и каждая точка могла быть скорректирована на 2-й (или более низкой размерности) карте. Существуют ли версии t-sne, которые могут эффективно работать с потоковыми данными? Поэтому, если …

2
Эластичный / ридж / лассо анализ, что тогда?
Я действительно заинтересован в процедуре эластичной сетки для усадки / выбора предиктора. Это кажется очень мощным. Но с научной точки зрения я не знаю, что делать, когда получу коэффициенты. На какой вопрос я отвечаю? Это те переменные, которые больше всего влияют на этот результат, и это те коэффициенты, которые дают …

1
Интервал прогнозирования на основе перекрестной проверки (CV)
В учебниках и лекциях на YouTube я много узнал об итерационных моделях, таких как бустинг, но я никогда не видел ничего о получении интервала прогнозирования. Перекрестная проверка используется для следующего: Выбор модели : попробуйте разные модели и выберите ту, которая подходит лучше всего. В случае повышения используйте CV для выбора …

2
Как можно использовать рекуррентные нейронные сети для классификации последовательностей?
RNN может использоваться для прогнозирования или преобразования последовательности в последовательность. Но как RNN можно использовать для классификации? Я имею в виду, мы даем всей последовательности одну метку.

1
Почему цены на акции являются ненормальными, но доходность акций нормальная
За исключением того факта, что доходность может быть отрицательной, в то время как цены должны быть положительными, есть ли какая-либо другая причина, по которой моделирование цен на акции является логарифмическим нормальным распределением, а моделирование доходности акций - нормальным распределением?

4
Причины для нормального распределения данных
Каковы некоторые теоремы, которые могут объяснить (то есть, в целом), почему данные реального мира могут нормально распределяться? Есть два, о которых я знаю: Центральная предельная теорема (конечно), которая говорит нам, что сумма нескольких независимых случайных величин со средним и дисперсией (даже если они не распределены одинаково) имеет тенденцию быть нормально …

2
Как выбрать структуру со случайными и фиксированными эффектами в линейных смешанных моделях?
Рассмотрим следующие данные из двустороннего дизайна предметов: df <- "http://personality-project.org/r/datasets/R.appendix4.data" df <- read.table(df,header=T) head(df) Observation Subject Task Valence Recall 1 1 Jim Free Neg 8 2 2 Jim Free Neu 9 3 3 Jim Free Pos 5 4 4 Jim Cued Neg 7 5 5 Jim Cued Neu 9 6 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.