Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как оптимально распределить ничьи при расчете множественных ожиданий
Предположим, мы хотим вычислить некоторое ожидание: EYЕИкс| Y[f(X,Y) ]EYЕИкс|Y[е(Икс,Y)]E_YE_{X|Y}[f(X,Y)] Предположим, мы хотим приблизить это с помощью моделирования Монте-Карло. ЕYЕИкс| Y[ ф( Х, Y) ] ≈ 1R SΣг = 1рΣs = 1Sе(xr,s,yr)EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) Но предположим , что это дорого брать пробы из обоих распределений, так что мы только можем себе …

1
Как линейный базовый ученик работает в повышении? И как это работает в библиотеке xgboost?
Я знаю, как реализовать линейную целевую функцию и линейные усиления в XGBoost. Мой конкретный вопрос: когда алгоритм соответствует остаточному (или отрицательному градиенту), использует ли он один элемент на каждом шаге (т.е. одномерную модель) или все признаки (многомерная модель)? Будем благодарны за любые ссылки на документацию о линейных бустах в XGBoost. …

1
Олимпиада - Венгрия имеет лидирующие цифры в золоте? (Относительное население)
Я создал веб-страницу, на которой публикуются живые результаты олимпийских медалей от Thompson Reuters и подсчет населения по всему миру из ЦРУ. Результаты интересны для меня - у Венгрии двузначное лидерство в золотых медалях над остальным миром. Кроме того, США и Китай находятся на самом низком уровне практически в каждой категории. …

2
Моделирование игроков в крикет, получающих игроков с битой
У меня есть набор данных, детализирующий большое количество игр в крикет (несколько тысяч). В крикет "боулеры" неоднократно бросают мяч в ряд "игроков с битой". Котелок пытается вытащить игрока с битой. В этом отношении он очень похож на кувшины и баттеры в бейсболе. Если бы я взял весь набор данных и …

1
Более простой способ найти
Рассмотрим 3 одинаковых выборки, взятых из равномерного распределения u(θ,2θ)u(θ,2θ)u(\theta, 2\theta) , где θθ\theta - параметр. Я хочу найти E[X(2)|X(1),X(3)]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] где X(i)X(i)X_{(i)} - это статистика порядка iii . Я ожидаю, что результатом будет Но единственный способ, которым я могу показать этот результат, кажется слишком длинным, я не могу …


2
Масштабируемое уменьшение размера
Учитывая постоянное число функций, t-SNE Барнса-Хата имеет сложность , случайные проекции и PCA имеют сложность что делает их «доступными» для очень больших наборов данных.O ( n logн )О(Nжурнал⁡N)O(n\log n)O ( n )О(N)O(n) С другой стороны, методы, основанные на многомерном масштабировании, имеют сложность .O ( n2)О(N2)O(n^2) Существуют ли другие методы уменьшения …

1
Я только что провел два миллиона регрессий - интегрированная вероятность
В настоящее время я работаю над попыткой реализовать метод, используемый в популярной статье под названием «Я только что провел два миллиона регрессий». Основная идея заключается в том, что есть определенные случаи, когда не очевидно, какие элементы управления должны быть включены в модель. Одна вещь, которую вы можете сделать в этом …

1
Интервал прогнозирования будущей доли успехов в биномиальных условиях
Предположим, я подгоняю биномиальную регрессию и получаю точечные оценки и дисперсионно-ковариационную матрицу коэффициентов регрессии. Это позволит мне получить CI для ожидаемой доли успехов в будущем эксперименте, , но мне нужен CI для наблюдаемой пропорции. Было опубликовано несколько связанных ответов, в том числе симуляция (предположим, я не хочу этого делать) и …


2
Что подразумевается под «шумом Лапласа»?
В настоящее время я пишу алгоритм для дифференциальной конфиденциальности с использованием механизма Лапласа. К сожалению, у меня нет опыта в статистике, поэтому многие термины мне неизвестны. Так что теперь я спотыкаюсь о термине: шум Лапласа . Чтобы сделать дифференциальный набор данных закрытым, все статьи просто говорят о добавлении шума Лапласа …

1
Прогнозирование временных рядов с использованием ARIMA против LSTM
Проблема, с которой я имею дело, заключается в прогнозировании значений временных рядов. Я смотрю на один временной ряд за раз и на основе, например, 15% входных данных, я хотел бы предсказать его будущие значения. До сих пор я сталкивался с двумя моделями: LSTM (долговременная кратковременная память; класс рекуррентных нейронных сетей) …

1
Можно ли использовать стандартизированные
Я пытаюсь интерпретировать результаты статьи, где они применили множественную регрессию, чтобы предсказать различные результаты. Однако 's (стандартизированные коэффициенты B определены как β x 1 = B x 1 ⋅ S D x 1ββ\beta гдеy- зависимая переменная, аx1- предиктор), по-видимому, не соответствует сообщенномуR2:βИкс1= BИкс1⋅ S DИкс1S DYβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y}YyyИкс1x1x_1р2R2R^2 …

2
Как рассчитать доверительный интервал X-перехвата в линейной регрессии?
Поскольку стандартная ошибка линейной регрессии обычно задается для переменной отклика, мне интересно, как получить доверительные интервалы в другом направлении - например, для x-перехвата. Я могу представить, что это может быть, но я уверен, что должен быть прямой способ сделать это. Ниже приведен пример того, как R визуализировать это: set.seed(1) x …

1
Насколько эффективно Q-learning с нейронными сетями, когда на одно действие приходится одна единица вывода?
Справочная информация: я использую приближение Q-значения нейронной сети в моей задаче обучения подкрепления. Подход точно такой же, как описанный в этом вопросе , однако сам вопрос другой. В этом подходе количество выходов - это количество действий, которые мы можем предпринять. Иными словами, алгоритм следующий: выполните действие A, изучите награду, попросите …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.