Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Тензоры в литературе по нейронным сетям: какое самое простое определение?
В литературе по нейронным сетям часто встречается слово «тензор». Это отличается от вектора? А из матрицы? У вас есть конкретный пример, который разъясняет его определение? Я немного запутался в его определении. Википедия не помогает, и иногда у меня складывается впечатление, что ее определение зависит от конкретной используемой среды машинного обучения …

2
Современные случаи использования машин Больцмана с ограничениями (RBM)?
Справочная информация: Многие современные исследования за последние ~ 4 года (post alexnet ), похоже, отошли от использования генеративной предварительной подготовки для нейронных сетей для достижения современных результатов классификации. Например, лучшие результаты для mnist здесь включают только 2 статьи из 50 лучших, которые, кажется, используют генеративные модели, обе из которых являются …

2
Разница остаточных стандартных ошибок между optim и glm
Я пытаюсь воспроизвести optimрезультаты простой линейной регрессии, снабженной glmили даже nlsR-функциями. Оценки параметров одинаковы, но оценка остаточной дисперсии и стандартные ошибки других параметров не одинаковы, особенно при небольшом размере выборки. Я полагаю, что это из-за различий в способе вычисления остаточной стандартной ошибки между подходами максимального правдоподобия и наименьшего квадрата (деление …

2
Высокая дисперсия распределения р-значений (аргумент в Taleb 2016)
Я пытаюсь понять общую картину, сделанную в Taleb, 2016, «Мета-распределение стандартных значений P» . В нем Талеб приводит следующий аргумент в пользу ненадежности р-значения (насколько я понимаю): Процедура оценки, работающая на точках данных, поступающих из некоторого распределения X, выдает значение ap. Если мы вытянем еще n точек из этого распределения …

1
Обратная регрессия гребня: с учетом матрицы отклика и коэффициентов регрессии, найти подходящих предикторов
Рассмотрим стандартную задачу регрессии OLS \newcommand{\Y}{\mathbf Y}\newcommand{\X}{\mathbf X}\newcommand{\B}{\boldsymbol\beta}\DeclareMathOperator*{argmin}{argmin} : У меня есть матрицы YY\Y и XX\X и я хочу найти ββ\B чтобы минимизировать L=∥Y−Xβ∥2.L=‖Y−Xβ‖2.L=\|\Y-\X\B\|^2. Решение дается β^=argminβ{L}=(X⊤X)+X⊤Y.β^=argminβ⁡{L}=(X⊤X)+X⊤Y.\hat\B=\argmin_\B\{L\} = (\X^\top\X)^+\X^\top \Y. Я также могу поставить «обратную» проблему: учитывая YY\Y и β∗β∗\B^* , найдите X^X^\hat\X , который даст β^≈β∗β^≈β∗\hat\B\approx \B^* , то …

3
Почему не CLT работа для
Итак, мы знаем, что сумма nnn пуассонов с параметром λλ\lambda сама является пуассоном с nλnλn\lambda . Поэтому гипотетически, можно взять x∼poisson(λ=1)x∼poisson(λ=1)x \sim poisson(\lambda = 1) и говорят , что это на самом деле ∑n1xi∼poisson(λ=1)∑1nxi∼poisson(λ=1)\sum_1^n x_i \sim poisson(\lambda = 1) , где каждый из xixix_i есть: xi∼poisson(λ=1/n)xi∼poisson(λ=1/n)x_i \sim poisson(\lambda = 1/n) …

2
Динамический системный взгляд на Центральную предельную теорему?
(Первоначально опубликовано на MSE.) Я видел много эвристических обсуждений классической центральной предельной теоремы, говорящей о нормальном распределении (или любом из устойчивых распределений) как об «аттракторе» в пространстве плотностей вероятностей. Например, рассмотрим эти предложения в верхней части Википедии лечения : В более общем использовании центральная предельная теорема - это любая из …

3
Интуиция за уровнем опасности
Меня смущает уравнение, которое служит определением степени опасности. Я понимаю, что такое уровень опасности, но я просто не понимаю, как уравнение выражает эту интуицию. Если xxx - случайная величина, которая представляет момент времени смерти кого-либо на интервале времени [0,T][0,T][0,T] . Тогда уровень опасности: h(x)=f(x)1−F(x)h(x)=f(x)1−F(x)h(x)=\frac{f(x)}{1-F(x)} Там , где F(x)F(x)F(x) не представляет …

2
Почему F-критерий так чувствителен к предположению о нормальности?
Почему F- критерий для различия в разнице так чувствителен к предположению о нормальном распределении, даже для большого NNN ? Я пытался искать в Интернете и посещал библиотеку, но ни один из них не дал хороших ответов. Это говорит о том, что тест очень чувствителен к нарушению предположения о нормальном распределении, …

1
Кто-нибудь, кроме Эгона Пирсона, получил доступ к газете Госсета 1904 года?
Кто-нибудь кроме Эгона Пирсона получил доступ к докладу Уильяма Сили Госсета 1904 года «Применение« закона ошибки »к работе пивоваренного завода»? Я предполагаю, что это свойство Гиннесса, но, учитывая его историческое значение, было бы очень интересно прочитать, если бы кто-то знал, как достать его.

5
Шестой вариант ответа («Я не знаю») был добавлен к 5-балльной шкале Лайкерта. Данные потеряны?
Мне нужна небольшая помощь в сборе данных из вопросника. Один из моих коллег применил вопросник, но по неосторожности, вместо того, чтобы использовать оригинальную 5-балльную шкалу Лайкерта (категорически не согласен, чтобы полностью согласиться), он вставил 6-й ответ в шкалу. И, что еще хуже, 6-й вариант ответа: «Я не знаю». Проблема заключается …

2
Современное состояние обучения на основе данных 69 года
Я пытаюсь понять контекст знаменитой книги Мински и Пейперта «Перцептроны» 1969 года, столь критичной для нейронных сетей. Насколько я знаю, не было никаких других общих алгоритмов обучения под наблюдением, за исключением персептрона: деревья решений начали становиться действительно полезными только в конце 70-х, случайные леса и SVM - 90-х. Кажется, что …

1
Каретка - повторная перекрестная проверка в K-кратном сравнении с вложенной перекрестной проверкой в ​​K-кратном порядке, повторенная n раз
Пакет caret представляет собой великолепную библиотеку R для построения нескольких моделей машинного обучения и имеет несколько функций для построения и оценки моделей. Для настройки параметров и обучения модели пакет карет предлагает «repeatcv» в качестве одного из методов. Хорошей практикой является то, что настройка параметров может выполняться с использованием вложенной перекрестной …

2
«Все эти точки данных поступают из одного и того же распределения». Как проверить?
Я чувствую, что видел эту тему, обсуждаемую здесь ранее, но не смог найти ничего конкретного. Опять же, я тоже не совсем уверен, что искать. У меня есть одномерный набор упорядоченных данных. Я предполагаю, что все точки в наборе взяты из того же распределения. Как я могу проверить эту гипотезу? Разумно …

1
Следует ли использовать повторную перекрестную проверку для оценки прогностических моделей?
Я наткнулся на эту статью 2012 года, написанную Гитте Ванвинкеленом и Хендриком Блокелом, в которой ставится под сомнение полезность повторной перекрестной проверки, которая стала популярным методом уменьшения дисперсии перекрестной проверки. Авторы продемонстрировали, что, хотя повторная перекрестная проверка действительно уменьшает дисперсию предсказаний модели, поскольку для того же набора данных выборки проводится …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.