Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Когда центральная предельная теорема и закон больших чисел не согласны
По сути, это повторение вопроса, который я нашел на math.se , который не получил ответов, на которые я надеялся. Пусть {Xi}i∈N{Xi}i∈N\{ X_i \}_{i \in \mathbb{N}} - последовательность независимых одинаково распределенных случайных величин с E[Xi]=1E[Xi]=1\mathbb{E}[X_i] = 1 и .V[Xi]=1V[Xi]=1\mathbb{V}[X_i] = 1 Рассмотрим оценку limn→∞P(1n−−√∑i=1nXi≤n−−√)limn→∞P(1n∑i=1nXi≤n) \lim_{n \to \infty} \mathbb{P}\left(\frac{1}{\sqrt{n}} \sum_{i=1}^n X_i \leq …

3
Является ли пень решения линейной моделью?
Пень решений - это дерево решений с одним разделением. Его также можно записать как кусочную функцию. Например, предположим, что xxx является вектором, а x1x1x_1 является первым компонентом xxx , в настройке регрессии может быть принят некоторый пень решения f(x)={35x1≤2x1>2f(x)={3x1≤25x1>2f(x)= \begin{cases} 3& x_1\leq 2 \\ 5 & x_1 > 2 \\ …

5
Что в названии: гиперпараметры
Таким образом, в нормальном распределении у нас есть два параметра: среднее значение и дисперсия . В книге « Распознавание образов и машинное обучение» внезапно появляется гиперпараметр в терминах регуляризации функции ошибок.μμ\muσ2σ2\sigma^2λλ\lambda Какие гиперпараметры? Почему они названы таковыми? И как они интуитивно отличаются от параметров в целом?

3
Чему следует учить в первую очередь: вероятность или статистика?
Я недавно присоединился как преподаватель в математическом отделе. известного учреждения. Я буду преподавать курс вероятности и статистики на уровне бакалавриата. В этом учебном заведении уже есть учебная программа, которая меня не очень устраивает. В этом учебном плане сначала рассматривается статистика, а также отсутствует часть оценки. Я всегда считал, что основы …
19 teaching 

3
Как , полярная координата, распределяется, когда и когда ?
Пусть декартовы координаты случайной точки выбраны st .x,yx,yx,y(x,y)∼U(−10,10)×U(−10,10)(x,y)∼U(−10,10)×U(−10,10)(x,y) \sim U(-10,10) \times U(-10,10) Таким образом, радиус, , не равномерно распределены как следует из «ы PDF .ρ=x2+y2−−−−−−√ρ=x2+y2\rho = \sqrt{x^2 + y^2}ρρ\rho Тем не менее, я ожидал бы, что будет почти равномерным, исключая артефакты из-за 4 остатков по краям:θ=arctanyxθ=arctan⁡yx\theta = \arctan{\frac{y}{x}} Ниже приведены …

2
Может ли регуляризация быть полезной, если мы заинтересованы только в моделировании, а не в прогнозировании?
Может ли регуляризация быть полезной, если мы заинтересованы только в оценке (и интерпретации) параметров модели, а не в прогнозировании или прогнозировании? Я вижу, как регуляризация / перекрестная проверка чрезвычайно полезна, если ваша цель состоит в том, чтобы делать хорошие прогнозы на основе новых данных. Но что, если вы занимаетесь традиционной …

1
Антоним дисперсии
Есть ли слово, которое означает «обратная дисперсия»? То есть, если имеет высокую дисперсию, то X имеет низкую … ? Не заинтересованы в близком антониме (например, «соглашение» или «сходство»), но конкретно означают 1 / σ 2 ?XXXXXX……\dots1/σ21/σ21/\sigma^2


5
Какие хорошие наборы данных для изучения основных алгоритмов машинного обучения и почему?
Я новичок в машинном обучении и ищу некоторые наборы данных, с помощью которых я могу сравнить и сравнить различия между различными алгоритмами машинного обучения (Деревья решений, Повышение, SVM и Нейронные сети) Где я могу найти такие наборы данных? Что я должен искать при рассмотрении набора данных? Было бы здорово, если …

2
Почему оценка максимального правдоподобия считается частой техникой
Статистика для меня - это синоним попытки принять решение, подходящее для всех возможных выборок. Т.е., правило принятия решений для частых всегда должно пытаться свести к минимуму частый риск, который зависит от функции потерь и истинного состояния природы :L θ 0δδ\deltaLLLθ0θ0\theta_0 Rfreq=Eθ0(L(θ0,δ(Y))Rfreq=Eθ0(L(θ0,δ(Y))R_\mathrm{freq}=\mathbb{E}_{\theta_0}(L(\theta_0,\delta(Y)) Как оценка максимального правдоподобия связана с частым риском? Учитывая, …

8
Почему дисперсия не определяется как разница между каждым значением, следующим друг за другом?
Это может быть простой вопрос для многих, но вот он: Почему дисперсия не определяется как разница между всеми значениями, следующими друг за другом, а не как разница между средними значениями? Это был бы более логичный выбор для меня, я думаю, что я, очевидно, наблюдаю за некоторыми недостатками. Благодарность РЕДАКТИРОВАТЬ: Позвольте …
19 variance 

2
Повышение: почему скорость обучения называется параметром регуляризации?
Параметр скорости обучения ( ) в Gradient Boosting сокращает вклад каждой новой базовой модели - обычно мелкого дерева - который добавляется в серию. Было показано, что резко повышается точность набора тестов, что понятно, так как при меньших шагах минимум функции потерь может быть достигнут более точно. ν∈ [ 0 , …

1
Использование круговых предикторов в линейной регрессии
Я пытаюсь подобрать модель, используя данные о ветре (0, 359) и время суток (0, 23), но я обеспокоен тем, что они плохо вписываются в линейную регрессию, поскольку сами по себе они не являются линейными параметрами. Я хотел бы преобразовать их с помощью Python. Я видел некоторые упоминания о вычислении среднего …

3
Важность узла смещения в нейронных сетях
Мне любопытно узнать, насколько важен узел смещения для эффективности современных нейронных сетей. Я легко могу понять, что это может быть важно в мелкой сети с несколькими входными переменными. Однако современные нейронные сети, такие как глубокое обучение, часто имеют большое количество входных переменных, чтобы решить, запущен ли определенный нейрон. Будет ли …

3
Юлия: Подводя итоги, как дела
Этот пост относится к быстро меняющемуся событию. Я столкнулся с вопросом 2012 года, в котором было очень хорошее обсуждение Джулии как альтернативы R / Python для различных типов статистических работ. Здесь лежит оригинальный вопрос 2012 года об обещании Юлии К сожалению, тогда Юлия была очень новичком, а наборы инструментов, необходимые …
19 r  python  computing  julia 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.