Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Является ли распределение Гаусса частным случаем бета-распределения?
Если вы посмотрите на бета-дистрибутив сα = β= 4αзнак равноβзнак равно4\alpha=\beta=4 он выглядит очень похоже на гауссовский дистрибутив . Но так ли это? Как вы можете доказать, является ли распределение бета (4,4) гауссовым или нет?

5
Возможно ли, что две случайные величины из одного и того же семейства распределений имеют одинаковое ожидание и дисперсию, но разные более высокие моменты?
Я думал о значении масштаба семьи. Насколько я понимаю, для каждого члена семейства масштабов местоположения с параметрами location и scale распределение не зависит от каких-либо параметров и одинаково для каждого принадлежащего этому семейству.XXXaaabbbZ=(X−a)/bZ=(X−a)/bZ =(X-a)/bXXX Итак, мой вопрос: не могли бы вы привести пример, когда два случайных числа из одного семейства …

4
Какова связь между ANOVA для сравнения средств нескольких групп и ANOVA для сравнения вложенных моделей?
До сих пор я видел, как ANOVA используется двумя способами: Во-первых , в моем вводном тексте статистики ANOVA был представлен как способ сравнения средних трех или более групп, как улучшение по сравнению с парным сравнением, чтобы определить, имеет ли одно из средств статистически значимое различие. Во-вторых , в моем статистическом …

1
RMSProp и Адам против SGD
Я выполняю эксперименты на валидации EMNIST, используя сети с RMSProp, Adam и SGD. Я достиг 87% точности с SGD (скорость обучения 0,1) и отсева (0,1 отсева), а также регуляризация L2 (1e-05 штраф). При тестировании точно такой же конфигурации с RMSProp и Adam, а также с начальной скоростью обучения 0,001 я …

1
Причинный эффект при регулировке задней двери и передней двери
Если мы хотим вычислить причинное влияние на Y на приведенном ниже причинном графике, мы можем использовать как теоремы регулировки задней двери, так и теоремы регулировки передней двери, т. Е. P ( y | do ( X = x ) ) = ∑ u P ( y | x , u …

2
Можно ли (теоретически) обучить нейронную сеть с меньшим количеством тренировочных выборок, чем весами?
Прежде всего: я знаю, что для обучения нейронной сети нет общего количества выборок. Это зависит от слишком многих факторов, таких как сложность задачи, шум в данных и так далее. И чем больше у меня будет обучающих образцов, тем лучше будет моя сеть. Но мне было интересно: возможно ли теоретически обучить …

1
Вариационный вывод, дивергенция KL требует истинного
По моему (очень скромному) пониманию вариационного вывода, каждый пытается приблизить неизвестное распределение , найдя распределение q, которое оптимизирует следующее:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Всякий раз, когда я вкладываю время в понимание вариационного вывода, я продолжаю придерживаться этой формулы и не могу не чувствовать, что упускаю суть. Кажется, …

3
Какие алгоритмы требуют горячего кодирования?
Я никогда не уверен, когда использовать одно горячее кодирование для неупорядоченных категориальных переменных, а когда нет. Я использую его всякий раз, когда алгоритм использует метрику расстояния для вычисления сходства. Может ли кто-нибудь дать общее эмпирическое правило относительно того, какие типы алгоритмов требуют, чтобы неупорядоченные категориальные функции были закодированы горячим способом, …

1
Какой алгоритм классификации следует использовать, увидев, что t-SNE хорошо разделяет классы?
Давайте предположим, что у нас есть проблема с классификацией, и сначала мы хотим получить представление о данных, и мы делаем t-SNE. Результат t-SNE очень хорошо разделяет классы. Это подразумевает, что можно построить классификационную модель, которая также будет очень хорошо разделять классы (если t-SNE не разделяет хорошо, это не подразумевает много). …

2
Как мини-пакетный градиентный спуск обновляет веса для каждого примера в пакете?
Если мы обрабатываем, скажем, 10 примеров в пакете, я понимаю, что мы можем суммировать потери для каждого примера, но как работает обратное распространение в отношении обновления весов для каждого примера? Например: Пример 1 -> потеря = 2 Пример 2 -> потеря = -2 Это приводит к средней потере 0 (E …

3
Мотивирующие сигмовидные выходные блоки в нейронных сетях, начиная с ненормализованных логарифмических вероятностей, линейных по
Справочная информация: я изучаю 6-ю главу «Глубокое обучение» Иана Гудфеллоу, Йошуа Бенжио и Аарона Курвилля. В разделе 6.2.2.2 (страницы 182 из 183, которые можно посмотреть здесь ) использование сигмоиды для вывода п( у= 1 | х )п(Yзнак равно1|Икс)P(y=1|x) мотивировано . Чтобы суммировать некоторые материалы, они позволяют быть выходным нейроном до …

3
Есть ли серьезная проблема с отбрасыванием наблюдений с пропущенными значениями при расчете матрицы корреляции?
У меня есть этот огромный набор данных с примерно 2500 переменными и примерно 142 наблюдениями. Я хочу запустить корреляцию между переменной X и остальными переменными. Но для многих столбцов пропущены записи. Я попытался сделать это в R, используя аргумент "pairple-complete" ( use=pairwise.complete.obs), и он вывел кучу корреляций. Но затем кто-то …

2
Keras: почему убыток уменьшается, а val_loss увеличивается?
Я настроил сетку для поиска группы параметров. Я пытаюсь найти лучшие параметры для нейронной сети Keras, которая выполняет бинарную классификацию. Выходное значение равно 1 или 0. Имеется около 200 функций. Когда я сделал поиск по сетке, я получил несколько моделей и их параметры. Лучшая модель имела следующие параметры: Epochs : …


2
Математическая интуиция смещения-дисперсии
Недавно я задал вопрос, пытаясь найти математическую интерпретацию / интуицию за элементарным уравнением, касающимся среднего значения выборки и дисперсии: , геометрическое или иное.E[X2]=Var(X)+(E[X])2E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 Но теперь мне интересно узнать внешне похожее уравнение компромисса смещения. MSE(θ^)=E[(θ^−θ)2]==E[(θ^−E[θ^])2]+(E[θ^]−θ)2Var(θ^)+Bias(θ^,θ)2MSE(θ^)=E[(θ^−θ)2]=E[(θ^−E[θ^])2]+(E[θ^]−θ)2=Var(θ^)+Bias(θ^,θ)2 \begin{eqnarray} \text{MSE}(\hat{\theta}) = E [(\hat{\theta}-\theta)^2 ] &=& E[(\hat{\theta} - E[\hat\theta])^2] + (E[\hat\theta] …
12 variance  bias 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.