Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Когда слово «уклон» был придуман для среднего
Когда слово «уклон» был придуман для среднего ?E[θ^−θ]E[θ^−θ]\mathbb{E}[\hat{\theta}-\theta] Причина, по которой я сейчас думаю об этом, заключается в том, что я, кажется, вспоминаю Джейнса в его тексте теории вероятностей , критикуя использование слова «смещение», использованного для описания этой формулы, и предлагая альтернативу. Из теории вероятностей Джейнса , раздел 17.2 «Несмещенные …

4
Сходится ли нормальное распределение к равномерному распределению, когда стандартное отклонение растет до бесконечности?
Сходится ли нормальное распределение к определенному, если стандартное отклонение растет без границ? мне кажется, что pdf начинает выглядеть как равномерное распределение с границами, заданными . Это правда?[−2σ,2σ][−2σ,2σ][-2 \sigma, 2 \sigma]

3
Как моделировать данные, чтобы они были статистически значимыми?
Я учусь в 10 классе и собираюсь смоделировать данные для проекта ярмарки машинного обучения. Окончательная модель будет использоваться на данных пациента и будет предсказывать корреляцию между определенным временем недели и влиянием, которое это оказывает на приверженность к лечению в данных одного пациента. Значения приверженности будут двоичными (0 означает, что они …

3
Может ли апостериорная вероятность быть> 1?
В формуле Байеса: P(x|a)=P(a|x)P(x)P(a)P(x|a)=P(a|x)P(x)P(a)P(x|a) = \frac{P(a|x) P(x)}{P(a)} может ли задняя вероятность превысить 1?P(x|a)P(x|a)P(x|a) Я думаю, что это возможно, если, например, предполагая, что и , и . Но я не уверен в этом, потому что это будет означать, что вероятность будет больше единицы?P ( a ) < P ( x ) …

2
Имеет ли смысл использовать логистическую регрессию с двоичным результатом и предиктором?
У меня есть двоичная переменная результата {0,1} и переменная предиктора {0,1}. Я думаю, что не имеет смысла заниматься логистикой, если я не включу другие переменные и не вычислю соотношение шансов. С одним бинарным предиктором не будет ли вычисление вероятности достаточным в сравнении с отношением шансов?

2
Почему максимальный пул необходим в сверточных нейронных сетях?
Наиболее распространенные сверточные нейронные сети содержат слои пула для уменьшения размеров выходных объектов. Почему я не могу достичь того же, просто увеличив шаг сверточного слоя? Что делает необходимым объединение слоев?

11
Термин «количество столбцов» матрицы
Есть ли одно английское слово для обозначения «количества столбцов» матрицы? Например, «размерность» матрицы 2 \ х равна 2 \ х 3 . Мне нужен термин для 3 в этом примере. Конечно, я всегда могу просто сказать «количество столбцов», но могу ли я сказать хоть одно слово?2 × 32 × 32×32\times …

7
Смещенные данные в машинном обучении
Я работаю над проектом машинного обучения с данными, которые уже (сильно) смещены при выборе данных. Предположим, у вас есть набор жестко закодированных правил. Как вы строите модель машинного обучения, чтобы заменить ее, когда все данные, которые она может использовать, являются данными, которые уже были отфильтрованы по этим правилам? Чтобы прояснить …

3
Иконические (игрушечные) модели нейронных сетей
Мои профессора физики в аспирантуре, а также благородный лауреат Фейнман всегда представляли то, что они называли игрушечными моделями, чтобы проиллюстрировать основные понятия и методы в физике, такие как гармонический осциллятор, маятник, волчок и черный ящик. Какие модели игрушек используются для иллюстрации основных концепций и методов, лежащих в основе применения нейронных …

1
Почему t-тест и ANOVA дают разные значения p для сравнения двух групп?
В статье в Википедии об ANOVA говорится В своей простейшей форме ANOVA предоставляет статистическую проверку того, равны ли средние значения нескольких групп, и поэтому обобщает t-критерий для более чем двух групп. Насколько я понимаю, ANOVA - это то же самое, что и t-критерий, когда речь идет о сравнении двух групп. …

6
Линейная регрессия или порядковая логистическая регрессия для прогнозирования рейтинга вина (от 0 до 10)
У меня есть данные вина из здесь , который состоит из 11 числовых независимых переменных с зависимой рейтинг , связанной с каждой записью со значениями от 0 до 10. Это делает его отличный набор данные , чтобы использовать регрессионную модель для изучения взаимосвязи между переменными и ассоциированным рейтинг. Однако будет …

4
Почему Q-Learning использует эпсилон-жадный во время тестирования?
В статье DeepMind о Q-Learning для видеоигр Atari ( здесь ) они используют эпсилон-жадный метод для исследования во время обучения. Это означает, что когда действие выбирается в процессе обучения, оно выбирается либо как действие с наибольшим значением q, либо как случайное действие. Выбор между этими двумя вариантами является случайным и …

2
Предположим, . Показать
Какой самый простой способ убедиться, что следующее утверждение верно? Предположим, . Показать .Y1,…,Yn∼iidExp(1)Y1,…,Yn∼iidExp(1)Y_1, \dots, Y_n \overset{\text{iid}}{\sim} \text{Exp}(1)∑ni=1(Yi−Y(1))∼Gamma(n−1,1)∑i=1n(Yi−Y(1))∼Gamma(n−1,1)\sum_{i=1}^{n}(Y_i - Y_{(1)}) \sim \text{Gamma}(n-1, 1) Обратите внимание, что .Y(1)=min1≤i≤nYiY(1)=min1≤i≤nYiY_{(1)} = \min\limits_{1 \leq i \leq n}Y_i Под X∼Exp(β)X∼Exp(β)X \sim \text{Exp}(\beta) это означает, что fX(x)=1βe−x/β⋅1{x>0}fX(x)=1βe−x/β⋅1{x>0}f_{X}(x) = \dfrac{1}{\beta}e^{-x/\beta} \cdot \mathbf{1}_{\{x > 0\}} . Легко видеть, что …

4
Теоретическая мотивация использования логарифмического правдоподобия и правдоподобия
Я пытаюсь понять на более глубоком уровне повсеместность логарифмической вероятности (и, возможно, в более общем смысле логарифмической вероятности) в статистике и теории вероятностей. Логарифмические вероятности проявляются повсеместно: мы обычно работаем с логарифмической вероятностью для анализа (например, для максимизации), информация Фишера определяется в терминах второй производной логарифмической вероятности, энтропия - это …

2
Есть ли предположение о логистической регрессии?
Есть ли предположение о переменной ответа логистической регрессии? Например, предположим, у нас есть точек данных. Похоже, что ответ исходит из дистрибутива Бернулли с . Следовательно, мы должны иметь распределений Бернулли с другим параметром .Y i p i = логит ( β 0 + β 1 x i ) 1000 р100010001000YiYiY_ipi=logit(β0+β1xi)pi=logit(β0+β1xi)p_i=\text{logit}(\beta_0+\beta_1 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.