Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Визуализировать двумерное биномиальное распределение
Вопрос: как выглядит двумерное биномиальное распределение в трехмерном пространстве? Ниже приведена конкретная функция, которую я хотел бы визуализировать для различных значений параметров; а именно , и .nnnp1p1p_{1}p2p2p_{2} f(x1,x2)=n!x1!x2!px11px22,x1+x2=n,p1+p2=1.f(x1,x2)=n!x1!x2!p1x1p2x2,x1+x2=n,p1+p2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. Обратите внимание, что есть два ограничения; и . Кроме того, является положительным целым числом, скажем, .x1+x2=nx1+x2=nx_{1}+x_{2}=nn …

2
Вероятность того, что расположение Secret Santa приведет к идеальному сочетанию
Итак, у нас был Секретный Санта на работе. Нас 8 человек. Каждый из нас по очереди вытащил маленький кусочек бумаги из миски с именем на нем. Единственное правило: если вы вытягиваете свое имя, вы должны положить лист бумаги обратно в чашу и попробуйте снова. Давайте назовем людей A, B, C, …

3
Являются ли взаимодействия полезными только в контексте регрессии?
Я всегда читал термин взаимодействие в контексте регрессии. Должны ли мы также рассмотреть взаимодействие с различными моделями, например, knn или svm? Если имеется , или даже больше функций и, скажем, наблюдений, как обычно найти полезные взаимодействия? Попробуйте все комбинации? Или использовать только комбинации, которые имеют смысл?505050100100100100010001000

4
Почему меры дисперсии менее интуитивны, чем центральность?
Кажется, что-то в нашем человеческом понимании создает трудности для интуитивного понимания идеи дисперсии. В узком смысле ответ немедленен: квадрат отбрасывает нас от нашего рефлексивного понимания. Но это только дисперсия, которая представляет проблемы, или это вся идея распространения в данных? Мы ищем убежище в диапазонеИли просто указав минимум и максимум, но …

1
Аппроксимация
Я случайно читал статью (по экономике), которая имела следующее приближение для :log(E(X))log⁡(E(X))\log(E(X)) log(E(X))≈E(log(X))+0.5var(log(X))log⁡(E(X))≈E(log⁡(X))+0.5var(log⁡(X))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)) , что автор говорит точно, если X лог-нормально (что я знаю). Чего я не знаю, так это как получить это приближение. Я попытался вычислить приближение Тейлора второго порядка, и все, что я придумал, это …

3
Понимание бета-конъюгата перед байесовским выводом о частоте
Ниже приведен отрывок из «Болстадского введения в байесовскую статистику» . Для всех вас, экспертов, это может быть тривиально, но я не понимаю, как автор приходит к выводу, что нам не нужно делать какую-либо интеграцию для вычисления апостериорной вероятности для некоторого значения . Я понимаю второе выражение, которое представляет собой пропорциональность …

2
Латинская Асимптотика Выборки Гиперкуба
Я пытаюсь построить доказательство для проблемы, над которой я работаю, и одно из допущений, которые я делаю, состоит в том, что множество точек, из которых я беру выборку, плотно по всему пространству. Практически я использую выборку из латинского гиперкуба, чтобы получить свои баллы во всем пространстве выборки. Что я хотел …

2
Успех испытаний Бернулли с разными вероятностями
Если проводится 20 независимых испытаний Бернулли, каждое с различной вероятностью успеха и, следовательно, неудачи. Какова вероятность того, что именно n из 20 испытаний было успешным? Есть ли лучший способ вычисления этих вероятностей, чем просто суммировать комбинации вероятностей успеха и неудачи?

3
Ресурсы для изучения многоцелевых методов?
Я ищу ресурсы (книги, конспекты лекций и т. Д.) О методах обработки данных с несколькими целями (например, три зависимые переменные: 2 дискретные и 1 непрерывная). У кого-нибудь есть ресурсы / знания по этому вопросу? Я знаю, что для этого можно использовать нейронные сети.

2
Два определения p-значения: как доказать их эквивалентность?
Я читаю книгу Ларри Вассермана « Вся статистика» и в настоящее время рассказываю о p-значениях (стр. 187). Позвольте мне сначала ввести некоторые определения (я цитирую): Определение 1 Степенная функция теста с областью отклонения определяется как Размер теста определяется как тест имеет уровень \ alpha, если его размер меньше или равен …

3
Результаты построения графиков, имеющие только среднее значение и стандартное отклонение
Я пытаюсь визуализировать соответствующий график для наблюдений в этой таблице средних значений и стандартных отклонений оценок отзыва: ОтзывконтрольЖадный37SD8экспериментальныйЖадный21SD6ControlExperimentalMeanSDMeanSDRecall378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} Каков наилучший …

1
Непараметрические значения p начальной загрузки в сравнении с доверительными интервалами
контекст Это несколько похоже на этот вопрос , но я не думаю, что это точная копия. Когда вы смотрите, как инструкции о том, как выполнить тест гипотезы начальной загрузки, обычно утверждается, что можно использовать эмпирическое распределение для доверительных интервалов, но что вам нужно правильно запустить загрузку из распределения при нулевой …

3
Всегда ли лучше извлекать больше факторов, когда они существуют?
В отличие от анализа основных компонентов, решения для моделей факторного анализа не обязательно являются вложенными. То есть нагрузки (например) для первого фактора не обязательно будут идентичными, когда извлекается только первый фактор, по сравнению с первыми двумя факторами. Имея это в виду, рассмотрим случай, когда у вас есть набор переменных манифеста, …

1
Как подобрать приблизительный PDF (т.е. оценку плотности), используя первые k (эмпирических) моментов?
У меня есть ситуация, когда я могу оценить (первые) моментов набора данных и хотел бы использовать его для оценки функции плотности.kkk Я уже сталкивался с распределением Пирсона , но понял, что он опирается только на первые 4 момента (с некоторыми ограничениями на возможные комбинации моментов). Я также понимаю, что любого …

1
Алгоритмы встраивания слов с точки зрения производительности
Я пытаюсь вставить примерно 60 миллионов фраз в векторное пространство , а затем вычислить косинусное сходство между ними. Я использовал sklearn CountVectorizerс пользовательской функцией токенизатора, которая создает униграммы и биграммы. Оказывается, чтобы получить осмысленное представление, мне нужно учесть огромное количество столбцов, линейных по количеству строк. Это приводит к невероятно редким …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.