Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как создать произвольную ковариационную матрицу
Например, в R, MASS::mvrnorm()функция полезна для генерации данных, чтобы продемонстрировать различные вещи в статистике. Он принимает обязательный Sigmaаргумент, который представляет собой симметричную матрицу, определяющую ковариационную матрицу переменных. Как бы я создал симметричную матрицу с произвольными записями?n×nn×nn\times n

2
Почему функция softmax используется для вычисления вероятностей, хотя мы можем разделить каждое значение на сумму вектора?
Применение функции softmax к вектору даст «вероятности» и значения между и . 000111 Но мы также можем разделить каждое значение на сумму вектора, и это даст вероятности и значения между и .000111 Я прочитал ответ здесь, но он говорит, что причина в том, что он дифференцируем, хотя обе функции дифференцируемы.

2
В чем разница между инициализатором масштабирования дисперсии и инициализатором xavier?
Я обнаружил, что в реализации ResNet от Tensorflow они используют инициализатор дисперсионного масштабирования, а также популярный инициализатор xavier . У меня нет большого опыта в этом, что лучше на практике?

5
Каков интуитивный смысл наличия линейных отношений между логами двух переменных?
У меня есть две переменные, которые не показывают большой корреляции при построении графика друг против друга, как есть, но очень четкие линейные отношения, когда я строю журналы каждой переменной против другой. Таким образом, я бы в конечном итоге с моделью типа: log(Y)=alog(X)+blog⁡(Y)=alog⁡(X)+b\log(Y) = a \log(X) + b , что математически …

1
lme () и lmer () дают противоречивые результаты
Я работал с некоторыми данными, которые имеют некоторые проблемы с повторными измерениями. При этом я заметил очень различное поведение lme()и lmer()использование моих тестовых данных и хочу знать почему. Поддельный набор данных, который я создал, содержит измерения роста и веса для 10 предметов, взятых дважды каждый. Я настроил данные так, чтобы …

9
Переоснащение и подгонка
Я провел некоторое исследование о переоснащении и подборе снаряжения, и я понял, что именно они есть, но я не могу найти причины. Каковы основные причины переоснащения и недостаточного оснащения? Почему мы сталкиваемся с этими двумя проблемами при обучении модели?

4
Пример неотрицательного дискретного распределения, где среднее (или другой момент) не существует?
Я немного поработал над scipy, и с одним из членов основной группы scipy зашел разговор о том, может ли неотрицательная дискретная случайная величина иметь неопределенный момент. Я думаю, что он прав, но доказательств нет. Кто-нибудь может показать / доказать это утверждение? (или если это утверждение не соответствует действительности, опровергнуть) У …

2
FPR (уровень ложных срабатываний) против FDR (уровень ложных обнаружений)
Следующая цитата взята из известной исследовательской работы « Статистическое значение для широких геномных исследований», проведенной Storey & Tibshirani (2003): Например, ложноположительный показатель 5% означает, что в среднем 5% истинно нулевых признаков в исследовании будут названы значимыми. FDR (уровень ложного обнаружения), равный 5%, означает, что среди всех функций, называемых значимыми, 5% …

3
Найти способ симулировать случайные числа для этого распределения
Я пытаюсь написать программу на R, которая имитирует псевдослучайные числа из распределения с помощью кумулятивной функции распределения: F( х ) = 1 - опыт( - а х - бр + 1Икср + 1) ,х ≥ 0F(Икс)знак равно1-ехр⁡(-aИкс-бп+1Иксп+1),Икс≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 гдеa , b > 0 , p …

1
Регрессия для категориальных независимых переменных и непрерывно зависимых
Я просто понял, что у меня всегда работала проблема регрессии, где независимые переменные всегда были числовыми. Могу ли я использовать линейную регрессию в случае, когда все независимые переменные являются категориальными?

4
Является ли повседневная вероятность просто способом борьбы с неизвестным (не говоря уже о квантовой физике)?
Кажется, что в повседневной вероятности (а не в квантовой физике) вероятности действительно являются заменой неизвестного. Возьмите монетку например. Мы говорим, что это «случайно», 50% -ое изменение головы и 50% -ый шанс хвоста. Однако, если бы я точно знал плотность, размер и форму монеты; плотность воздуха; с какой силой перевернулась монета; …

3
Понимание параметра input_shape в LSTM с помощью Keras
Я пытаюсь использовать пример, описанный в документации Keras, под названием «Stacked LSTM для классификации последовательностей» (см. Код ниже) и не могу определить input_shapeпараметр в контексте моих данных. В качестве входных данных у меня есть матрица последовательностей из 25 возможных символов, закодированных в целых числах в дополненную последовательность максимальной длины 31. …
20 lstm  keras  shape  dimensions 

1
Почему LASSO не находит мою идеальную пару предикторов в высокой размерности?
Я провожу небольшой эксперимент с регрессией LASSO в R, чтобы проверить, сможет ли она найти идеальную пару предикторов. Пара определяется следующим образом: f1 + f2 = исход Результатом здесь является предопределенный вектор, называемый «возраст». F1 и f2 создаются путем взятия половины вектора возраста и установки остальных значений в 0, например: …

4
Если несколько сравнений «запланированы», нужно ли вам исправлять множественные сравнения?
Я рецензирую статью, в которой было выполнено> 15 отдельных тестов хи-квадрат 2х2. Я предположил, что им нужно исправить множественные сравнения, но они ответили, что все сравнения были запланированы, и поэтому в этом нет необходимости. Я чувствую, что это не должно быть правильно, но я не могу найти никаких ресурсов, которые …

5
Пример, где принцип правдоподобия * действительно * имеет значение?
Существует ли пример, в котором два различных защищаемых теста с пропорциональными правдоподобиями приведут один к заметно различным (и одинаково оправданным) выводам, например, где значения p на порядок величин далеко друг от друга, но мощность альтернатив аналогична? Все примеры, которые я вижу, очень глупы, сравнивая бином с отрицательным биномом, где значение …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.