Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Вывод модели 2-гауссовой смеси с MCMC и PyMC
Проблема Я хочу соответствовать модельным параметрам простой 2-гауссовой смеси населения. Учитывая всю шумиху вокруг байесовских методов, я хочу понять, является ли для этой проблемы байесовский вывод лучшим инструментом, чем традиционные методы подбора. Пока MCMC работает очень плохо в этом игрушечном примере, но, возможно, я просто что-то упустил. Итак, давайте посмотрим …

2
Как изменить порог для классификации в R randomForests?
Вся литература по моделированию распределения видов предполагает, что при прогнозировании присутствия / отсутствия вида с использованием модели, которая выводит вероятности (например, RandomForests), важен выбор пороговой вероятности, с помощью которой можно фактически классифицировать вид как присутствие или отсутствие, и следует не всегда полагаться на значение по умолчанию 0,5. Мне нужна помощь …

1
Стандартное отклонение экспоненциально-взвешенного среднего
Я написал простую функцию в Python для вычисления экспоненциально взвешенного среднего: def test(): x = [1,2,3,4,5] alpha = 0.98 s_old = x[0] for i in range(1, len(x)): s = alpha * x[i] + (1- alpha) * s_old s_old = s return s Тем не менее, как я могу рассчитать соответствующий …

2
Как статистика Чи-квадрат Пирсона приближается к распределению Чи-квадрат
Таким образом, если статистика Пиарсона Chi Squared дана для таблицы , то ее форма:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Тогда это приближается к , распределению хи-квадрат с степенями свободы, поскольку размер выборки становится больше. н - 1 нχ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Я не понимаю, как работает это асимптотическое приближение. Я чувствую, что в …

2
Какова максимальная оценка вероятности ковариации двумерных нормальных данных, когда известны среднее значение и дисперсия?
Предположим, у нас есть случайная выборка из двумерного нормального распределения, которая имеет нули в качестве средних значений и единицы в качестве дисперсий, поэтому единственным неизвестным параметром является ковариация. Что такое MLE ковариации? Я знаю, что это должно быть что-то вроде но откуда мы это знаем?1n∑nj=1xjyj1n∑j=1nxjyj\frac{1}{n} \sum_{j=1}^{n}x_j y_j

1
Почему в пакетах используются образцы начальной загрузки?
Пакетирование - это процесс создания N учащихся на N различных выборках начальной загрузки, а затем на основе их прогнозов. Мой вопрос: почему бы не использовать любой другой тип отбора проб? Зачем использовать образцы начальной загрузки?
10 bagging 

2
Обобщенный логарифмический критерий отношения правдоподобия для не вложенных моделей
Я понимаю, что если у меня есть две модели A и B и A вложено в B, то, учитывая некоторые данные, я могу подобрать параметры A и B с помощью MLE и применить обобщенный тест логарифмического отношения правдоподобия. В частности, распределение теста должно быть с степенями свободы , где есть …

2
Выбор каретки для модели randomForest
У меня проблемы с пониманием того, как varImpфункция работает для модели randomForest с caretпакетом. В приведенном ниже примере функция var3 получает нулевую важность с помощью varImpфункции caret , но базовая конечная модель randomForest имеет ненулевую важность для функции var3. Почему это так? require(randomForest) require(caret) rf <- train(x, y, method = …
10 r  caret  random-forest 

2
Вмешательство с дифференцированием
При проведении анализа вмешательства с данными временного ряда (также известного как Прерванный временной ряд), как обсуждалось здесь, например, одно из требований, которое у меня есть, - оценить общий выигрыш (или убыток) от вмешательства - то есть количество единиц, полученных или потерянных (переменная Y ). Не совсем понимая, как оценивать функцию …

1
Является ли удерживающая проверка лучшей аппроксимацией «получения новых данных», чем k-кратное резюме?
Я переосмыслил ответ, который дал на вопрос пару недель назад Удерживающая перекрестная проверка дает один набор тестов, который можно многократно использовать для демонстрации. Похоже, мы все согласны с тем, что это во многих отношениях является отрицательной чертой, поскольку один протяженный набор может оказаться непредставительным из-за случайности. Более того, вы можете …

4
Динамическое искажение времени для нерегулярных временных рядов
В последнее время я много читал о динамической деформации времени (DTW). Я очень удивлен, что вообще нет литературы по применению DTW к нерегулярным временным рядам, или, по крайней мере, я не смог ее найти. Кто-нибудь может дать мне ссылку на что-то, связанное с этой проблемой, или, может быть, даже на …

2
Должны ли типы данных (номинальные / порядковые / интервалы / отношения) действительно рассматриваться как типы переменных?
Так, например, вот определения, которые я получаю из стандартных учебников Переменная - характеристика популяции или выборки. ех. Цена акции или оценки на тест Данные - фактические наблюдаемые значения Итак, для отчета из двух столбцов [Имя | Income] имена столбцов будут переменными и фактическими наблюдаемыми значениями {dave | 100K}, {Джим | …

3
Возможно ли в R (или вообще) заставить коэффициенты регрессии быть определенным знаком?
Я работаю с некоторыми реальными данными, и регрессионные модели дают противоречивые результаты. Обычно я доверяю статистике, но на самом деле некоторые из этих вещей не могут быть правдой. Основная проблема, которую я вижу, состоит в том, что увеличение одной переменной вызывает увеличение отклика, когда на самом деле они должны иметь …

2
Стабильные распределения, которые можно умножить?
Стабильные распределения инвариантны относительно сверток. Какие подсемейства устойчивых распределений также замкнуты относительно умножения? В том смысле, что если f ∈ F и g ∈ F , то функция плотности вероятности произведения f ⋅ g (с точностью до константы нормализации) также принадлежит F ?FFFе∈ Ff∈Ff\in Fг∈ Fg∈Fg\in F е⋅ гf⋅gf \cdot …

2
Честная монета подбрасывается, пока в первый раз не поднимется голова. Вероятность того, что это произойдет при броске нечетного числа, равна?
Честная монета подбрасывается, пока в первый раз не поднимется голова. Вероятность того, что это произойдет при броске нечетного числа, равна? Как мне подойти к этой проблеме?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.