Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
От байесовских сетей к нейронным сетям: как многомерная регрессия может быть перенесена в сеть с несколькими выходами
Я имею дело с байесовской иерархической линейной моделью , здесь описывается сеть. представляет ежедневные продажи продукта в супермаркете (наблюдается).YYY - известная матрица регрессоров, включая цены, акции, день недели, погоду, праздники.XXX - неизвестный уровень скрытого запаса каждого продукта, который вызывает большинство проблем и который я считаю вектором двоичных переменных, по одному …

1
Есть ли какое-либо интуитивное объяснение того, почему логистическая регрессия не будет работать в случае идеального разделения? И почему добавление регуляризации это исправит?
У нас много хороших дискуссий по поводу идеального разделения в логистической регрессии. Например, логистическая регрессия в R привела к идеальному разделению (феномен Хаука-Доннера). Что теперь? и модель логистической регрессии не сходится . Лично я все еще чувствую, что это не интуитивно понятно, почему это будет проблемой и почему добавление регуляризации …

1
Можно ли доверять адаптивному MCMC?
Я читаю об адаптивном MCMC (см., Например, главу 4 « Справочника цепи Маркова Монте-Карло» , изд. Brooks et al., 2011; а также Andrieu & Thoms, 2008 ). Основной результат Roberts and Rosenthal (2007) состоит в том, что если схема адаптации удовлетворяет исчезающему условию адаптации (плюс некоторая другая техническая специфика), адаптивный …

5
Допущения множественной регрессии: чем предположение о нормальности отличается от предположения о постоянной дисперсии?
Я прочитал, что это условия для использования модели множественной регрессии: остатки модели почти нормальные, изменчивость остатков почти постоянна остатки независимы, и каждая переменная линейно связана с результатом. Чем отличаются 1 и 2? Вы можете увидеть один здесь прямо: Таким образом, вышеприведенный график говорит, что остаток, составляющий 2 стандартных отклонения, находится …

6
Заполнение матрицы корреляции 3x3: два коэффициента из трех данных
Мне задали этот вопрос в интервью. Допустим, у нас есть корреляционная матрица вида ⎡⎣⎢10.60.80.61γ0.8γ1⎤⎦⎥[10.60.80.61γ0.8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Меня попросили найти значение гаммы, учитывая эту матрицу корреляции. Я думал, что мог бы что-то сделать с собственными значениями, поскольку все они должны быть больше или равны 0. (Матрица должна быть положительной полуопределенной) - но я …

2
Доказательство того, что F-статистика следует F-распределению
В свете этого вопроса: Доказательство того, что коэффициенты в модели OLS следуют t-распределению с (nk) степенями свободы Я хотел бы понять, почему F=(TSS−RSS)/(p−1)RSS/(n−p),F=(TSS−RSS)/(p−1)RSS/(n−p), F = \frac{(\text{TSS}-\text{RSS})/(p-1)}{\text{RSS}/(n-p)}, где - число параметров модели, а - число наблюдений, а - полная дисперсия, - остаточная дисперсия, следует распределению .n T S S R S …

1
Вой, вызванный использованием ступенчатой ​​регрессии
Мне хорошо известны проблемы пошагового / прямого / обратного отбора в регрессионных моделях. Есть многочисленные случаи, когда исследователи осуждали методы и указывали на лучшие альтернативы. Мне было любопытно, существуют ли какие-либо истории, где существует статистический анализ: использовал ступенчатую регрессию; сделал некоторые важные выводы на основе окончательной модели заключение было неверным, …

3
Делаете правильную статистику в рабочей среде?
Я не уверен, к чему относится этот вопрос: перекрестная проверка или рабочее место. Но мой вопрос смутно связан со статистикой. Этот вопрос (или, я думаю, вопросы) возник во время моей работы в качестве "стажера по науке о данных". Я строил эту модель линейной регрессии и изучал остаточный график. Я видел …
20 careers 

5
Бросайте кубик, пока он не попадет на любое число, кроме 4. Какова вероятность того, что результат> 4?
Игроку предоставляется честный шестигранный кубик. Чтобы выиграть, она должна бросить число больше 4 (то есть 5 или 6). Если она бросает 4, она должна катиться снова. Каковы ее шансы на победу? Я думаю, что вероятность выигрыша , может быть выражена рекурсивно как:P(W)P(W)P(W) P(W)=P(r=5∪r=6)+P(r=4)⋅P(W)P(W)=P(r=5∪r=6)+P(r=4)⋅P(W) P(W) = P(r = 5 \cup r …

1
Гауссовские процессы в вейвлет-области: что такое ковариация?
Я читал Марауна и др. «Нестационарные гауссовские процессы в вейвлет-области: синтез, оценка и значимое тестирование» (2007), в котором определяется класс нестационарных ГП, которые можно задавать умножителями в вейвлет-области. Реализация одного такого GP: Где η ( т ) является белым шумом, W г является непрерывное вейвлетпреобразование по отношению к вейвлет г …

3
Чтобы максимизировать вероятность правильного угадывания результата броска монеты, должен ли я всегда выбирать наиболее вероятный результат?
Это не домашнее задание. Мне интересно понять, правильна ли моя логика в этой простой задаче статистики. Допустим, у меня есть двусторонняя монета, в которой вероятность перевернуть голову равна а вероятность перевернуть хвост - . Давайте предположим, что все сальто имеют независимые вероятности. Теперь, скажем, я хочу максимально увеличить свои шансы …

1
Как мы можем моделировать из геометрической смеси?
Если - известные плотности, из которых я могу смоделировать, т. Е. Для которых доступен алгоритм. и если продукт является интегрируемым, существует ли общий подход для моделирования на основе этой плотности продукта с использованием симуляторы от ?k ∏ i = 1 f i ( x ) α if1,…,fkf1,…,fkf_1,\ldots,f_kf i∏i=1kfi(x)αiα1,…,αk>0∏i=1kfi(x)αiα1,…,αk>0\prod_{i=1}^k f_i(x)^{\alpha_i}\qquad \alpha_1,\ldots,\alpha_k>0fifif_i

4
В чем разница между обучением и умозаключением?
В научных работах по машинному обучению часто рассматриваются обучение и умозаключение как две отдельные задачи, но мне не совсем понятно, в чем заключается различие. В этой книге , например , они используют байесовской статистики для обоих видов задач, но не обеспечивают мотивацию для этого различия. У меня есть несколько расплывчатых …

3
Почему AUC = 1, даже классификатор неправильно классифицировал половину выборок?
Я использую классификатор, который возвращает вероятности. Для расчета AUC я использую pROC R-пакет. Вероятности выхода из классификатора: probs=c(0.9865780, 0.9996340, 0.9516880, 0.9337157, 0.9778576, 0.8140116, 0.8971550, 0.8967585, 0.6322902, 0.7497237) probsпоказывает вероятность быть в классе «1». Как показано, классификатор классифицировал все образцы в классе «1». Истинный вектор метки: truel=c(1, 1, 1, 1, 1, …

9
Откуда мы знаем, что вероятность прокатки 1 и 2 равна 1/18?
Начиная с моего первого класса вероятности я задавался вопросом о следующем. Вычисление вероятностей обычно вводится через отношение «предпочтительных событий» к общему числу возможных событий. В случае броска двух шестигранных кубиков количество возможных событий составляет , как показано в таблице ниже.363636 1234561( 1 , 1 )( 2 , 1 )( 3 …
20 probability  dice 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.