Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Источники для изучения (не только бега) статистики / математики через R
Мне интересны примеры источников (R-код, R-пакеты, книги, главы книг, статьи, ссылки и т. Д.) Для изучения статистических и математических понятий через R (это также может быть и через другие языки, но R - мой любимый вариант). Проблема в том, что изучение материала основано на программировании, а не только на том, …

3
Сравнение и противопоставление, p-значения, уровни значимости и ошибка типа I
Мне было интересно, если кто-нибудь мог бы дать краткое изложение в отношении определений и использования значений p, уровня значимости и ошибки типа I. Я понимаю, что значения p определяются как «вероятность получения тестовой статистики, по крайней мере, такой же экстремальной, как та, которую мы наблюдали на самом деле», тогда как …

4
Почему решение наименьших квадратов дает плохие результаты в этом случае?
На странице 204 в главе 4 «Распознавание образов и машинное обучение» Бишопа есть изображение, где я не понимаю, почему решение по методу наименьших квадратов дает плохие результаты: Предыдущий абзац был о том факте, что решениям наименьших квадратов не хватает устойчивости к выбросам, как вы видите на следующем изображении, но я …

5
Новый революционный способ добычи данных?
Следующий отрывок взят из интервью Швагера «Рынок хедж-фондов Wizzards» (май 2012 года) с постоянно успешным менеджером хедж-фонда Джаффреем Вудриффом: На вопрос: «Каковы некоторые из худших ошибок, которые люди допускают при извлечении данных?»: Многие люди думают, что они в порядке, потому что они используют данные в выборке для обучения и данные …

1
Остаточная диагностика в регрессионных моделях на основе MCMC
Недавно я приступил к подгонке регрессионно-смешанных моделей в байесовской структуре, используя алгоритм MCMC (функция MCMCglmm в R на самом деле). Я полагаю, что я понял, как диагностировать сходимость процесса оценки (след, график Гьюке, автокорреляция, апостериорное распределение ...). Одна из вещей, которая поражает меня в байесовской структуре, - это то, что …

3
Что говорит о моих данных неположительно определенная ковариационная матрица?
У меня есть несколько многовариантных наблюдений, и я хотел бы оценить плотность вероятности по всем переменным. Предполагается, что данные нормально распределены. При небольших количествах переменных все работает так, как я ожидал, но переход к большим числам приводит к тому, что ковариационная матрица становится не положительно определенной. Я уменьшил проблему в …

4
Важность предикторов в множественной регрессии: частичное против стандартизированных коэффициентов
Мне интересно, какова точная связь между частичным и коэффициентами в линейной модели и должен ли я использовать только один или оба, чтобы проиллюстрировать важность и влияние факторов.R2R2R^2 Насколько я знаю, с помощью summaryя получаю оценки коэффициентов, а с anovaсуммой квадратов для каждого фактора - доля суммы квадратов одного фактора, деленная …

3
Укладка / сборка моделей с кареткой
Я часто нахожу себя обучающим несколько различных прогностических моделей с использованием caretR. Я тренирую их все по одним и тем же сгибам перекрестной проверки, используя caret::: createFolds, а затем выбираю лучшую модель, основанную на перекрестно проверенной ошибке. Тем не менее, медианный прогноз из нескольких моделей часто превосходит лучшую единственную модель …
21 r  caret  ensemble 

1
Как я могу выровнять / синхронизировать два сигнала?
Я провожу некоторые исследования, но застрял на этапе анализа (следовало бы уделять больше внимания моим статистическим лекциям). Я собрал два одновременных сигнала: скорость потока, интегрированная для объема, и изменение объема груди. Я хотел бы сравнить сигналы и в конечном итоге надеяться получить объем из сигнала расширения груди. Но сначала я …

1
Когда марковские случайные поля экспоненциальные семейства?
В учебнике, графические моделях, экспоненциальная семье и вариационные умозаключениях , М. Иордане и М. Уэйнрайт обсуждается связь между экспоненциальными семействами и марковскими случайными полей (неориентированные графические моделями). Я пытаюсь лучше понять отношения между ними с помощью следующих вопросов: Все ли MRF являются членами Экспоненциальных семей? Могут ли все члены из …

4
Разница между регрессионным анализом и дисперсионным анализом?
Этот вопрос был перенесен из Математического стека обмена, потому что на него можно ответить по перекрестной проверке. Мигрировал 7 лет назад . Сейчас я учусь регрессионному анализу и анализу отклонений. В регрессионном анализе у вас есть одна фиксированная переменная, и вы хотите знать, как переменная идет с другой переменной. При …
21 regression 

3
Первый шаг для больших данных ( , )
Предположим, вы анализируете огромный набор данных из миллиардов наблюдений в день, где каждое наблюдение имеет несколько тысяч разреженных и, возможно, избыточных числовых и категориальных переменных. Скажем, есть одна проблема регрессии, одна проблема неуравновешенной двоичной классификации и одна задача «выяснить, какие предикторы являются наиболее важными». Моя мысль о том, как подойти …

2
Как мы можем ограничить вероятность того, что случайная величина максимальна?
\newcommand{\P}{\mathbb{P}} Предположим, у нас есть NNN независимых случайных величин X1X1X_1 , ……\ldots , XnXnX_n с конечными средними μ1≤…≤μNμ1≤…≤μN\mu_1 \leq \ldots \leq \mu_N и дисперсиями σ21σ12\sigma_1^2 , ……\ldots , σ2NσN2\sigma_N^2 . Я ищу границы без распределения для вероятности того, что любой Xi≠XNXi≠XNX_i \neq X_N больше, чем все другие XjXjX_j , j≠ij≠ij …

3
Спс, когда размерность больше количества образцов
Я столкнулся со сценарием, где у меня есть 10 сигналов на человека на 10 человек (таким образом, 100 выборок), содержащих 14000 точек данных (измерений), которые мне нужно передать в классификатор. Я хотел бы уменьшить размерность этих данных, и PCA, кажется, является способом сделать это. Тем не менее, мне удалось найти …

2
«Намерение исследователя» и пороговые значения / p-значения
Я читаю слайды Джона Крушке «Анализ байесовских данных» , но на самом деле у меня есть вопрос о его интерпретации t-тестов и / или всей основы тестирования значимости нулевой гипотезы. Он утверждает, что p-значения плохо определены, потому что они зависят от намерений следователя. В частности, он приводит пример (страницы 3-6) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.