Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Каковы ограничения методов ядра и когда использовать методы ядра?
Методы ядра очень эффективны во многих контролируемых задачах классификации. Итак, каковы ограничения методов ядра и когда использовать методы ядра? Каковы успехи методов ядра, особенно в эпоху крупномасштабных данных? В чем разница между методами ядра и обучением нескольких экземпляров? Если данные есть 500x10000, 500это количество отсчетов и 10000размерность каждого признака, то …


1
Какой статистический тест следует использовать для проверки обогащения списков генов?
Я провел эксперимент, чтобы проверить клеточную чувствительность к определенному агенту повреждения ДНК. Мы обнаружили 270 генов, которые были специфически чувствительны к препарату, и общее количество проанализированных генов составило 3668. 38 из 270 чувствительных генов классифицируются как «гены репарации ДНК». Если количество «генов репарации ДНК», содержащихся в геноме, равно 112, а …

1
В чем разница между вероятностью и нечеткой логикой?
Я работал с нечеткой логикой (FL) в течение многих лет, и я знаю, что существуют различия между FL и вероятностью, особенно в отношении того, как FL справляется с неопределенностью. Однако я хотел бы спросить, какие еще существуют различия между FL и вероятностью? Другими словами, если я имею дело с вероятностями …
10 bayes  fuzzy 

1
Что такое исправления Гомеля Хохберга?
Недавно я познакомился с исправлениями Гомеля Хохберга. Я пытаюсь найти простое объяснение того, что это на самом деле / ​​делает, но мне не повезло. Может ли кто-нибудь дать краткое и простое описание поправок Гомеля Хохберга?

1
Лог вероятности для GLM
В следующем коде я выполняю логистическую регрессию для сгруппированных данных, используя glm, и «вручную», используя mle2. Почему функция logLik в R дает мне вероятность логирования logLik (fit.glm) = - 2.336, отличную от той, что logLik (fit.ml) = - 5.514, которую я получаю вручную? library(bbmle) #successes in first column, failures in …

3
Оценка параметра равномерного распределения: неправильный априор?
У нас есть N выборок из равномерного распределения где неизвестно. Оцените из данных.XiXiX_iθ θ[0,θ][0,θ][0,\theta]θθ\thetaθθ\theta Итак, правило Байеса ... f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} и вероятность: 0≤Xi≤θif(Xi|θ)=∏Ni=11θf(Xi|θ)=∏i=1N1θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (редактировать: когда для всех и 0 в противном случае - спасибо whuber)0≤Xi≤θ0≤Xi≤θ0 \le X_i \le \thetaiii но без какой-либо другой информации …

3
Начальная загрузка остатков: я делаю это правильно?
Прежде всего: Из того, что я понял, остатки начальной загрузки работают следующим образом: Подгоните модель к данным Рассчитать остатки Пересчитайте остатки и добавьте их к 1. Подгоните модель к новому набору данных из 3. Повторите nвремя, но всегда добавляйте пересчитанные остатки к подгонке от 1. Пока это правильно? Я хочу …

1
Тест перестановки, сравнивающий один образец со средним
Когда люди применяют тесты перестановки для сравнения одной выборки со средним значением (например, как вы могли бы сделать с помощью t-критерия перестановки), как обрабатывается среднее значение? Я видел реализации, которые берут среднее и образец для теста перестановки, но неясно, что они на самом деле делают под капотом. Есть ли хотя …

1
SMOTE выдает ошибку для мультиклассовой проблемы дисбаланса
Я пытаюсь использовать SMOTE для исправления дисбаланса в моей проблеме классификации нескольких классов. Хотя SMOTE отлично работает с набором данных iris согласно справочному документу SMOTE, он не работает с аналогичным набором данных. Вот как выглядят мои данные. Обратите внимание, что у него есть три класса со значениями 1, 2, 3. …

4
Как рассчитать стандартное двухмерное отклонение со средним 0, ограниченным пределами
Моя проблема заключается в следующем: я бросаю 40 шариков одновременно с определенной точки, на несколько метров над полом. Шарики катятся и отдыхают. Используя компьютерное зрение, я вычисляю центр масс в плоскости XY. Меня интересует только расстояние от центра масс до каждого шара, которое рассчитывается с использованием простой геометрии. Теперь я …

1
Два метода начальных тестов значимости
С помощью начальной загрузки я вычисляю значения p тестов значимости, используя два метода: повторная выборка в соответствии с нулевой гипотезой и подсчет результатов, по крайней мере, таких же экстремальных, как исход исходных данных повторная выборка в соответствии с альтернативной гипотезой и подсчет результатов, по крайней мере, столь же далеких от …

3
Упражнение 2.2 «Элементы статистического обучения»
Учебник сначала генерирует некоторые 2-классовые данные через: который дает: и тогда он спрашивает: Я пытаюсь решить эту проблему, сначала смоделировав это с помощью этой графической модели: где - метка, - индекс выбранного среднего значения , а - точка данных. Это дастccch(1≤h≤10)h(1≤h≤10)h\,(1\le h \le 10)mchmhcm_h^cxxx Pr(x∣mch)=Pr(mch∣h,c=blue)=Pr(mch∣h,c=orange)=Pr(h)=Pr(c)=N(mch,I/5)N((1,0)T,I)N((0,1)T,I)11012Pr(x∣mhc)=N(mhc,I/5)Pr(mhc∣h,c=blue)=N((1,0)T,I)Pr(mhc∣h,c=orange)=N((0,1)T,I)Pr(h)=110Pr(c)=12 \begin{align*} \Pr(x\mid m_h^c) =& \mathcal{N}(m_h^c,\mathbf{I}/5)\\ …

1
В чем преимущество использования перестановочных тестов?
При проверке некоторых нулевых и альтернативных гипотез с помощью тестовой статистики , где , примените тест перестановки с набором перестановок на и мы получим новую статистику Х = { х я , . , , , x n } G X T ( X ) : = # { π …

2
Соответствует ли это единственное значение тому распределению?
это похоже на очень наивный вопрос, но мне трудно увидеть ответ. У меня есть один набор из 30 значений. Самостоятельно я получил 31-е значение. Нулевая гипотеза состоит в том, что 31-е значение является частью одного и того же распределения. Альтернатива в том, что это другое. Я хочу какую-то p-величину или …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.