Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Статистические тесты, которые включают неопределенность измерений
Предположим, мне даны две группы измерения массы (в мг), которые называются y1 и y2. Я хочу сделать тест, чтобы определить, взяты ли эти две пробы из групп населения с разными средствами. Примерно так, например (в R): y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) Я получаю значение р 0,3234, и на …

3
Хорошие книги / документы по кредитному скорингу
Я ищу рекомендации книг по кредитному скорингу. Я заинтересован во всех аспектах этой проблемы, но в основном: 1) Хорошие возможности. Как их построить? Какие из них оказались хорошими? 2) Нейронные сети. Их применение к проблеме кредитного скоринга. 3) Я выбрал нейронные сети, но меня интересуют и другие методы.

1
Объединение двух ковариационных матриц
Я вычисляю ковариацию распределения параллельно, и мне нужно объединить распределенные результаты в единственном гауссовском. Как мне совместить два? Линейная интерполяция между двумя почти работами, если они одинаково распределены и измерены. В Википедии внизу есть форумла для комбинации, но она кажется неправильной; два одинаково распределенных распределения должны иметь одинаковую ковариацию, но …


2
Сколько исчисления необходимо, чтобы понять оценку максимального правдоподобия?
Я пытаюсь спланировать учебный план для изучения MLE. Чтобы сделать это, я пытаюсь выяснить, какой минимальный уровень исчисления необходим для понимания MLE. Достаточно ли понять основы исчисления (то есть найти минимум и максимум функций), чтобы понять MLE?

2
Взвешивание показателя склонности в анализе Кокса PH и выборе ковариат
Относительно взвешивания по шкале склонности (IPTW) при моделировании пропорциональных рисков Кокса для данных о выживаемости от времени к событию: У меня есть проспективные данные реестра, где мы заинтересованы в том, чтобы посмотреть на эффект лечения от лекарств, которые в большинстве случаев пациенты уже принимали в начале исследования. Поэтому я не …

1
Работа с регрессией необычно ограниченной переменной ответа
Я пытаюсь смоделировать переменную ответа, теоретически ограниченную между -225 и +225. Переменная - это общая оценка, которую субъекты получают, играя в игру. Хотя теоретически это возможно для предметов +225. Несмотря на это, потому что счет зависел не только от действий субъектов, но и от действий других действий, максимум, который набрал …

1
Оценка классификаторов: кривые обучения против кривых ROC
Я хотел бы сравнить 2 разных классификатора для задачи классификации текстов с несколькими классами, которые используют большие обучающие наборы данных. Я сомневаюсь, должен ли я использовать кривые ROC или кривые обучения, чтобы сравнить 2 классификатора. С одной стороны, кривые обучения полезны для определения размера набора обучающих данных, поскольку вы можете …

3
Измерьте равномерность распределения точек в 2D квадрате
У меня есть 2D-квадрат, и внутри него есть набор точек, скажем, 1000 точек. Мне нужен способ увидеть, распределено ли распределение точек внутри квадрата (или более или менее равномерно распределено) или они собираются вместе в каком-то месте внутри квадрата. Мне нужен математический / статистический (не программирующий) способ определить это. Я гуглил, …

2
Преобразование непрерывных переменных для логистической регрессии
У меня есть большие данные опроса, двоичная переменная результата и много объясняющих переменных, включая двоичные и непрерывные. Я строю наборы моделей (экспериментирую как с GLM, так и со смешанным GLM) и использую теоретико-информационные подходы для выбора топ-модели. Я тщательно изучил объяснения (как непрерывные, так и категориальные) на предмет корреляций, и …


1
Генерация случайных чисел по Коши
Мне нужно нарисовать случайные числа из логарифмического распределения, которое имеет плотность: Может кто-нибудь помочь мне или указать мне книгу / бумагу, которая может показать мне, как?е( х ; μ , σ) = 1х πσ[ 1 + ( l n ( x ) - μσ)2],е(Икс;μ,σ)знак равно1Иксπσ[1+(LN(Икс)-μσ)2],f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
Как «разумно» собрать коллекцию отсортированных данных?
Я пытаюсь разумно отсортировать коллекцию. У меня есть коллекция из частей данных. Но я знаю , что это припадки данных в неравных размеров бункеров. Я не знаю, как правильно выбирать конечные точки для правильного размещения данных. например:Nnnмmm Скажем, у меня в коллекции 12 предметов, и я знаю, что данные поместятся …

4
Диагональные прямые в графике остатков и подгоночных значений для множественной регрессии
Я наблюдаю странные закономерности в остатках для моих данных: [EDIT] Вот графики частичной регрессии для двух переменных: [EDIT2] Добавлен график PP Распределение, кажется, работает хорошо (см. Ниже), но я понятия не имею, откуда может идти эта прямая линия. Любые идеи? [ОБНОВЛЕНИЕ 31.07] Оказывается, вы были абсолютно правы, у меня были …

1
Найти сопоставимую контрольную группу для группы лечения?
У меня есть группа лечения размером 30 (30 школ в Калифорнии), которая использовала дополнительное математическое программное обеспечение. В простом анализе я хотел бы сравнить средний рост математики учащихся между нашей группой лечения и сопоставимой контрольной группой. Есть много школ в CA, которые не использовали программное обеспечение. Я бы хотел, чтобы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.