Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Модель пропорционального риска Кокса и не случайно выбранная выборка
Существуют ли методы для исправления смещения в модели пропорционального риска Кокса, вызванного неслучайно выбранной выборкой (что-то вроде коррекции Хекмана)? Справочная информация : Допустим, ситуация выглядит следующим образом: - В течение первых двух лет все клиенты принимаются. - После этих двух лет модель Cox PH строится. Модель прогнозирует, как долго клиенты …
9 bias  cox-model 

4
Тест на значительную разницу в отношениях нормально распределенных случайных величин
Относится к анализу соотношений переменных и как параметризовать отношение двух нормально распределенных переменных или обратное к одной? , Предположим, у меня есть несколько выборок из четырех различных непрерывных случайных распределений, все из которых мы можем считать примерно нормальными. В моем случае они соответствуют некоторым показателям производительности двух разных файловых систем …

4
Как бороться с пробелами / NaN в данных временных рядов при использовании Matlab для автокорреляции и нейронных сетей?
У меня есть временной ряд измерений (высота-одномерный ряд). В период наблюдения процесс измерения замедлился на несколько моментов времени. Таким образом, полученные данные представляют собой вектор с NaN, где в данных были пробелы. Используя MATLAB, это вызывает у меня проблему при вычислении автокорреляции ( autocorr) и применении нейронных сетей ( nnstart). …

4
Самый эффективный способ узнать LaTeX, Sweave, Beamer? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 3 года назад . Мне очень интересно узнать, как создавать повторяющиеся отчеты из моего кода R и визуализации ggplot2. Я понимаю, что LaTeX …
9 r 

1
Создание марковской модели максимальной энтропии из существующего классификатора максимальной энтропии с несколькими входами
Я заинтригован концепцией модели максимальной энтропии Маркова (MEMM), и я думаю об использовании ее для тегера части речи (POS). В настоящее время я использую традиционный классификатор Maximum Entropy (ME), чтобы пометить каждое отдельное слово. При этом используется ряд функций, в том числе два предыдущих тега. MEMM используют алгоритм Витерби, чтобы …

7
Поиск 2D искусственных данных для демонстрации свойств алгоритмов кластеризации
Я ищу наборы данных 2-мерных точек данных (каждый пункт данных является вектором двух значений (x, y)) следующих разных распределений и форм. Код для генерации таких данных также будет полезен. Я хочу использовать их для построения / визуализации работы некоторых алгоритмов кластеризации. Вот некоторые примеры: звездные облачные данные четыре кластера, один …

1
Фильтр частиц в R - пример тривиального кода
Я ищу простой пример кода для того, как запустить Particle Filter в R. Пакет pomp, кажется, поддерживает математический бит пространства состояний, но примеры являются немного сложными, чтобы следовать программно для простого разработчика OO, такого как я, особенно как загрузить наблюдаемые данные в объект помпы. Примеры здесь: http://cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf Допустим, у меня …
9 r 

1
Как рассчитать меру точности на основе RMSE? Мой большой набор данных нормально распределен?
У меня есть несколько наборов данных порядка тысяч точек. Значения в каждом наборе данных: X, Y, Z, относящиеся к координате в пространстве. Z-значение представляет собой разницу высот в координатной паре (x, y). Как правило, в моей области ГИС ошибка превышения указывается в RMSE путем вычитания точки истинности относительно точки измерения …

4
Сокращение количества переменных в множественной регрессии
У меня есть большой набор данных, состоящий из значений нескольких сотен финансовых переменных, которые можно использовать в множественной регрессии для прогнозирования поведения индексного фонда во времени. Я хотел бы сократить число переменных до десяти или около того, сохраняя при этом как можно большую предсказательную силу. Добавлено: сокращенный набор переменных должен …

1
В чем разница между GLM и GEE?
В чем разница между моделью GLM (логистическая регрессия) с бинарной переменной отклика, которая включает субъект и время в качестве ковариат, и аналогичной моделью GEE, которая учитывает корреляцию между измерениями в нескольких временных точках? Мой GLM выглядит так: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) с …

1
Как правильно определить победителей региональной научной ярмарки?
Мне нужна помощь в поиске правильного способа подсчета победителей на нашей научной ярмарке. Я не хочу, чтобы мое незнание статистики и математики мешало шансу ребенка выиграть. (много стипендий и пособий по продвижению на карту). Заранее спасибо за помощь. Сначала немного истории о том, как у нас все настроено: Наша ярмарка …

1
Учет дискретных или двоичных параметров в байесовском информационном критерии
BIC штрафует в зависимости от количества параметров. Что если некоторые из параметров являются своего рода переменными двоичного индикатора? Они считаются полными параметрами? Но я могу объединить двоичных параметров в одну дискретную переменную, которая принимает значения в . Они должны учитываться как параметров или как один параметр?{ 0 , 1 , …

1
Другой прогнозный график от выживаемости coxph и rms cph
Я создал свою немного улучшенную версию termplot, которую я использую в этом примере, вы можете найти ее здесь . Ранее я писал о SO, но чем больше я об этом думаю, тем больше думаю, что это скорее связано с интерпретацией модели пропорциональных рисков Кокса, чем с фактическим кодированием. Проблема Когда …
9 r  survival  cox-model 

2
Ошибка при запуске glmnet в многочлене [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 9 месяцев назад . Проблема, упомянутая в этом вопросе, исправлена ​​в версии 1.7.3 пакета R glmnet. У меня возникли некоторые проблемы при запуске …
9 r  multinomial  glmnet 

1
Лучший способ обработки несбалансированного мультиклассового набора данных с помощью SVM
Я пытаюсь построить модель предсказания с SVM на довольно несбалансированных данных. Мои метки / выходные данные имеют три класса, положительный, нейтральный и отрицательный. Я бы сказал, что положительный пример составляет около 10–20% моих данных, нейтральный - около 50–60%, а отрицательный - около 30–40%. Я пытаюсь сбалансировать классы, поскольку стоимость, связанная …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.