Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Преимущества подхода к проблеме путем формулирования функции стоимости, которая является глобально оптимизируемой
Это довольно общий вопрос (т.е. не обязательно специфический для статистики), но я заметил тенденцию в машинном обучении и статистической литературе, где авторы предпочитают придерживаться следующего подхода: Подход 1 : Получить решение практической проблемы, сформулировав функцию стоимости, для которой можно (например, с вычислительной точки зрения) найти глобально оптимальное решение (например, путем …

1
Как интерпретировать результаты уменьшения размерности / многомерного масштабирования?
Я выполнил декомпозицию SVD и многомерное масштабирование 6-мерной матрицы данных, чтобы лучше понять структуру данных. К сожалению, все сингулярные значения имеют один и тот же порядок, подразумевая, что размерность данных действительно равна 6. Однако я хотел бы иметь возможность интерпретировать значения сингулярных векторов. Например, первый кажется более или менее равным …

1
Тест случайной перестановки для выбора функции
Меня смущает анализ перестановок для выбора функций в контексте логистической регрессии. Не могли бы вы дать четкое объяснение теста случайной перестановки и как он применяется к выбору функции? Возможно, с точным алгоритмом и примерами. Наконец, как это можно сравнить с другими методами усадки, такими как лассо или LAR?

2
Распределение «несмешанных» частей в зависимости от порядка смешивания
Предположим, у меня есть парные наблюдения, нарисованные как для . Пусть и обозначим через J - й по величине наблюдаемое значение Z . Что такое (условное) распределение X_ {i_j} ? (или, что то же самое, что Y_ {i_j} )Xi∼N(0,σ2x),Yi∼N(0,σ2y),Xi∼N(0,σx2),Yi∼N(0,σy2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right),i=1,2,…,ni=1,2,…,ni=1,2,\ldots,nZi=Xi+Yi,Zi=Xi+Yi,Z_i = X_i + Y_i,ZijZijZ_{i_j}jjjZZZXijXijX_{i_j}YijYijY_{i_j} То есть …

3
Велоспорт в алгоритме k-средних
Согласно вики, наиболее широко используемый критерий конвергенции - «назначение не изменилось». Мне было интересно, может ли ехать на велосипеде, если мы используем такой критерий сходимости? Я был бы рад, если бы кто-то указал ссылку на статью, которая приводит пример езды на велосипеде или доказывает, что это невозможно.

3
Компактная кластеризация
Большинство алгоритмов кластеризации, которые я видел, начинаются с создания расстояний между каждым из всех точек, что становится проблематичным для больших наборов данных. Есть тот, кто этого не делает? Или это какой-то частичный / приблизительный / ступенчатый подход? Какой алгоритм / реализация кластеризации занимает меньше O (n ^ 2) места? Есть …

1
Как я могу оценить соответствие модели GEE / логистической модели, если у ковариат есть недостающие данные?
Я приспособил две модели обобщенных оценочных уравнений (GEE) к моим данным: 1) Модель 1. Результат - продольная переменная Да / Нет (A) (год 1,2,3,4,5) с продольным непрерывным предиктором (B) для лет 1,2,3,4,5. 2) Модель 2: Результат - та же самая продольная переменная Да / Нет (A), но теперь с моим …
9 logistic  gee 

3
Обработка уровней «Не знаю / Отказ» категориальных переменных
Я моделирую прогнозирование диабета с помощью логистической регрессии. Используемый набор данных представляет собой систему наблюдения за поведенческим фактором риска (BRFSS) Центра контроля заболеваний (CDC). Одной из независимых переменных является высокое кровяное давление. Он категорически со следующими уровнями: «Да», «Нет», «Не знаю / Отказался». Должен ли я удалить эти строки с …

5
Автоматическое определение порога для обнаружения аномалий
Я работаю с временным рядом оценок аномалий (фон - обнаружение аномалий в компьютерных сетях). Каждую минуту я получаю оценку аномалии которая говорит мне, насколько «неожиданным» или ненормальным является текущее состояние сети. Чем выше оценка, тем ненормальнее текущее состояние. Результаты, близкие к 5, теоретически возможны, но встречаются практически никогда.xt∈[0,5]ИксT∈[0,5]x_t \in [0, …

4
Как выполнить многократные тесты хи-квадрат после таблицы 2 на 3?
Мой набор данных состоит из общей смертности или выживания организма в трех типах участков: на берегу, в среднем и на расстоянии от берега. Цифры в таблице ниже представляют количество сайтов. 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 Я хотел бы знать, является ли количество …

2
Статистическая значимость изменений во времени на 5-балльной позиции Лайкерта
Контекст: У меня есть два набора данных из одной и той же анкеты за два года. Каждый вопрос измеряется по 5-балльной шкале. Q1: схема кодирования На данный момент я закодировал свои ответы с интервалом [0, 1], где 0 означает «наиболее отрицательный ответ», 1 означает «наиболее положительный ответ», а другие ответы …

1
В R как мне ссылаться \ искать в cdf стандартной таблицы нормального распределения?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я предполагаю, что R имеет это встроенное. Как я могу ссылаться на это?

2
Как правильно применять перекрестную проверку в контексте выбора параметров обучения для машин опорных векторов?
Прекрасный пакет libsvm предоставляет интерфейс Python и файл «easy.py», который автоматически ищет параметры обучения (cost & gamma), которые максимизируют точность классификатора. В заданном наборе параметров обучения кандидата точность реализуется путем перекрестной проверки, но я чувствую, что это подрывает цель перекрестной проверки. То есть, поскольку сами параметры обучения могут быть выбраны …

1
Есть ли эквивалент ARMA для ранговой корреляции?
Я смотрю на чрезвычайно нелинейные данные, для которых модели ARMA / ARIMA не работают хорошо. Тем не менее, я вижу некоторую автокорреляцию, и я подозреваю, что будут иметь лучшие результаты для нелинейной автокорреляции. 1 / существует ли эквивалент PACF для ранговой корреляции? (в R?) 2 / существует ли эквивалент модели …

4
Как рассчитать доверительные интервалы для объединенных нечетных отношений в метаанализе?
У меня есть два набора данных из общих исследований генома ассоциации. Единственной доступной информацией являются нечетные отношения и их доверительные интервалы (95%) для каждого генотипированного SNP. Я хочу создать лесной участок, сравнивая эти два коэффициента, но я не могу найти способ рассчитать комбинированные доверительные интервалы для визуализации суммарных эффектов. Я …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.