Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Почему функции R 'princomp' и 'prcomp' дают разные собственные значения?
Вы можете использовать набор данных десятиборья {FactoMineR}, чтобы воспроизвести это. Вопрос в том, почему вычисленные собственные значения отличаются от значений ковариационной матрицы. Вот собственные значения, использующие princomp: > library(FactoMineR);data(decathlon) > pr <- princomp(decathlon[1:10], cor=F) > pr$sd^2 Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 1.348073e+02 2.293556e+01 9.747263e+00 1.117215e+00 3.477705e-01 1.326819e-01 Comp.7 Comp.8 …
22 r  pca 

4
Создание индекса качества из нескольких переменных для включения порядка рангов
У меня есть четыре числовые переменные. Все они являются показателями качества почвы. Чем выше переменная, тем выше качество. Диапазон для всех них различен: Вар1 от 1 до 10 Вар2 от 1000 до 2000 Вар3 от 150 до 300 Вар4 от 0 до 5 Мне нужно объединить четыре переменные в один …

6
Теория графов - анализ и визуализация
Я не уверен, что предмет входит в CrossValidated интерес. Вы скажете мне. Я должен изучить граф (из теории графов ) т.е. У меня есть определенное количество точек, которые связаны между собой. У меня есть таблица со всеми точками и точками, от которых зависит каждая. (У меня есть еще одна таблица …

2
Марковский процесс только в зависимости от предыдущего состояния
Я просто хотел бы, чтобы кто-то подтвердил мое понимание или я что-то упустил. Определение марковского процесса говорит, что следующий шаг зависит только от текущего состояния, а не от прошлых состояний. Итак, допустим, у нас было пространство состояний a, b, c, d, и мы идем от a-> b-> c-> d. Это …

2
Генеративные и дискриминационные модели (в байесовском контексте)
Каковы различия между порождающими и дискриминационными (дискриминантными) моделями (в контексте байесовского обучения и умозаключений)? и какое это имеет отношение к предсказанию, теории принятия решений или обучению без учителя?

1
Коррекция множественных гипотез с помощью Бенджамини-Хохберга, p-значения или q-значения?
Учитывая список значений p, полученных из независимых тестов, отсортированных в порядке возрастания, можно использовать процедуру Бенджамини-Хохберга для множественной коррекции тестирования . Для каждого значения p процедура Бенджамини-Хохберга позволяет рассчитать частоту ложных открытий (FDR) для каждого из значений p. То есть, в каждой «позиции» в отсортированном списке значений p он скажет …

5
Могу ли я доверять результатам ANOVA для ненормально распределенного DV?
Я проанализировал эксперимент с повторными измерениями ANOVA. ANOVA - это 3x2x2x2x3 с 2 факторами между субъектами и 3 внутри (N = 189). Уровень ошибок является зависимой переменной. Распределение коэффициентов ошибок имеет перекос 3,64 и эксцесс 15,75. Наклон и куртоз являются результатом того, что 90% от среднего значения ошибок равняется 0. …

3
Несмещенная оценка ковариационной матрицы для данных с множественной цензурой
Химические анализы проб окружающей среды часто подвергаются цензуре ниже пределов отчетности или различных пределов обнаружения / количественного определения. Последние могут варьироваться, как правило, пропорционально значениям других переменных. Например, для анализа может потребоваться разведение образца с высокой концентрацией одного соединения, что приведет к пропорциональному раздуванию пределов цензуры для всех других соединений, …

6
Групповые различия по пятибалльной шкале Лайкерта
Исходя из этого вопроса : представьте, что вы хотите проверить различия в центральной тенденции между двумя группами (например, мужчинами и женщинами) по 5-балльному пункту Лайкерта (например, удовлетворенность жизнью: неудовлетворен удовлетворенным). Я думаю, что критерий Стьюдента был бы достаточно точным для большинства целей, но тест начальной загрузки различий между средними значениями …

9
Как выяснить, какой тип распределения представляет эти данные о времени отклика ping?
Я пробовал реальный процесс, время пинга в сети. «Время прохождения туда-обратно» измеряется в миллисекундах. Результаты представлены на гистограмме: Время пинга имеет минимальное значение, но длинный верхний хвост. Я хочу знать, что это за статистическое распределение, и как оценить его параметры. Несмотря на то, что дистрибутив не является нормальным, я все …

1
Общие статистические тесты как линейные модели
(ОБНОВЛЕНИЕ: я углубился в это и разместил результаты здесь ) Список названных статистических тестов огромен. Многие из общих тестов основаны на выводе из простых линейных моделей, например, t-критерий с одной выборкой - это просто y = β + ε, который проверяется на нулевой модели, y = μ + ε, т. …

4
На 50% на 100% выше, чем на 25%, или на 25% выше, чем на 25%?
Если у меня есть два значения A и B, которые оба выражены в процентах от C, и я хочу выразить разницу в величине между A и B в процентах от D, правильнее ли выражать D в процентах от C, или в процентах от B (или даже A)? 50 безработных, очевидно, …

3
Как термин ошибки регрессии может быть когда-либо соотнесен с объясняющими переменными?
В первом предложении этой вики- страницы утверждается, что «В эконометрике возникает проблема эндогенности, когда объясняющая переменная соотносится с ошибочным термином. 1 » Мой вопрос в том, как это может произойти? Разве бета-версия регрессии не выбрана такой, что член ошибки ортогонален пространству столбцов матрицы проекта?
22 regression 

9
Как определить достоверность предсказания нейронной сети?
Чтобы проиллюстрировать мой вопрос, предположим, что у меня есть тренировочный набор, где на входе есть уровень шума, а на выходе нет, например; # Training data [1.02, 1.95, 2.01, 3.06] : [1.0] [2.03, 4.11, 5.92, 8.00] : [2.0] [10.01, 11.02, 11.96, 12.04] : [1.0] [2.99, 6.06, 9.01, 12.10] : [3.0] здесь …

2
Какое свойство оценки у оракула?
Какое свойство оценки у оракула ? Для каких целей моделирования имеет значение свойство оракула (предиктивный, объяснительный, ...)? И теоретически строгие, и (особенно) интуитивные объяснения приветствуются.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.