Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как я могу интерпретировать график процента усечения относительно среднего значения?
Для части домашнего задания меня попросили вычислить усеченное среднее для набора данных, удалив самое маленькое и самое большое наблюдение, и интерпретировать результат. Среднее значение было ниже, чем среднее значение. Моя интерпретация заключалась в том, что это произошло потому, что базовое распределение было положительно искажено, поэтому левый хвост был более плотным, …

3
Понимание параметров функции Gaussian Basis для использования в линейной регрессии
Я хотел бы применить базисную функцию Гаусса в реализации линейной регрессии. К сожалению, мне сложно понять пару параметров в базовой функции. В частности, и .σμμ\muσσ\sigma Мой набор данных - это матрица размером 10 000 x 31 10000 образцов и 31 функций. Я читал, что «Каждая базисная функция преобразует входной вектор …

1
Определитель информации Фишера
(Я разместил аналогичный вопрос на math.se. ) В информационной геометрии детерминант информационной матрицы Фишера представляет собой естественную форму объема на статистическом многообразии, поэтому он имеет хорошую геометрическую интерпретацию. Например, тот факт, что он фигурирует в определении ранее Джеффриса, связан с его инвариантностью при репараметризации, которая является (imho) геометрическим свойством. Но …


2
Почему SAS PROC GLIMMIX дает ОЧЕНЬ разные случайные уклоны, чем glmer (lme4) для биномиального glmm
Я - пользователь, более знакомый с R, и пытался оценить случайные уклоны (коэффициенты отбора) примерно для 35 особей в течение 5 лет для четырех переменных среды обитания. Переменная ответа - является ли место «использованным» (1) или «доступным» (0) местом обитания («использование» ниже). Я использую Windows 64-битный компьютер. В версии R …

4
Хорошая форма для удаления выбросов?
Я работаю над статистикой для сборок программного обеспечения. У меня есть данные для каждой сборки по пройденному / неудачному и истекшему времени, и мы генерируем ~ 200 из них / неделю. Коэффициент успешности легко агрегируется, я могу сказать, что 45% прошли каждую данную неделю. Но я хотел бы также объединить …

3
тестирование коэффициентов логистической регрессии с использованием и степеней свободы остаточного отклонения
Резюме: существует ли статистическая теория, поддерживающая использование распределения (со степенями свободы, основанными на остаточном отклонении) для тестов коэффициентов логистической регрессии, а не стандартного нормального распределения?Ttt Некоторое время назад я обнаружил, что при подборе модели логистической регрессии в SAS PROC GLIMMIX при настройках по умолчанию коэффициенты логистической регрессии тестируются с использованием …

1
Понимание результатов анализа посредничества в R
Я пытаюсь разобраться с пакетом посредничества в R, используя виньетку для пакета. Я изо всех сил пытаюсь понять вывод mediate()функции. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ …
12 r  mediation 

4
Можно ли моделировать стационарную серию тренда с помощью ARIMA?
У меня вопрос / путаница в отношении стационарных рядов, необходимых для моделирования с помощью ARIMA (X). Я думаю об этом больше с точки зрения логического вывода (эффекта вмешательства), но хотел бы знать, если прогнозирование против логического вывода имеет какое-либо значение в ответе. Вопрос: Все вводные материалы, которые я прочитал, утверждают, …

3
Идея сделать данные имеют среднее значение
Я часто вижу людей, делающих измерение / особенность набора данных нулевым средним, удаляя среднее из всех элементов. Но я так и не понял, зачем это делать? Каков эффект от этого в качестве шага предварительной обработки? Улучшает ли это эффективность классификации? Помогает ли это что-то ответить о наборе данных? Помогает ли …

2
Неправильно ли использовать линейные графики для дискретных данных?
Я часто видел дискретные наборы данных, построенные в виде линейных графиков, но мне приходит в голову, что линия выводит значение в точке между интервалами измерения, что не имеет смысла для дискретных наборов данных. Таким образом, неверно ли использование линейных графиков для дискретных данных? В качестве примера возьмем два набора данных …

3
Каков наилучший способ изменить / реструктурировать данные?
Я научный сотрудник лаборатории (волонтер). Мне и небольшой группе было поручено провести анализ данных для набора данных, извлеченных из большого исследования. К сожалению, данные были собраны с помощью какого-то онлайн-приложения, и оно не было запрограммировано на вывод данных в наиболее удобной форме. Картинки ниже иллюстрируют основную проблему. Мне сказали, что …
12 r  excel  data-cleaning 

2
Являются ли нормально распределенные X и Y более вероятными в результате нормально распределенных остатков?
Здесь обсуждается неправильное толкование предположения о нормальности в линейной регрессии (что «нормальность» относится к X и / или Y, а не к остаткам), и автор спрашивает, возможно ли иметь ненормально распределенные X и Y и все еще имеют нормально распределенные остатки. Мой вопрос: нормально ли распределены X и Y с …

3
Экспоненциальная верхняя граница
Предположим, у нас есть случайные величины IID с распределением . Мы будем наблюдать образец 'ы следующим образом: пусть быть независимыми случайные величины, предположим , что все х и «s являются независимыми и определяют размер выборки . В «s показывают , какой из » с в образце, и мы хотим , …

3
Какой статистический тест использовать для теста А / Б?
У нас есть две когорты по 1000 образцов в каждой. Мы измеряем 2 величины в каждой когорте. Первая - это двоичная переменная. Второе - действительное число, которое следует за распределением тяжелых хвостов. Мы хотим оценить, какая группа лучше всего подходит для каждой метрики. Есть много статистических тестов на выбор: люди …
12 ab-test 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.