Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как работает стандартная ошибка?
Недавно я изучил внутреннюю работу стандартной ошибки и не смог понять, как она работает. Мое понимание стандартной ошибки заключается в том, что это стандартное отклонение распределения выборочных средних. Мои вопросы: • как мы узнаем, что стандартная ошибка означает стандартное отклонение выборки, когда мы обычно берем только одну выборку? • почему …

8
Как интерполяция связана с концепцией регрессии?
Кратко объясните, что подразумевается под интерполяцией. Как это связано с понятием регрессии? Интерполяция - это искусство чтения между строками таблицы, а в элементарной математике этот термин обычно обозначает процесс вычисления промежуточных значений функции из набора заданных или табличных значений этой функции. Я не могу дать ответ на второй вопрос. Пожалуйста …

2
Обратное преобразование коэффициентов регрессии
Я делаю линейную регрессию с преобразованной зависимой переменной. Следующее преобразование было сделано для того, чтобы предположение о нормальности остатков было выполнено. Нетрансформированная зависимая переменная была отрицательно искажена, и следующее преобразование приблизило ее к нормальному: Y=50−Yorig−−−−−−−−√Y=50−YorigY=\sqrt{50-Y_{orig}} где YorigYorigY_{orig} является зависимой переменной в исходном масштабе. Я думаю, что имеет смысл использовать некоторое …

1
Как выбрать между ANOVA и ANCOVA в разработанном эксперименте?
Я провожу эксперимент, который имеет следующее: DV: потребление среза (непрерывное или может быть категоричным) IV: здоровое сообщение, нездоровое сообщение, отсутствие сообщения (контроль) (3 группы, в которых люди назначаются случайным образом - категорично) Это манипулируемое сообщение о здоровье среза. Следующие IV могут рассматриваться как отдельные переменные различия: Импульсивность (это может быть …

1
Почему мы предполагаем, что ошибка обычно распространяется?
Интересно, почему мы используем предположение Гаусса при моделировании ошибки. В курсе ML Стэнфорда профессор Нг описывает его в основном двумя способами: Это математически удобно. (Это связано с подходом наименьших квадратов и легко решается псевдообратным) Из-за центральной предельной теоремы мы можем предположить, что на процесс влияют многие основные факты, и сумма …

5
Как указать логнормальное распределение в аргументе семейства glm в R?
Простой вопрос: как указать логнормальное распределение в аргументе семейства GLM в R? Я не мог найти, как это может быть достигнуто. Почему логнормальный (или экспоненциальный) не вариант в семейном аргументе? Где-то в R-архивах я читал, что нужно просто использовать лог-ссылку для семейства, установленного на гауссовский в GLM, чтобы указать логнормальное. …

1
Условные обозначения для случайных величин и их распределения
Я запутался в правильных обозначениях значений, а также в значениях некоторых обозначений, касающихся случайных величин и их распределений. Ниже я приведу список вещей, которые я считаю верными, а также вещей, которые я не понимаю, и я хотел бы получить информацию / исправления. Я пометил каждую точку / вопрос с номером …

3
Фиттинг многомерный, натуральный кубический сплайн
примечание: без правильных ответов через месяц я разместил сообщение на SO Фон У меня есть модель, fff , где Y=f(X)Y=f(X)Y=f(\textbf{X}) XX\textbf{X} -матрица выборок изпараметров размером а-векторвыходных данных модели.n×mn×mn \times mmmmYYYn×1n×1n \times 1 fff требует большого объема вычислений, поэтому я хотел бы аппроксимировать fff используя многовариантный кубический сплайн через (X,Y)(X,Y)(X,Y) точек, …

2
Вычисление 95-го процентиля: сравнение нормального распределения, подходов R-квантиль и Excel
Я пытался вычислить 95-й процентиль для следующего набора данных. Я наткнулся на несколько онлайн-ссылок на это. Подход 1: на основе выборочных данных Первый один говорит мне , для получения TOP 95 Percentнабора данных , а затем выберите MINили AVGиз результирующего набора. Это дает мне следующий набор данных: AVG: 29162 MIN: …
17 r  dataset  quantiles  sql 

5
Для классификации со случайными лесами в R, как следует приспособиться к несбалансированным размерам классов?
Я изучаю различные методы классификации для проекта, над которым я работаю, и заинтересован в попытках использовать «Случайные леса». Я стараюсь обучаться сам по себе, и буду признателен за любую помощь, предоставленную сообществом CV. Я разделил свои данные на тренировочные / тестовые наборы. После экспериментов со случайными лесами в R (с …

7
Означает ли простая линейная регрессия причинную связь?
Я знаю, что корреляция подразумевает не причинно-следственную связь, а силу и направление отношений. Означает ли простая линейная регрессия причинную связь? Или для этого требуется статистический тест (t-критерий и т. Д.)?

2
Как интерпретировать Exp (B) в регрессии Кокса?
Я студент-медик, пытаюсь понять статистику (!) - так что будьте осторожны! ;) Я пишу эссе, содержащее достаточное количество статистического анализа, включая анализ выживания (Kaplan-Meier, Log-Rank и регрессия Кокса). Я провел регрессию Кокса на моих данных, пытаясь выяснить, могу ли я найти значительную разницу между смертями пациентов в двух группах (пациенты …

5
Как добавить периодический компонент в модель линейной регрессии?
У меня есть некоторые кумулятивные данные о частоте. Линия выглядит так, как будто она очень хорошо вписывается в данные, но в ней есть циклическое / периодическое покачивание. Я хотел бы оценить, когда совокупная частота достигнет определенного значения c . Когда я строю графики остатков и подгоночных значений, я получаю прекрасное …

1
Использование HMM в количественных финансах. Примеры HMM, который работает, чтобы обнаружить трендовые / поворотные точки?
Я открываю для себя удивительный мир таких «скрытых марковских моделей», которые также называют «моделями переключения режимов». Я хотел бы адаптировать HMM в R для обнаружения трендов и поворотных моментов. Я хотел бы построить модель как можно более общей, чтобы я мог протестировать ее по многим ценам. Кто-нибудь может порекомендовать бумагу? …

4
Каковы плюсы и минусы использования логранка и метода Мантеля-Хензеля для вычисления коэффициента опасности в анализе выживания?
Одним из способов суммировать сравнение двух кривых выживаемости является вычисление коэффициента опасности (ЧСС). Есть (как минимум) два метода для вычисления этого значения. Метод Логранка. Как часть вычислений Каплана-Мейера, вычислите число наблюдаемых событий (обычно смертей) в каждой группе ( O aОaOa и ) и количество ожидаемых событий, предполагая нулевую гипотезу об …
17 survival  hazard 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.