Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Каковы различия между терминами «анализ временных рядов» и «анализ продольных данных»
Говоря о продольных данных, мы можем многократно ссылаться на данные, собранные с течением времени от одного и того же субъекта / единицы исследования, таким образом, существуют корреляции для наблюдений внутри одного и того же субъекта, т. Е. Сходство внутри объекта. Говоря о данных временного ряда, мы также ссылаемся на данные, …

2
Как запустить анализ Порядковой Логистической Регрессии в R с обоими числовыми / категориальными значениями?
Базовые данные : у меня ~ 1000 человек помечены оценками: «1», «хорошо», «2», «средний» или «3» [плохо »- это те значения, которые я пытаюсь предсказать для людей в будущем , В дополнение к этому, у меня есть некоторая демографическая информация: пол (категориальный: M / F), возраст (числовой: 17-80) и раса …

3
Зачем нам нужны автоэнкодеры?
Недавно я изучал автоэнкодеры. Если я правильно понял, автоэнкодер - это нейронная сеть, где входной слой идентичен выходному слою. Таким образом, нейронная сеть пытается предсказать результат, используя вход как золотой стандарт. В чем полезность этой модели? Каковы преимущества попытки восстановить некоторые выходные элементы, сделав их максимально равными входным элементам? Зачем …


2
Как это возможно, что Пуассон GLM принимает нецелые числа?
Я действительно ошеломлен тем фактом, что Poisson GLM принимает нецелые числа! Посмотрите: Данные (содержание data.txt): 1 2001 0.25 1 1 2002 0.5 1 1 2003 1 1 2 2001 0.25 1 2 2002 0.5 1 2 2003 1 1 R скрипт: t <- read.table("data.txt") names(t) <- c('site', 'year', 'count', 'weight') …

4
Какая связь между
Мне было интересно, есть ли связь между и F-Test.R2R2R^2 Обычно и измеряет силу линейные отношения в регрессии.R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R^2=\frac {\sum (\hat Y_t - \bar Y)^2 / T-1} {\sum( Y_t - \bar Y)^2 / T-1} F-тест просто подтверждает гипотезу. Есть ли связь между и F-тестом?R2R2R^2


1
Как мне мысленно разобраться с парадоксом Бореля?
Мне немного неловко от того, как я мысленно справился с парадоксом Бореля и другими связанными с ним «парадоксами», связанными с условной вероятностью. Для тех, кто читает это, кто не знаком с этим, посмотрите эту ссылку . Мой ментальный ответ до этого момента был в основном игнорировать это, потому что никто, …

3
Какова связь между R-квадратом и р-значением в регрессии?
tl; dr - для регрессии OLS, более высокий R-квадрат также подразумевает более высокое P-значение? В частности, для одной объясняющей переменной (Y = a + bX + e), но было бы также интересно узнать для n нескольких объясняющих переменных (Y = a + b1X + ... bnX + e). Контекст - …

5
Почему k-means не дает глобального минимума?
Я читал, что алгоритм k-средних сходится только к локальному минимуму, а не к глобальному минимуму. Почему это? Я могу логически подумать о том, как инициализация может повлиять на окончательную кластеризацию, и есть вероятность неоптимальной кластеризации, но я не нашел ничего, что математически доказало бы это. Кроме того, почему k-означает итеративный …

1
Как интерпретировать вывод предиката .coxph?
После подбора кокс-модели можно делать прогнозы и получать относительный риск новых данных. Что я не понимаю, так это то, как относительный риск рассчитывается для человека и к чему он относится (то есть для среднего населения)? Любые рекомендации по ресурсам, которые помогут понять (я не очень продвинут в анализе выживания, поэтому …

3
Т-распределение Фиттинга в R: параметр масштабирования
Как мне подобрать параметры t-распределения, то есть параметры, соответствующие «среднему» и «стандартному отклонению» нормального распределения. Я предполагаю, что они называются «среднее» и «масштабирование / степени свободы» для t-распределения? Следующий код часто приводит к ошибкам «сбой оптимизации». library(MASS) fitdistr(x, "t") Нужно ли сначала масштабировать х или преобразовать в вероятности? Как лучше …

5
Почему мой R-квадрат такой низкий, когда моя t-статистика такая большая?
Я выполнил регрессию с 4 переменными, и все они очень статистически значимы, со значениями T и (я говорю потому что кажется неуместным включать десятичные дроби), которые очень высоки и явно значимы. Но тогда только 2284. Я неверно истолковываю здесь значения t, чтобы обозначать то, чем они не являются? Моя первая …

1
Связь между генерирующей момент функцией и характеристической функцией
Я пытаюсь понять связь между генерирующей момент функцией и характеристической функцией. Генерирующая момент функция определяется как: MX(t)=E(exp(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n!MX(t)=E(exp⁡(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n! M_X(t) = E(\exp(tX)) = 1 + \frac{t E(X)}{1} + \frac{t^2 E(X^2)}{2!} + \dots + \frac{t^n E(X^n)}{n!} Используя разложение в ряд Я могу найти все моменты распределения для случайной величины X.exp(tX)=∑∞0(t)n⋅Xnn!exp⁡(tX)=∑0∞(t)n⋅Xnn!\exp(tX) = \sum_0^{\infty} \frac{(t)^n …

1
Отрицательный коэффициент в упорядоченной логистической регрессии
Предположим, у нас есть порядковый ответ и набор переменных которые мы считаем объясню . Затем мы делаем упорядоченную логистическую регрессию (матрица дизайна) на (ответ).y:{Bad, Neutral, Good}→{1,2,3}y:{Bad, Neutral, Good}→{1,2,3}y:\{\text{Bad, Neutral, Good}\} \rightarrow \{1,2,3\}X:=[x1,x2,x3]X:=[x1,x2,x3]X:=[x_1,x_2,x_3]yyyXXXyyy Предположим, что оценочный коэффициент , назовите его , в упорядоченной логистической регрессии равен . Как мне интерпретировать отношение …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.