Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
тесты противтестов?
Я пытаюсь выяснить, в чем именно разница между тестами и тестами.TttZzz Насколько я могу судить, для обоих классов тестов используется одна и та же статистика тестов, что-то вроде б^- Ссеˆ( б^)б^-Ссе^(б^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} где - некоторая выборочная статистика, - некоторая ссылочная константа (местоположение) (которая зависит от деталей теста), а - …

1
Динамический факторный анализ и модель пространства состояний
Пакет MARSS в R предлагает функцию для динамического факторного анализа. В этом пакете динамическая факторная модель написана как особая форма модели пространства состояний, и они предполагают, что общие тенденции следуют процессу AR (1). Поскольку я не очень знаком с этими двумя методами, я задаю два вопроса: Является ли динамический факторный …

1
Манипулирование моделью логистической регрессии
Я хотел бы понять, что делает следующий код. Человек, который написал код, больше не работает здесь, и он почти полностью без документов. Меня попросили исследовать это кто-то, кто думает, что это "модель байесовской логистической регрессии " bglm <- function(Y,X) { # Y is a vector of binary responses # X …

3
Математическое моделирование нейронных сетей как графических моделей
Я изо всех сил пытаюсь сделать математическую связь между нейронной сетью и графической моделью. В графических моделях идея проста: распределение вероятностей разлагается в соответствии с кликами на графике, причем потенциалы обычно имеют экспоненциальное семейство. Есть ли аналогичная аргументация для нейронной сети? Можно ли выразить распределение вероятности по единицам (переменным) в …

2
Как определить, что остатки автокоррелированы из графики
Когда вы делаете регрессию OLS и строите результирующие остатки, как вы можете определить, являются ли эти остатки автокоррелированными? Я знаю, что есть тесты для этого (Durbin, Breusch-Godfrey), но мне было интересно, можете ли вы просто посмотреть на график, чтобы оценить, может ли автокорреляция быть проблемой (потому что для гетероскедастичности это …

1
В чем разница между бесплатной статистикой / методами распределения и непараметрической статистикой?
Из Википедии Первое значение непараметрических охватывает методы, которые не полагаются на данные, принадлежащие к какому-либо конкретному распределению. К ним, среди прочего, относятся: методы без распределения, которые не основаны на предположениях о том, что данные взяты из заданного распределения вероятностей. Как таковая, она является противоположностью параметрической статистики. Он включает в себя …

4
Какие преимущества имеет пуассоновская регрессия по сравнению с линейной регрессией в этом случае?
Мне дали набор данных, который содержит количество наград, заработанных учащимися в одной средней школе, где предикторами количества полученных наград являются тип программы, в которую был зачислен учащийся, и балл по их итоговому экзамену по математике. Мне было интересно, может ли кто-нибудь сказать мне, почему модель линейной регрессии может быть непригодной …

2
Интерпретация результата кластеризации k-средних в R
Я использовал kmeansинструкцию R для выполнения алгоритма k-средних в наборе данных радужной оболочки глаза Андерсона. У меня есть вопрос о некоторых параметрах, которые я получил. Результаты: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 В этом случае, что означает «Кластер означает»? Это среднее расстояние всех объектов в …

1
подбор экспоненциальной функции с использованием метода наименьших квадратов в сравнении с обобщенной линейной моделью в сравнении с нелинейным методом наименьших квадратов
У меня есть набор данных, который представляет экспоненциальный спад. Я хотел бы приспособить экспоненциальную функцию к этим данным. Я попытался лог преобразовать переменную ответа и затем использовать наименьшие квадраты, чтобы соответствовать линии; использование обобщенной линейной модели с функцией логарифмической связи и гамма-распределением вокруг переменной отклика; и используя нелинейные наименьшие квадраты. …

2
Как совместить результаты логистической регрессии и случайного леса?
Я новичок в машинном обучении. Я применил логистическую регрессию и случайный лес к одному и тому же набору данных. Таким образом, я получаю значение переменной (абсолютный коэффициент для логистической регрессии и значение переменной для случайного леса). Я думаю объединить два, чтобы получить окончательное значение переменной. Кто-нибудь может поделиться своим опытом? …

2
Сравнение двух моделей линейной регрессии
Я хотел бы сравнить две модели линейной регрессии, которые представляют скорости деградации мРНК во времени в двух разных условиях. Данные для каждой модели собираются независимо. Вот набор данных. Время (часы) log (обработка A) log (обработка B) 0 2.02 1.97 0 2.04 2.06 0 1,93 1,96 2 2.02 1.91 2 2,00 …

1
Kernelised k Ближайший сосед
Я новичок в ядрах и попал в ловушку при попытке ядра KNN. прелиминарии Я использую ядро ​​с полиномами: K(x,y)=(1+⟨x,y⟩)dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Ваш типичный евклидов kNN использует следующую метрику расстояния: d(x,y)=||x−y||d(x,y)=||x−y||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert Пусть отображает в некоторое многомерное пространство признаков. Тогда квадрат …

1
Плотность Y = log (X) для гамма-распределенного Х
Этот вопрос тесно связан с этим постом Предположим, у меня есть случайная величина , и я определяю . Я хотел бы найти функцию плотности вероятности .Y = log ( X ) YX∼Gamma(k,θ)X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y=log(X)Y=log⁡(X)Y = \log(X)YYY Первоначально я думал, что я просто определю кумулятивную функцию распределения X, сделаю изменение …

1
Прогнозирование заказанного логита в R
Я пытаюсь сделать упорядоченную регрессию логита. Я управляю моделью вот так (просто глупая маленькая модель, оценивающая количество фирм на рынке по показателям дохода и населения). Мой вопрос о прогнозах. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Когда я запускаю прогнозирование (которое я пытаюсь использовать для получения прогнозируемого значения y), выходные значения равны …

2
Являются ли решения PCA уникальными?
Когда я запускаю PCA для определенного набора данных, предоставляется ли мне уникальное решение? Т.е. я получаю набор 2d координат, основанный на расстояниях между точками. Можно ли найти хотя бы еще одно расположение точек, которое бы соответствовало этим ограничениям? Если ответ да, как я могу найти такое другое решение?
12 pca 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.