Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Модельные предположения о регрессии частичных наименьших квадратов (PLS)
Я пытаюсь найти информацию относительно предположений о регрессии PLS (одиночный ). Я особенно заинтересован в сравнении допущений PLS с регрессией OLS. YYy Я прочитал / пролистал много литературы по теме PLS; работы Вольда (Сванте и Германа), Абди и многих других, но не нашли удовлетворительного источника. Wold et al. (2001) PLS-регрессия: …

1
MLE параметра местоположения в распределении Коши
После центрирования два измерения x и -x можно считать независимыми наблюдениями из распределения Коши с функцией плотности вероятности: 1f(x:θ)=f(x:θ)=f(x :\theta) = ,-∞&lt;x&lt;∞1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Покажите, что если MLE для θ равно 0, но если x 2 &gt; 1, есть два MLE для θ , равные …

1
Зачем использовать параметрическую загрузку?
В настоящее время я пытаюсь разобраться в некоторых вещах, касающихся параметрической начальной загрузки. Большинство вещей, вероятно, тривиально, но я все еще думаю, что, возможно, что-то пропустил. Предположим, я хочу получить доверительные интервалы для данных с помощью параметрической процедуры начальной загрузки. Итак, у меня есть этот образец, и я предполагаю, что …

2
используя информацию о соседях при вменении данных или находке вне данных (в R)
У меня есть набор данных с предположением, что ближайшие соседи являются лучшими предикторами. Просто прекрасный пример визуализации двухстороннего градиента Предположим, у нас есть случай, когда несколько значений отсутствуют, мы можем легко предсказать на основе соседей и тренда. Соответствующая матрица данных в R (фиктивный пример для тренировки): miss.mat &lt;- matrix (c(5:11, …

2
Существует ли простая версия теста эквивалентности теста Колмогорова – Смирнова?
Были ли сформулированы два односторонних критерия эквивалентности (TOST) для критерия Колмогорова – Смирнова, чтобы проверить отрицательную гипотезу отрицателя о том, что два распределения отличаются , по крайней мере, по некоторому уровню, указанному исследователем? Если не TOST, то какая-то другая форма теста на эквивалентность? Ник Стаунер мудро указывает, что (я уже …

3
Какие критерии должны быть соблюдены, чтобы сделать вывод о «потолочном эффекте»?
По данным SAGE Encyclopedia of Social Science Методы исследования … [a] потолочный эффект возникает, когда мера имеет четкий верхний предел для потенциальных ответов и большая концентрация участников получает балл в пределах или около этого предела. Масштабное затухание является методологической проблемой, которая возникает всякий раз, когда дисперсия ограничивается таким образом. …

2
Причинность в микроэкономике против причинности Грейнджера в эконометрике временных рядов
Я понимаю причинно-следственную связь, используемую в микроэкономике (в частности, в IV или при расчете разрыва регрессии), а также причинность Грейнджера, используемую в эконометрике временных рядов. Как мне связать одно с другим? Например, я видел, как оба подхода использовались для данных панели (скажем, , T = 20 ). Любая ссылка на …

3
Случайный лес на многоуровневых / иерархически структурированных данных
Я довольно новичок в машинном обучении, методиках CART и тому подобном, и я надеюсь, что моя наивность не слишком очевидна. Как случайный лес обрабатывает многоуровневые / иерархические структуры данных (например, когда интерес представляет межуровневое взаимодействие)? То есть наборы данных с единицами анализа на нескольких иерархических уровнях ( например , ученики, …

1
Как интерпретировать загрузки PCA?
Читая о PCA, я натолкнулся на следующее объяснение: Предположим, у нас есть набор данных, где каждая точка данных представляет баллы одного студента по тесту по математике, тесту по физике, тесту на понимание прочитанного и словарному тесту. Мы находим первые два основных компонента, которые фиксируют 90% изменчивости данных и интерпретируют их …
13 pca 

3
Стандартное отклонение нескольких измерений с неопределенностью
У меня есть два 2 часа данных GPS с частотой дискретизации 1 Гц (7200 измерений). Данные приведены в форме , где - погрешность измерения.(X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)NσNσN_\sigma Когда я беру среднее из всех измерений (например, среднее значение Z за эти два часа), каково его стандартное отклонение? Конечно, я …

1
Современное состояние дедупликации
Каковы современные методы дедупликации записей? Дедупликацию также иногда называют: связывание записи, разрешение объекта, разрешение идентификатора, объединение / очистка. Я знаю, например, о CBLOCK [1]. Я был бы признателен, если бы ответы также включали ссылки на существующее программное обеспечение, реализующее методы. Я знаю, например, что Mahout реализует кластеризацию навеса . Также …

4
Почему все известные дистрибутивы унимодальны?
Я не знаю ни одного мультимодального дистрибутива. Почему все известные дистрибутивы унимодальны? Есть ли какой-нибудь "знаменитый" дистрибутив с более чем одним режимом? Конечно, смеси распределений часто являются мультимодальными, но я хотел бы знать, существуют ли какие-либо «несмешанные» распределения, которые имеют более одной моды.

2
Почему геометрическое распределение и гипергеометрическое распределение называются таковыми?
Почему геометрическое распределение и гипергеометрическое распределение называются «геометрическим» и «гипергеометрическим» соответственно? Это потому что их pmfs принимают какую-то особую форму? Благодарность!

1
Как масштабировать новые наблюдения для прогнозирования, когда модель снабжена масштабированными данными?
Я понимаю концепцию масштабирования матрицы данных для использования в модели линейной регрессии. Например, в R вы можете использовать: scaled.data &lt;- scale(data, scale=TRUE) Мой единственный вопрос: для новых наблюдений, для которых я хочу предсказать выходные значения, как они правильно масштабируются? Это будет scaled.new &lt;- (new - mean(data)) / std(data)?

1
Почему стандартная ошибка перехвата увеличивается с увеличением
Стандартная ошибка свободного члена ( β 0 ) в у = β 1 х + β 0 + ε задается S E ( β 0 ) 2 = σ 2 [ 1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonSE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right] гдеx¯x¯\bar{x}представляет собой среднее изxixix_i«ы. Из того, что я понимаю, SE квантифицирует ваш uncertainty-, например, в 95% …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.