Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Оценить квантиль значения в векторе
У меня есть набор реальных чисел. Мне нужно оценить квантиль нового числа. Есть ли чистый способ сделать это в R? в целом? Я надеюсь, что это не ультра-тривиально ;-) Очень признателен за ваш ответ. PK
26 r 

3
Чем нахождение центроида отличается от нахождения среднего значения?
При выполнении иерархической кластеризации можно использовать множество метрик для измерения расстояния между кластерами. Две такие метрики подразумевают вычисление центроидов и средних точек данных в кластерах. В чем разница между средним и центроидом? Разве это не одна и та же точка в кластере?
26 clustering  mean 

3
Как я могу интерпретировать «корреляции фиксированных эффектов» в моем блеске?
У меня есть следующий вывод: Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS2 +sAG2 +sSHDI2 +sbare +season +crop +(1|landscape) AIC BIC logLik deviance 4062 4093 -2022 4044 Random effects: Groups Name Variance Std.Dev. landscape (Intercept) 0.82453 0.90804 Number of obs: 239, groups: landscape, 45 Fixed …

2
Как вычислить SVD огромной разреженной матрицы?
Каков наилучший способ вычисления разложения по сингулярным числам (SVD) очень большой положительной матрицы (65M x 3,4M), где данные чрезвычайно редки? Менее 0,1% матрицы не равно нулю. Мне нужен способ, который: впишется в память (я знаю, что онлайн методы существуют) будет рассчитан в разумные сроки: 3,4 дня будет достаточно точным, однако …
26 svd  numerics 

2
Три версии дискриминантного анализа: различия и как их использовать
Кто-нибудь может объяснить различия и привести конкретные примеры, как использовать эти три анализа? LDA - линейный дискриминантный анализ FDA - дискриминантный анализ Фишера QDA - Квадратичный дискриминантный анализ Я искал везде, но не смог найти реальных примеров с реальными значениями, чтобы увидеть, как используются эти анализы и как рассчитываются данные, …

2
Преимущества двойного лассо или двойного лассо?
Однажды я слышал метод использования лассо дважды (например, двойное лассо), когда вы выполняете лассо на исходном наборе переменных, скажем, S1, получаете разреженный набор с именем S2, а затем снова выполняете лассо на множестве S2, чтобы получить множество S3. , Есть ли методологический термин для этого? Кроме того, каковы преимущества выполнения …

3
Почему модели гауссовских процессов называют непараметрическими?
Я немного смущен. Почему гауссовские процессы называют непараметрическими моделями? Они предполагают, что функциональные значения или их подмножества имеют гауссовский априор со средним 0 и ковариационную функцию, заданную в качестве функции ядра. Эти функции ядра сами имеют некоторые параметры (например, гиперпараметры). Так почему их называют непараметрическими моделями?

2
Диагностика коллинеарности проблематична только тогда, когда включен термин взаимодействия
Я провел регрессию по округам США и проверяю коллинеарность в моих «независимых» переменных. Belsley, Kuh и Welsch's Regression Diagnostics предлагают взглянуть на Пропорции индекса состояния и дисперсии дисперсии: library(perturb) ## colldiag(, scale=TRUE) for model with interaction Condition Index Variance Decomposition Proportions (Intercept) inc09_10k unins09 sqmi_log pop10_perSqmi_log phys_per100k nppa_per100k black10_pct hisp10_pct …

5
Стратегии внедрения расширенной статистики в различные аудитории
Я работаю в основном с не статистиками в таких областях, как медицина, социальные науки и образование. Независимо от того, консультируюсь ли я с аспирантами, помогаю исследователям со статьями или рецензирую статьи для журналов, я часто сталкиваюсь с проблемой, что кто-то (клиент, автор, диссертационный комитет, редактор журнала) хочет использовать какую-то относительно …
26 consulting 

3
Тематические модели и методы совместного использования слов
Популярные тематические модели, такие как LDA, обычно объединяют слова, которые обычно объединяются в одну и ту же тему (кластер). В чем основное различие между такими тематическими моделями и другими простыми подходами кластеризации на основе совпадений, такими как PMI? (PMI расшифровывается как Pointwise Mutual Information и используется для идентификации слов, которые …

2
Геометрическая интерпретация штрафной линейной регрессии
Я знаю, что линейная регрессия может рассматриваться как «линия, которая расположена ближе всего ко всем точкам» : Но есть и другой способ увидеть это, визуализируя пространство столбцов как «проекцию на пространство, охватываемое столбцами матрицы коэффициентов» : Мой вопрос: в этих двух интерпретациях, что происходит, когда мы используем штрафованную линейную регрессию, …

1
Можно ли распространить критерий Мантеля на асимметричные матрицы?
Тест Мантеля обычно применяется к симметричным матрицам расстояний / разностей. Насколько я понимаю, предположение теста состоит в том, что мера, используемая для определения различий, должна быть, по крайней мере, полуметрической (соответствовать стандартным требованиям метрики, но не неравенству треугольника). Может ли предположение о симметрии быть ослаблено (давая предварительную метрику)? Можно ли …

1
Как интерпретировать коэффициент стандартных ошибок в линейной регрессии?
Мне интересно, как интерпретировать коэффициент стандартных ошибок регрессии при использовании функции отображения в R. Например, в следующем выводе: lm(formula = y ~ x1 + x2, data = sub.pyth) coef.est coef.se (Intercept) 1.32 0.39 x1 0.51 0.05 x2 0.81 0.02 n = 40, k = 3 residual sd = 0.90, R-Squared …

7
Каково минимальное рекомендуемое количество групп для фактора случайных эффектов?
Я использую смешанную модель в R( lme4) для анализа некоторых данных повторных измерений. У меня есть переменная реакции (содержание волокна в кале) и 3 фиксированных эффекта (масса тела и т. Д.). В моем исследовании всего 6 участников, по 16 повторных измерений для каждого (хотя у двух только 12 повторений). Субъектами …

2
Когда следует использовать критерий суммы рангов Уилкоксона вместо непарного t-критерия?
Это дополнительный вопрос к тому, что Фрэнк Харрелл написал здесь : По моему опыту, требуемый размер выборки для точного распределения t часто больше, чем размер выборки под рукой. Тест на звание ранга Уилкоксона чрезвычайно эффективен, как вы сказали, и он надежен, поэтому я почти всегда предпочитаю его тесту t Если …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.