Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
В чем разница между эконометрикой временных рядов и эконометрикой панельных данных?
Этот вопрос может быть очень наивным, но то, как меня учат эконометрике, меня очень смущает, если есть разница между временными рядами и методом панельных данных. Что касается временных рядов, я рассмотрел такие темы, как стационарная ковариация, AR, MA и т. Д. Что касается данных панели, я видел дискуссии только в …

1
Почему определение непротиворечивой оценки таково, как оно есть? Как насчет альтернативных определений согласованности?
Цитата из Википедии: В статистике непротиворечивая оценка или асимптотически непротиворечивая оценка является оценщиком - правилом для вычисления оценок параметра обладающим тем свойством, что, поскольку число используемых точек данных увеличивается бесконечно, результирующая последовательность оценок сходится по вероятности к θ ^ * .θ*θ*θ^*θ*θ*θ^* Чтобы сделать это утверждение точным, пусть θ*θ*\theta^* будет значением …

2
Поддерживает ли машина опорных векторов несбалансированный набор данных?
SVM обрабатывает несбалансированный набор данных? Это какие-либо параметры (например, C или стоимость неправильной классификации), обрабатывающие несбалансированный набор данных?

1
Как использовать дельта-метод, когда производная первого порядка равна нулю?
http://en.wikipedia.org/wiki/Delta_method В статье в Википедии предполагалось, что грамм'( θ )грамм'(θ)g'(\theta) должно существовать и что грамм'( θ )грамм'(θ)g'(\theta) имеет ненулевое значение. Можно ли найти асимптотическое распределение для N--√( г( ХN) - г( θ ) )N(грамм(ИксN)-грамм(θ))\sqrt{n}(g(X_n)-g(\theta)) учитывая, чтограмм'( θ)грамм'(θ)g'(\theta)может быть равно нулю и?N--√( ХN- θ ) →dN( 0 , σ2)N(ИксN-θ)→dN(0,σ2)\sqrt{n}(X_n-\theta) \stackrel{d}{\rightarrow} N(0,\sigma^2)

3
Теория ответа предмета против подтверждающего факторного анализа
Мне было интересно, каковы основные, значимые различия между теорией ответа предмета и анализом фактора подтверждения. Я понимаю, что есть различия в вычислениях (фокусируясь больше на элемент против ковариаций; лог-линейный против линейного). Однако я понятия не имею, что это означает с точки зрения более высокого уровня - означает ли это, что …

5
Есть ли мера «равномерности» распространения?
Я посмотрел в Интернете, но не смог найти ничего полезного. Я в основном ищу способ измерить, насколько «равномерно» распределено значение. Как и в «равномерно» распределенном распределении, таком как X : и «неравномерно» распределенное распределение Y примерно того же среднего значения и стандартного отклонения: Но есть ли мера равномерности m, такая …

5
Что именно цензурированные данные?
Я прочитал различные описания цензурированных данных: A) Как объяснено в этой теме, не количественные данные ниже или выше определенного порога подвергаются цензуре. Неколичественно означает, что данные выше или ниже определенного порога, но мы не знаем точного значения. Затем данные помечаются при низком или высоком пороговом значении в регрессионной модели. Это …

3
Bootstrap: проблема переоснащения
Предположим, что кто-то выполняет так называемый непараметрический бутстрап, рисуя выборок размером n каждая из исходных n наблюдений с заменой. Я полагаю, что эта процедура эквивалентна оценке кумулятивной функции распределения по эмпирическому cdf:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function и затем получение образцов начальной загрузки путем моделирования наблюдений из оцененных cdf B раз подряд.nnnBBB Если я …

1
Полосы доверия для линии QQ
Этот вопрос конкретно не относится к R, но я решил использовать его Rдля иллюстрации. Рассмотрим код для получения доверительных полос вокруг (нормальной) qq-строки: library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Я ищу объяснение (или альтернативную ссылку на бумажный / онлайн-документ, объясняющий), как устроены эти доверительные интервалы (я видел ссылку на Fox 2002 в …

4
Предвзятость в выборе жюри?
Друг представляет клиента по апелляции после уголовного процесса, в ходе которого выясняется, что выбор присяжных был расистским. Жюри состояло из 30 человек в 4 расовых группах. Обвинение использовало императивные вызовы, чтобы исключить 10 из этих людей из пула. Количество людей и количество реальных проблем в каждой расовой группе были, соответственно: …

2
к-значит против к-медиана?
Я знаю, что есть алгоритм кластеризации k-средних и k-медиана. Один использует среднее в качестве центра кластера, а другой использует медиану. Мой вопрос: когда и где использовать что?

3
Имеют ли значение коэффициенты логистической регрессии?
У меня есть проблема двоичной классификации из нескольких функций. Имеют ли коэффициенты (регуляризованной) логистической регрессии интерпретируемый смысл? Я думал, что они могли бы указать размер влияния, учитывая особенности, предварительно нормированные. Однако в моей задаче коэффициенты, похоже, зависят от выбранных мной функций. Даже знак коэффициентов изменяется с различными наборами признаков, выбранными …

2
Субъективность в частной статистике
Я часто слышу утверждение, что байесовская статистика может быть очень субъективной. Основным аргументом является то, что логический вывод зависит от выбора априора (хотя для выбора априора можно использовать принцип безразличия или максимальной энтропии). По сравнению с утверждением, статистика часто встречается более объективно. Сколько правды в этом утверждении? Кроме того, это …

1
Диагностика сходимости Гельмана и Рубина, как обобщить работу с векторами?
Диагностика Гельмана и Рубина используется для проверки сходимости нескольких параллельных цепочек mcmc. Он сравнивает дисперсию внутри цепочки с дисперсией между цепями, описание приведено ниже: Шаги (для каждого параметра): Запустите m ≥ 2 цепочки длиной 2n из перераспределенных начальных значений. Откажитесь от первых n розыгрышей в каждой цепочке. Рассчитайте дисперсию внутри …

4
Означает ли «корреляция» также наклон в регрессионном анализе?
Я читаю газету, и автор пишет: Влияние A, B, C на Y изучалось с помощью множественного регрессионного анализа. A, B, C были введены в уравнение регрессии с Y в качестве зависимой переменной. Дисперсионный анализ представлен в Таблице 3. Эффект B на Y был значительным, причем B коррелировал .27 с Y. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.