Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Несмещенная оценка с минимальной дисперсией для
Пусть X1,...,XnX1,...,Xn X_1, ...,X_n - случайная выборка из распределения Geometric(θ)Geometric(θ)Geometric(\theta) для 0&lt;θ&lt;10&lt;θ&lt;10<\theta<1 . То есть, pθ(x)=θ(1−θ)x−1I{1,2,...}(x)pθ(x)=θ(1−θ)x−1I{1,2,...}(x)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) Найти несмещенную оценку с минимальной дисперсией для g(θ)=1θg(θ)=1θg(\theta)=\frac{1}{\theta} Моя попытка: Поскольку геометрическое распределение принадлежит экспоненциальному семейству, статистика ∑Xi∑Xi\sum X_i является полной и достаточной для θθ \theta . Кроме того, если T(X)=X1T(X)=X1T(X)=X_1 является оценкой …

3
Почему людям нравятся гладкие данные?
Я должен использовать квадратное экспоненциальное ядро ​​(SE) для регрессии гауссовских процессов. Преимущества этого ядра: 1) просто: всего 3 гиперпараметра; 2) гладкое: это ядро ​​гауссово. Почему людям так нравится «гладкость»? Я знаю, что ядро ​​Гаусса бесконечно дифференцируемо, но так ли это важно? (Пожалуйста, дайте мне знать, если есть другие причины, почему …

1
Экспоненциальная семья: наблюдаемая и ожидаемая достаточная статистика
Мой вопрос возникает из прочтения чтения Минки «Оценка распределения Дирихле» , в котором без доказательств говорится следующее в контексте получения оценки максимального правдоподобия для распределения Дирихле на основе наблюдений случайных векторов: Как всегда в случае экспоненциального семейства, когда градиент равен нулю, ожидаемые достаточные статистические данные равны наблюдаемым достаточным статистическим данным. …


4
Наименее коррелированное подмножество случайных величин из корреляционной матрицы
У меня есть корреляционная матрица AAA , которую я получил, используя коэффициент линейной корреляции Пирсона через функцию Matlab corrcoef () . Корреляционная матрица размерности 100x100, т.е. я вычислил корреляционную матрицу на 100 случайных величин. Среди этих 100 случайных величин я хотел бы найти 10 случайных величин, чья матрица корреляции содержит …

5
Является ли использование децилей для нахождения корреляции статистически обоснованным подходом?
У меня есть выборка из 1449 точек данных, которые не коррелированы (r-квадрат 0,006). Анализируя данные, я обнаружил, что путем разделения значений независимых переменных на положительные и отрицательные группы, как представляется, существует значительная разница в среднем зависимой переменной для каждой группы. Разбивая точки на 10 бинов (децилей) с использованием значений независимых …

2
Логистическая регрессия и порядковые независимые переменные
Я нашел этот пост: Да. Коэффициент отражает изменение логарифмических коэффициентов для каждого приращения изменения в порядковом предикторе. Эта (очень распространенная) спецификация модели предполагает, что предиктор оказывает линейное влияние на свои приращения. Чтобы проверить предположение, вы можете сравнить модель, в которой вы используете порядковую переменную в качестве единственного предиктора, с моделью, …

1
Как сравнить силу двух корреляций Пирсона?
Рецензент спросил меня, можно ли сравнить корреляции Пирсона (r-значения), представленные в таблице, друг с другом, чтобы можно было утверждать, что одно "сильнее", чем другое (кроме простого взгляда на фактические r-значения) , Как бы вы пошли об этом? Я нашел этот метод http://vassarstats.net/rdiff.html но я не уверен, если это применимо.

2
Оценка размера пересечения нескольких наборов с использованием выборки из одного набора
Я работаю над алгоритмом, который должен рассчитать размер набора, сгенерированного пересечениями не менее 2 наборов. Более конкретно: z=|A0∩…∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | Пересекающиеся наборы генерируются запросами SQL, и, чтобы поддерживать скорость, я заблаговременно получаю счет каждого запроса, затем беру набор с наименьшим счетом ( …
10 error  sample 

1
Как интерпретировать значения GAM P?
Меня зовут Хью, и я аспирант, использующий обобщенные аддитивные модели, чтобы провести некоторый исследовательский анализ. Я не уверен, как интерпретировать p-значения, полученные из пакета MGCV, и хотел проверить мое понимание (я использую версию 1.7-29 и ознакомился с некоторыми документами Саймона Вуда). Сначала я искал другие CV-вопросы, но, похоже, наиболее важные …
10 p-value  mgcv 

1
Распределение вероятностей функций случайных величин?
У меня есть сомнение: рассмотрим вещественные случайные величины и определенные в пространстве вероятностей .XXXZZZ(Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) Пусть , где - вещественная функция. Поскольку является функцией случайных величин, это случайная величина.Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z)g(⋅)g(⋅)g(\cdot)YYY Пусть , т.е. реализацию .x:=X(ω)x:=X(ω)x:=X(\omega)XXX Является ли равным ?P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x)P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))

2
Почему алгоритм итерации политики сходится к оптимальной функции политики и стоимости?
Я читал лекционные заметки Эндрю Нга по обучению с подкреплением и пытался понять, почему итерации политики сходятся к функции оптимального значения V∗V∗V^* и оптимальной политике .π∗π∗\pi^* Напомним, итерация политики: Initialize π randomlyRepeat{Let V:=Vπ \for the current policy, solve bellman's eqn's and set that to the current VLet π(s):=argmaxa∈A∑s′Psa(s′)V(s′)}Initialize π randomlyRepeat{Let …

2
Значение P для члена взаимодействия в моделях смешанных эффектов с использованием lme4
Я анализирую некоторые поведенческие данные, используя lme4in R, в основном следуя отличным учебникам Бодо Винтера , но не понимаю, правильно ли я обрабатываю взаимодействия. Хуже того, никто другой, участвующий в этом исследовании, не использует смешанные модели, поэтому я немного волнуюсь, чтобы убедиться, что все правильно. Вместо того, чтобы просто плакать …

1
Как рассчитать 95% доверительный интервал для нелинейного уравнения?
У меня есть уравнение, чтобы предсказать вес ламантинов от их возраста, в днях (dias, на португальском языке): R &lt;- function(a, b, c, dias) c + a*(1 - exp(-b*dias)) Я смоделировал это в R, используя nls (), и получил этот рисунок: Теперь я хочу рассчитать 95% доверительный интервал и построить его …

3
Различные непараметрические методы оценки вероятности распределения данных
У меня есть некоторые данные, и я пытался подогнать их под плавную кривую. Тем не менее, я не хочу навязывать ему слишком много предыдущих убеждений или слишком сильных предварительных представлений (кроме тех, которые подразумеваются в остальной части моего вопроса) или каких-либо конкретных распределений. Я просто хотел подогнать его к некоторой …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.