Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


3
Статистические методы для данных, где известно только минимальное / максимальное значение
Существует ли какая-либо ветвь статистики, имеющая дело с данными, для которых точные значения неизвестны , но для каждого человека мы знаем максимальную или минимальную привязку к значению ? Я подозреваю, что моя проблема в основном связана с тем, что я изо всех сил пытаюсь сформулировать ее в статистических терминах, но, …

4
Где теория графов в графических моделях?
Введение в графические модели описывает их как «... брак между теорией графов и теорией вероятностей». Я получил часть теории вероятностей, но у меня возникли проблемы с пониманием того, куда именно подходит теория графов. Какие выводы из теории графов помогли углубить наше понимание распределения вероятностей и принятия решений в условиях неопределенности? …

10
Регресс к среднему значению против заблуждения игрока
С одной стороны, у меня есть регресс к среднему значению, а с другой - у меня ошибка игрока . Ошибка Игрока определяется Миллером и Санджурджо (2019) как «ошибочное убеждение, что случайные последовательности имеют систематическую тенденцию к развороту, то есть, что полосы схожих результатов скорее заканчиваются, чем продолжаются». Например, упавшая монета …

2
Насколько хорошо самозагрузка аппроксимирует выборочное распределение оценки?
Недавно изучив начальную загрузку, у меня возник концептуальный вопрос, который до сих пор меня удивляет: У вас есть население, и вы хотите знать атрибут населения, то есть , где я использую для представления населения. Это может означать, например, население. Обычно вы не можете получить все данные от населения. Таким образом, …

2
Гамма против логнормальных распределений
У меня есть экспериментально наблюдаемое распределение, которое выглядит очень похожим на гамма или логнормальное распределение. Я читал, что логнормальное распределение - это максимальное распределение вероятности энтропии для случайной переменной для которой среднее значение и дисперсия являются фиксированными. Обладает ли гамма-распределение подобными свойствами?XXXln(X)ln⁡(X)\ln(X)

3
Какая информация является информацией Фишера?
Предположим, у нас есть случайная величина . Если был истинным параметром, функция правдоподобия должна быть максимизирована, а производная равна нулю. Это основной принцип оценки максимального правдоподобия.X∼f(x|θ)X∼f(x|θ)X \sim f(x|\theta)θ0θ0\theta_0 Насколько я понимаю, информация о Фишере определяется как я( θ ) = E [ ( ∂∂θе( X| θ) )2]I(θ)=E[(∂∂θf(X|θ))2]I(\theta) = \Bbb E …

5
Почему мой интервал начальной загрузки имеет ужасное покрытие?
Я хотел сделать демонстрацию класса, где я сравниваю интервал t с интервалом начальной загрузки и вычисляю вероятность охвата обоих. Я хотел, чтобы данные поступали из искаженного дистрибутива, поэтому я решил сгенерировать данные в exp(rnorm(10, 0, 2)) + 1виде выборки размером 10 из смещенного логнормаляра. Я написал сценарий, чтобы нарисовать 1000 …

3
Может ли ANOVA быть значимым, если ни один из парных t-тестов не является?
Возможно ли для одностороннего (с группами или «уровнями») ANOVA сообщить о существенной разнице, когда ни один из парных t-тестов не делает?N ( N - 1 ) / 2N> 2N>2N>2N( N- 1 ) / 2N(N−1)/2N(N-1)/2 В этом ответе @whuber писал: Хорошо известно, что глобальный тест ANOVA F может обнаружить разницу средних …

2
Отказ от гипотезы с использованием p-значения, эквивалентного гипотезе, не относящейся к доверительному интервалу?
При формальном выводе доверительного интервала оценки я получил формулу, очень похожую на способ вычисления ppp значения. Таким образом, вопрос: формально они эквивалентны? Т.е. отвергает гипотезу H0=0H0=0H_0 = 0 с критическим значением αα\alpha эквивалентным 000 не принадлежащему доверительному интервалу с критическим значениемαα\alpha ?

1
Как стандартные ошибки вычисляются для подобранных значений из логистической регрессии?
Когда вы прогнозируете подходящее значение из модели логистической регрессии, как рассчитываются стандартные ошибки? Я имею в виду для подогнанных значений , а не для коэффициентов (которые включают информационную матрицу Фишера). Я только узнал, как получить числа R(например, здесь, в r-help, или здесь, в переполнении стека), но не могу найти формулу. …

1
Выбор характеристик и модель с glmnet по данным метилирования (p >> N)
Я хотел бы использовать GLM и Elastic Net, чтобы выбрать эти релевантные функции + построить модель линейной регрессии (т. Е. Как прогнозирование, так и понимание, поэтому было бы лучше оставить с относительно небольшим количеством параметров). Выход непрерывный. Это генов на случаев. Я читал об этом пакете, но я не уверен …

4
Площадь под кривой ROC против общей точности
Я немного сбиваю с толку насчет площади под кривой (AUC) ROC и общей точности. Будет ли AUC пропорционален общей точности? Другими словами, когда мы получим большую общую точность, мы определенно увеличим AUC? Или они по определению положительно коррелируют? Если они положительно коррелируют, зачем нам сообщать о них обоих в некоторых …

1
Доказательство того, что коэффициенты в модели OLS следуют t-распределению с (nk) степенями свободы
Задний план Предположим, у нас есть модель Обыкновенных наименьших квадратов, в которой у нас есть коэффициентов в нашей регрессионной модели, kkky=Xβ+ϵy=Xβ+ϵ\mathbf{y}=\mathbf{X}\mathbf{\beta} + \mathbf{\epsilon} где - вектор коэффициентов, - матрица проектирования, определяемая какββ\mathbf{\beta}(k×1)(k×1)(k\times1)XX\mathbf{X} X=⎛⎝⎜⎜⎜⎜⎜⎜11⋮1x11x21xn1x12…⋱………x1(k−1)⋮⋮xn(k−1)⎞⎠⎟⎟⎟⎟⎟⎟X=(1x11x12…x1(k−1)1x21…⋮⋮⋱⋮1xn1……xn(k−1))\mathbf{X} = \begin{pmatrix} 1 & x_{11} & x_{12} & \dots & x_{1\;(k-1)} \\ 1 & x_{21} & \dots …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.