Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Если «Стандартная ошибка» и «Доверительные интервалы» измеряют точность измерения, то каковы измерения точности?
В книге «Биостатистика для чайников» на странице 40 я читаю: Стандартная ошибка (сокращенно SE) - это один из способов указать, насколько точна ваша оценка или измерение чего-либо. и Доверительные интервалы предоставляют еще один способ указать точность оценки или измерения чего-либо. Но там ничего не написано, как указать точность измерения. Вопрос: …

2
Когда прекратить дорабатывать модель?
Я изучал статистику из многих книг за последние 3 года, и благодаря этому сайту я многому научился. Тем не менее, один фундаментальный вопрос все еще остается без ответа для меня. У него может быть очень простой или очень сложный ответ, но я точно знаю, что это требует некоторого глубокого понимания …

2
PDF из
Предположим, что определены из с неизвестными иX1,X2,...,XnX1,X2,...,XnX_1, X_2,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)μ∈Rμ∈R\mu \in \mathcal Rσ2>0σ2>0\sigma^2>0 Пусть S здесь стандартное отклонение.Z=X1−X¯S,Z=X1−X¯S,Z=\frac{X_1-\bar{X}}{S}, Можно показать, что имеет Лебега pdfZZZ f(z)=n−−√Γ(n−12)π−−√(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n√)(|Z|)f(z)=nΓ(n−12)π(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n)(|Z|)f(z)=\frac{\sqrt{n} \Gamma\left(\frac{n-1}{2}\right)}{\sqrt{\pi}(n-1)\Gamma\left(\frac{n-2}{2}\right)}\left[1-\frac{nz^2}{(n-1)^2}\right]^{n/2-2}I_{(0,(n-1)/\sqrt{n})}(|Z|) Тогда мой вопрос, как получить этот PDF? Вопрос от здесь в примере 3.3.4 , чтобы найти UMVUE из . Я могу понять логику и процедуры, чтобы …
15 self-study  umvue 

5
Каково распределение разных многогранных кубиков, одновременно раскатанных?
Возьмите 5 платоновых тел из набора костей Dungeons & Dragons. Они состоят из 4-сторонних, 6-сторонних (обычных), 8-сторонних, 12-сторонних и 20-сторонних кубиков. Все начинаются с номера 1 и увеличиваются на 1 до их общего количества. Скатайте их все сразу, возьмите их сумму (минимальная сумма 5, максимальная 50). Сделайте это несколько раз. …

1
На каком уровне тест математически идентичен тесту пропорций?
ФОН: Пропустите безопасно - это здесь для справки, и чтобы узаконить вопрос. Открытие этой статьи гласит: «Знаменитый критерий непредвиденных обстоятельств Карла Пирсона по хи-квадрату получен из другой статистики, называемой z-статистикой, основанной на нормальном распределении. Можно показать, что самые простые версии математически идентичны эквивалентным z-тестам. Тесты дают тот же результат при …

1
Понимание QR-разложения
У меня есть рабочий пример (в R), который я пытаюсь понять дальше. Я использую Limma для создания линейной модели, и я пытаюсь понять, что происходит шаг за шагом в вычислениях кратного изменения. Я в основном пытаюсь выяснить, что происходит для расчета коэффициентов. Из того, что я могу выяснить, QR-декомпозиция используется …

1
Какова допустимая длина последовательности для RNN для моделирования?
Я изучаю использование LSTM ( долговременной кратковременной памяти ) версии рекуррентной нейронной сети (RNN) для моделирования данных временных рядов. По мере увеличения длины последовательности данных сложность сети возрастает. Поэтому мне любопытно, какую длину последовательностей можно было бы моделировать с хорошей точностью? Я хотел бы использовать относительно простую версию LSTM без …

7
Что вы делали, чтобы помнить правило Байеса?
Я думаю, что хороший способ запомнить формулу - это думать о формуле так: Вероятность того, что какое-либо событие A имеет конкретный результат, учитывая результат независимого события B = вероятность того, что оба результата произошли одновременно / что бы мы ни говорили, вероятность ожидаемого результата события A была бы, если бы …
15 bayesian  bayes 

4
Text Mining: как кластеризовать тексты (например, новостные статьи) с помощью искусственного интеллекта?
Я построил некоторые нейронные сети (MLP (полностью подключенные), Elman (рекуррентные)) для различных задач, таких как игра в понг, классификация рукописных цифр и прочее ... Кроме того, я попытался создать несколько первых сверточных нейронных сетей, например, для классификации многозначных рукописных заметок, но я совершенно новичок в анализе и кластеризации текстов, например, …

1
Другие несмещенные оценки, чем СИНИЙ (решение OLS) для линейных моделей
Для линейной модели решение OLS обеспечивает наилучшую линейную несмещенную оценку параметров. Конечно, мы можем обменять смещение на более низкую дисперсию, например, на регрессию гребня. Но мой вопрос касается отсутствия предвзятости. Существуют ли какие-либо другие оценщики, которые обычно используются, которые являются несмещенными, но с большей дисперсией, чем оценочные параметры OLS? Если …

1
Регуляризация для моделей ARIMA
Я знаю о регуляризации типа LASSO, гребня и эластичной сетки в моделях линейной регрессии. Вопрос: Можно ли применить этот (или аналогичный) вид штрафных оценок к моделированию ARIMA (с непустой частью MA)? При построении моделей ARIMA кажется обычным рассмотреть предварительно выбранный максимальный порядок задержки ( , ), а затем выбрать оптимальный …

2
Вопрос о компромиссном отклонении
Я пытаюсь понять компромисс между отклонением оценки, отношением между отклонением оценки и отклонением модели, а также отношением между дисперсией оценки и дисперсией модели. Я пришел к этим выводам: Мы склонны переписывать данные, когда пренебрегаем смещением оценки, то есть когда мы стремимся минимизировать смещение модели, пренебрегая дисперсией модели (другими словами, мы …

2
Повторные измерения ANOVA: каково предположение о нормальности?
Меня смущает предположение о нормальности при повторных измерениях ANOVA. В частности, мне интересно, какие именно нормы должны быть соблюдены. Читая литературу и ответы на резюме, я натолкнулся на три разные формулировки этого предположения. Зависимая переменная внутри каждого (повторного) условия должна распределяться нормально. Часто утверждается, что у RANOVA те же предположения, …

1
Как ответить на вопросы рецензентов о p-значениях в байесовской многоуровневой модели?
Рецензент попросил нас предоставить p-значения, чтобы лучше понять оценки модели в нашей байесовской многоуровневой модели. Модель представляет собой типичную модель множественных наблюдений на одного участника эксперимента. Мы оценили модель с помощью Stan, поэтому мы можем легко вычислить дополнительную апостериорную статистику. В настоящее время мы сообщаем (визуально и в таблицах) среднюю …

1
Использует ли случайный лес Бреймана прирост информации или индекс Джини?
Я хотел бы знать, использует ли случайный лес Бреймана (случайный лес в пакете R randomForest) в качестве критерия расщепления (критерий для выбора атрибута) получение информации или индекс Джини? Я пытался выяснить это на http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm и в документации для пакета randomForest в R. Но единственное, что я обнаружил, это то, что …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.