Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Определение размера выборки с пропорцией и биномиальным распределением
Я пытаюсь изучить некоторые статистические данные, используя книгу «Биометрия» Сокала и Рольфа (3e). Это упражнение в 5-й главе, которое охватывает вероятность, биномиальное распределение и распределение Пуассона. Я понимаю, что есть формула для ответа на этот вопрос: Однако этого уравнения нет в этом тексте. Я хотел бы знать, как рассчитать размер …

1
В каких реализациях требуется масштабирование переменных (возможностей) и нормализация (настройка) переменных деревьев решений?
Во многих алгоритмах машинного обучения масштабирование функций (или переменное масштабирование, нормализация) является обычным этапом предварительной обработки. Википедия - Масштабирование функций - этот вопрос был близким Вопрос № 41704 - Как и почему работают нормализация и масштабирование функций? У меня есть два вопроса, особенно в отношении деревьев решений: Существуют ли какие-либо …

4
Последствия текущих дебатов о статистической значимости
В последние несколько лет различные ученые поднимали пагубную проблему проверки научной гипотезы, получившую название «степень свободы исследователя», что означает, что ученые имеют множество вариантов выбора в ходе анализа, которые смещаются в сторону обнаружения с p-значением <5%. Эти неоднозначные варианты выбора, например, включают в себя случай, который классифицируется как выброс, выполнение …

1
Должен ли я использовать приблизительные степени свободы Уэлча (1947) или Satterthwaite (1946)?
Меня смущает правильная формула приблизительных степеней свободы, которую можно использовать для t-теста Уэлча. Формула Satterthwaite (1946) - это наиболее часто цитируемая формула, но Уэлч дал альтернативу в 1947 году. Я не уверен, что является предпочтительным (или используется большинством статистических программ). Формула Саттервейта: ( с2Икс/ нИкс+ с2Y/ нY)2( с2Икс/ нИкс)2/ ( …

1
Объяснение фильтров Калмана в моделях пространства состояний
Каковы этапы использования фильтров Калмана в моделях пространства состояний? Я видел несколько разных формулировок, но я не уверен в деталях. Например, Cowpertwait начинается с этого набора уравнений: θt=Gtθt-1+wtyt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} где и , - наши неизвестные оценки, а - наблюдаемые значения.ш т ~ N ( 0 , …

3
Как интерпретировать отношение рисков по непрерывной переменной - единице разницы?
Я читаю статью, в которой показаны коэффициенты опасности для непрерывных переменных, но я не уверен, как интерпретировать данные значения. Мое текущее понимание коэффициентов опасности состоит в том, что число представляет относительную вероятность [события] при определенном условии. Например: если отношение риска смерти от рака легких при курении (бинарное событие) равно 2, …

2
PyMC для непараметрической кластеризации: процесс Дирихле для оценки параметров гауссовой смеси не кластеризуется
Настройка проблемы Одной из первых игрушечных проблем, к которой я хотел применить PyMC, является непараметрическая кластеризация: с учетом некоторых данных смоделируйте их как гауссову смесь и узнайте количество кластеров, а также среднее значение и ковариацию каждого кластера. Большая часть того, что я знаю об этом методе, взята из видео-лекций Майкла …

2
Подходит ли двухсторонний ANOVA?
Это описание моего исследования. Я экспериментирую с тремя растениями: A, B и C. Предполагается, что эти растения снижают уровень глюкозы в крови у пациентов с диабетом. Я хочу определить, какое из этих трех растений оказывает более длительное влияние на снижение уровня глюкозы в крови после однократного введения мышам. Это делается …

2
Ошибка распространения SD против SE
У меня от 3 до 5 показателей качества на человека в двух разных состояниях (A и B). Я черчения в среднем для каждого человека в каждом состоянии , и я использую стандартную ошибку ( то есть , , с = число измерений) как погрешностями.SD/N−−√SD/NSD/\sqrt{N}NNN Теперь я хочу построить график разницы …

1
Общие теоремы для непротиворечивости и асимптотической нормальности максимального правдоподобия
Я заинтересован в хорошей ссылке на результаты, касающиеся асимптотических свойств оценок максимального правдоподобия. Рассмотрим модель где - это мерная плотность, а - это MLE, основанный на образце из где - это "истинное" значение . Есть два нарушения, которые меня интересуют.{fn(⋅∣θ):θ∈Θ,n∈N}{fn(⋅∣θ):θ∈Θ,n∈N}\{f_n(\cdot \mid \theta): \theta \in \Theta, n \in \mathbb N\}fn(x∣θ)fn(x∣θ)f_n(\mathbf x …

2
Имеет ли смысл рассчитывать доверительные интервалы и проверять гипотезы, когда доступны данные по всей совокупности?
Имеет ли смысл рассчитывать доверительные интервалы и проверять гипотезы, когда доступны данные по всей совокупности? На мой взгляд, ответ - нет, поскольку мы можем точно рассчитать истинные значения параметров. Но тогда, какова максимальная доля данных от первоначального населения, которая позволяет нам использовать вышеупомянутые методы?

6
Гибкие и негибкие модели в машинном обучении
Я столкнулся с простым вопросом о сравнении гибких моделей (т.е. сплайнов) с негибкими моделями (например, линейной регрессией) при различных сценариях. Вопрос в том: В целом, ожидаем ли мы, что эффективность гибкого статистического метода обучения будет лучше или хуже, чем у негибкого метода, когда: Количество предикторов чрезвычайно велико, а количество наблюдений …

3
Путаница, связанная с эластичной сеткой
Я читал эту статью, связанную с эластичной сеткой. Они говорят, что они используют эластичную сеть, потому что, если мы просто используем Лассо, это имеет тенденцию выбирать только один предиктор среди предикатов, которые сильно коррелируют. Но разве это не то, что мы хотим. Я имею в виду, что это избавляет нас …

2
Тест на пригодность: вопрос о тесте Андерсона – Дарлинга и критерии Крамера – фон Мизеса
Я читаю веб-страницы для проверки пригодности, когда я пришел к тесту Андерсона – Дарлинга и критерию Крамера – фон Мизеса . До сих пор я понял суть; кажется, что критерий Андерсона – Дарлинга и критерий Крамера – фон Мизеса схожи, просто основаны на другой весовой функции . Также есть вариант …

1
Почему статистики не используют взаимную информацию в качестве меры ассоциации?
Я видел пару выступлений не-статистиков, где они, похоже, заново изобретают меры корреляции, используя взаимную информацию, а не регрессию (или эквивалентные / тесно связанные статистические тесты). Я полагаю, есть веская причина, по которой статистики не используют такой подход. Мое непрофессионал понимает, что оценки энтропии / взаимной информации, как правило, являются проблемными …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.