Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Последовательная проверка гипотез в фундаментальной науке
Я фармаколог и, по моему опыту, почти во всех работах по базовым биомедицинским исследованиям используется t-критерий Стьюдента (либо для вывода, либо для соответствия ожиданиям ...). Пару лет назад мне стало известно, что t-тест Стьюдента - не самый эффективный тест, который можно использовать: последовательные тесты дают гораздо большую мощность для любого …

2
Почему супремум броуновского моста имеет распределение Колмогорова – Смирнова?
Распределение Колмогорова – Смирнова известно из теста Колмогорова – Смирнова . Тем не менее, это также распределение супремума броуновского моста. Поскольку это далеко не очевидно (для меня), я хотел бы попросить вас интуитивно объяснить это совпадение. Ссылки также приветствуются.

3
Надежное обнаружение выбросов в финансовых временных сериях
Я ищу некоторые надежные методы для удаления выбросов и ошибок (независимо от причины) из финансовых данных временных рядов (например, тикданных). Тик-тик-тик финансовые данные временных рядов очень грязные. Он содержит огромные (временные) промежутки, когда биржа закрыта, и делает огромные скачки, когда биржа открывается снова. Когда биржа открыта, все виды факторов вводят …

2
Выбор между «Статистикой» Фридмана и др. И «Статистическими моделями: теория и практика» Фридмана
Я не статистика, но я очень заинтересован в статистике, и я хотел бы купить книгу, чтобы сохранить в качестве справки. У меня есть несколько книг по конкретным предметам (например, «Элементы статистического обучения для машинного обучения» или « Байесовский анализ данных» для… ну, «Байесовский анализ данных»). Я также искал более общую …
16 references 

2
Нужен ли случайный лес масштабируемым или центрированным входным переменным?
Мои входные переменные имеют разные размеры. Некоторые переменные являются десятичными, а некоторые - сотнями. Необходимо ли центрировать (вычитать среднее) или масштабировать (делить на стандартное отклонение) эти входные переменные, чтобы сделать данные безразмерными при использовании случайного леса?

4
Почему P (A, B | C) / P (B | C) = P (A | B, C)?
Я понимаю, что P(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) . Условным является пересечение A и B, деленное на всю площадь B. Но почему P(A∩B|C)/P(B|C)=P(A|B∩C)P(A∩B|C)/P(B|C)=P(A|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) ? Можете ли вы дать некоторую интуицию? Разве это не должно быть: ?P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C)

2
Как использовать порядковую логистическую регрессию со случайными эффектами?
В моем исследовании я буду измерять рабочую нагрузку с помощью нескольких показателей. С вариабельностью сердечного ритма (ВСР), электродермальной активностью (ЭДА) и с субъективной шкалой (СРП). После нормализации IWS имеет три значения: Рабочая нагрузка ниже нормальной Рабочая нагрузка средняя Рабочая нагрузка выше, чем обычно. Я хочу увидеть, насколько хорошо физиологические измерения …

1
Есть ли связь между косинусным сходством, корреляцией Пирсона и z-счетом?
Мне интересно, есть ли связь между этими тремя показателями. Похоже, я не могу установить связь между ними, ссылаясь на определения (возможно, потому что я новичок в этих определениях и с трудом понимаю их). Я знаю, что диапазон сходства косинусов может быть от 0 до 1, и что корреляция Пирсона может …

2
Определение естественных кубических сплайнов для регрессии
Я изучаю сплайны из книги Hastie et al. "Элементы статистического изучения данных: добыча, вывод и прогнозирование". На странице 145 я обнаружил, что естественные кубические сплайны линейны за граничными узлами. В есть узлов, и о таком сплайне в книге дается следующее.KKKξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K Вопрос 1: Как освобождаются 4 степени свободы? …

1
Какое значение имеет количество сверточных фильтров в сверточной сети?
Каково количество фильтров в слое свертки? Как это число влияет на производительность или качество архитектуры? Я имею в виду, мы должны всегда выбирать большее количество фильтров? что хорошего в них? и как люди назначают различное количество фильтров для разных слоев? Я имею в виду, глядя на этот вопрос: как определить …

2
Интерпретация доверительного интервала
Примечание: заранее извиняюсь, если это дубликат, я не нашел аналогичного q в своем поиске Скажем, у нас есть истинный параметр р. Доверительный интервал C (X) - это RV, который содержит p, скажем, 95% времени. Теперь предположим, что мы наблюдаем X и вычисляем C (X). Общий ответ, по-видимому, состоит в том, …

2
Какие обозначения и почему: , ,
Являются ли они просто стилистическими соглашениями (выделены ли курсивом или не курсивом), или есть существенные различия в значениях этих обозначений? Существуют ли другие обозначения, означающие « вероятность », которые следует учитывать в этом вопросе?

3
Когда мы можем говорить о коллинеарности
В линейных моделях нам нужно проверить, существует ли связь между объясняющими переменными. Если они слишком сильно коррелируют, то возникает коллинеарность (то есть переменные частично объясняют друг друга). В настоящее время я просто смотрю на попарную корреляцию между каждой из объясняющих переменных. Вопрос 1: Что классифицирует как слишком большую корреляцию? Например, …

3
Почему нужно использовать REML (вместо ML) для выбора среди вложенных моделей var-covar?
Различные описания по выбору модели на случайные эффекты линейных смешанных моделей инструктируют использовать REML. Я знаю разницу между REML и ML на некотором уровне, но я не понимаю, почему REML следует использовать, потому что ML смещен. Например, неправильно ли проводить LRT для параметра дисперсии модели нормального распределения с использованием ML …

3
Как выбрать приоритет в оценке байесовских параметров
Я знаю 3 метода оценки параметров, ML, MAP и байесовский подход. А для MAP и байесовского подхода нам нужно выбирать априоры для параметров, верно? Скажем, у меня есть эта модель , в которой α , β являются параметрами, чтобы выполнить оценку с использованием MAP или байесовского алгоритма, я прочитал в …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.