Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Нейронная сеть для множественной выходной регрессии
У меня есть набор данных, содержащий 34 входных столбца и 8 выходных столбцов. Один из способов решения этой проблемы - взять 34 входа и построить индивидуальную модель регрессии для каждого выходного столбца. Мне интересно, если эта проблема может быть решена с помощью только одной модели, особенно с помощью нейронной сети. …

1
Метод Нистроема для аппроксимации ядра
Я читал о методе Nyström для апроксимации ядра низкого ранга. Этот метод реализован в scikit-learn [1] как метод проецирования выборок данных в низкосортное приближение отображения характеристик ядра. Насколько мне известно, данный учебный набор и функция ядра, она генерирует низкокачественного приближение ядро матрицы , применяя SVD к и . n × …


5
Как вы видите, цепь Маркова неприводима?
У меня есть некоторые проблемы с пониманием неприводимого свойства цепочки Маркова . Говорят, что неприводимое означает, что случайный процесс может «перейти из любого состояния в любое состояние». Но что определяет, может ли он перейти из состояния в состояние или не может перейти?жiяijJj Страница википедии дает формализацию: Государство является доступным (написано …

3
Почему важен размер ВК?
Википедия говорит, что: Измерение VC - это мощность наибольшего множества точек, которые алгоритм может разрушить. Например, линейный классификатор имеет мощность n + 1. Мой вопрос, почему мы заботимся? Большинство наборов данных, по которым вы выполняете линейную классификацию, имеют тенденцию быть очень большими и содержать много точек.

3
Как построить путаницу для мультиклассового классификатора?
У меня проблема с 6 классами. Поэтому я строю мультиклассовый классификатор следующим образом: для каждого класса у меня есть один классификатор логистической регрессии, использующий один против всех, что означает, что у меня есть 6 различных классификаторов. Я могу сообщить матрицу путаницы для каждого из моих классификаторов. Но я хотел бы …

2
Неограниченность в причинной модели Рубина - объяснение Леймана
При реализации причинной модели Рубина, одно из (непроверяемых) предположений, которое нам нужно, - это необоснованность, что означает ( Y( 0 ) , Y( 1 ) ) ⊥ T| Икс(Y(0),Y(1))⊥T|Икс(Y(0),Y(1))\perp T|X Если LHS - это контрфактуальность, T - это лечение, а X - ковариаты, которые мы контролируем. Мне интересно, как описать …

1
Что означает лог-равномерное распределение?
Когда кто-то говорит, что данные выбираются из логарифмически равномерного распределения между 128 и 4000, что это значит? Как это отличается от выборки из равномерного распределения? Смотрите эту статью: http://www.jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf Спасибо!


2
Как использовать auto.arima для вменения пропущенных значений
У меня есть серия зоопарка со многими пропущенными значениями. Я читал, что auto.arimaможет вменять эти пропущенные значения? Может кто-нибудь может научить меня, как это сделать? большое спасибо! Это то, что я пытался, но безуспешно: fit <- auto.arima(tsx) plot(forecast(fit))
12 arima 

1
В чем проблема использования R-квадрата в моделях временных рядов?
Я читал, что использование R-квадрата для временных рядов не подходит, потому что в контексте временных рядов (я знаю, что существуют другие контексты) R-квадрат больше не уникален. Почему это? Я пытался найти это, но я ничего не нашел. Обычно я не придаю особого значения R-квадрату (или скорректированному R-квадрату), когда оцениваю свои …

5
Как рассчитать точность и вспомнить в матрице путаницы 3 x 3
Predicted class Cat Dog Rabbit Actual class Cat 5 3 0 Dog 2 3 1 Rabbit 0 2 11 Как я могу рассчитать точность и вспомнить, чтобы стало легко рассчитать F1-счет. Нормальная матрица путаницы - это размерность 2 x 2. Тем не менее, когда он становится 3 х 3, я …

3
Можно ли применить расхождение KL между дискретным и непрерывным распределением?
Я не математик. Я искал в Интернете о KL Divergence. Я узнал, что дивергенция KL измеряет потерянную информацию, когда мы приближаемся к распределению модели относительно входного распределения. Я видел это между любыми двумя непрерывными или дискретными распределениями. Можем ли мы сделать это между непрерывным и дискретным или наоборот?

3
Разница между моделью одновременного уравнения и моделью структурного уравнения
Кто-нибудь может помочь мне понять, в чем различия между моделью одновременного уравнения и моделью структурного уравнения (SEM)? Было бы здорово, если бы кто-нибудь смог предоставить мне литературу по этому вопросу. Кроме того, есть ли литература, где SEM использовался в контексте временных рядов? Литература, которую я получаю, в основном объясняется SEM …

2
Минимальное количество наблюдений для множественной линейной регрессии
Я делаю множественную линейную регрессию. У меня 21 наблюдение и 5 переменных. Моя цель просто найти связь между переменными Достаточно ли моих данных для множественной регрессии? Результат t-теста показал, что 3 мои переменные не являются значимыми. Нужно ли мне снова проводить регрессию со значимыми переменными (или моей первой регрессии достаточно, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.