Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

12
Реальные примеры распределений с отрицательной асимметрией
Вдохновленный « реальными примерами общих распределений », интересно , что педагогические примеры люди используют , чтобы продемонстрировать отрицательную асимметрию? Есть много «канонических» примеров симметричных или нормальных распределений, используемых в обучении - даже если такие, как рост и вес, не выдерживают более тщательного биологического исследования! Кровяное давление может быть ближе к …

1
Какая функция может быть ядром?
В контексте машинного обучения и распознавания образов существует концепция Kernel Trick . Перед лицом проблем, когда меня просят определить, может ли функция быть функцией ядра или нет, что именно нужно сделать? Должен ли я сначала проверить, имеют ли они форму трех или четырех функций ядра, таких как полином, RBF и …

3
Как рассчитать качество посадки в glm (R)
У меня есть следующий результат от запуска функции GLM. Как я могу интерпретировать следующие значения: Нулевое отклонение Остаточное отклонение AIC Они имеют какое-то отношение к совершенству? Могу ли я рассчитать некоторую степень достоверности соответствия по этим результатам, таким как R-квадрат или любая другая мера? Call: glm(formula = tmpData$Y ~ tmpData$X1 …

2
Естественная интерпретация гиперпараметров LDA
Может кто-нибудь объяснить, какова естественная интерпретация гиперпараметров LDA? ALPHAи BETAявляются параметрами распределения Дирихле для (по документу) темы и (по теме) словосочетания соответственно. Однако кто-то может объяснить, что значит выбирать большие значения этих гиперпараметров по сравнению с меньшими значениями? Означает ли это, что в документах должно быть какое-то предварительное убеждение с …

1
Роль n.minobsinnode параметра GBM в R [закрыто]
Этот вопрос вряд ли поможет будущим посетителям; это относится только к небольшому географическому региону, конкретному моменту времени или необычайно узкой ситуации, которая обычно не применима к всемирной аудитории Интернета. Чтобы сделать этот вопрос более применимым, посетите справочный центр . Закрыто 7 лет назад . Я хотел знать, что означает параметр …
21 r  gbm 


3
Как интерпретировать основные эффекты, когда эффект взаимодействия незначителен?
Я запустил обобщенную линейную смешанную модель в R и включил эффект взаимодействия между двумя предикторами. Взаимодействие не было значительным, но основные эффекты (два предиктора) были оба. Теперь многие примеры из учебников говорят мне, что, если взаимодействие имеет существенный эффект, основные эффекты не могут быть интерпретированы. Но что, если ваше взаимодействие …

4
Функциональный анализ главных компонентов (FPCA): что это такое?
Функциональный анализ главных компонентов (FPCA) - это то, на что я наткнулся и никогда не мог понять. О чем это все? См. «Обзор функционального анализа главных компонентов», 2011 г. , и я цитирую: PCA сталкивается с серьезными трудностями при анализе функциональных данных из-за «проклятия размерности» (Bellman 1961). «Проклятие размерности» происходит …

2
Может ли небольшой размер выборки вызвать ошибку типа 1?
Я узнал, что небольшой размер выборки может привести к недостаточной мощности и ошибке 2 типа. Тем не менее, у меня есть ощущение, что небольшие образцы просто могут быть ненадежными и могут привести к любому результату случайно. Это правда?

3
Почему случайные величины определяются как функции?
У меня проблемы с пониманием концепции случайной величины как функции. Я понимаю механику (я думаю), но я не понимаю мотивации ... Скажет (Ω,B,P)(Ω,В,п)(\Omega, B, P) представляет собой вероятность того, тройной, где Ω=[0,1]Ωзнак равно[0,1]\Omega = [0,1] , BВB представляет собой Борель σσ\sigma - алгебру на этом интервал и PпP является регулярной …

2
Почему
Фон Одним из наиболее часто используемых слабых предшествующих отклонений является обратная гамма с параметрами (Gelman 2006) .α = 0,001 , β= 0,001αзнак равно0,001,βзнак равно0,001\alpha =0.001, \beta=0.001 Однако это распределение имеет 90% CI приблизительно .[ 3 × 1019, ∞ ][3×1019,∞][3\times10^{19},\infty] library(pscl) sapply(c(0.05, 0.95), function(x) qigamma(x, 0.001, 0.001)) [1] 3.362941e+19 Inf Исходя …

3
Потеря обучения увеличивается со временем [дубликат]
На этот вопрос уже есть ответы здесь : Как изменение функции стоимости может быть положительным? (1 ответ) Что мне делать, если моя нейронная сеть не учится? (5 ответов) Закрыто в прошлом месяце . Я тренирую модель (Recurrent Neural Network), чтобы классифицировать 4 типа последовательностей. Во время тренировок я вижу, что …

2
PCA в NumPy и Sklearn дает разные результаты
Я что-то неправильно понимаю. Это мой код используя sklearn import numpy as np import matplotlib.pyplot as plt from mpl_toolkits.mplot3d import Axes3D from sklearn import decomposition from sklearn import datasets from sklearn.preprocessing import StandardScaler pca = decomposition.PCA(n_components=3) x = np.array([ [0.387,4878, 5.42], [0.723,12104,5.25], [1,12756,5.52], [1.524,6787,3.94], ]) pca.fit_transform(x) Выход: array([[ -4.25324997e+03, -8.41288672e-01, …

2
Как работают узкие места в нейронных сетях?
Мы определяем архитектуру узких мест как тип, найденный в статье ResNet, где [два конвексных слоя 3x3] заменяются на [один конв 1x1, один конв 3x3 и еще один слой конвекс 1x1]. Я понимаю, что конвексные слои 1x1 используются как форма уменьшения размеров (и восстановления), что объясняется в другом посте . Однако …

1
Разница между скрытыми марковскими моделями и фильтром частиц (и фильтром Калмана)
Вот мой старый вопрос Я хотел бы спросить, знает ли кто-нибудь разницу (если есть какая-либо разница) между скрытыми марковскими моделями (HMM) и Particle Filter (PF), и, как следствие, Kalman Filter, или при каких обстоятельствах мы используем какой алгоритм. Я студент, и я должен сделать проект, но сначала я должен понять …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.