Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Какое интуитивное значение стоит за случайной величиной, определяемой как «решетка»?
В теории вероятностей неотрицательная случайная величина XXX называется решеткой, если существует d≥0d≥0d \geq 0 такое, что ∑∞n=0P(X=nd)=1∑n=0∞P(X=nd)=1\sum_{n=0}^{\infty}P(X=nd) = 1 . Существует ли геометрическая интерпретация того, почему это определение называется решеткой?

1
Что делать, если высокая точность проверки, но низкая точность испытаний в исследованиях?
У меня есть конкретный вопрос о проверке в исследованиях машинного обучения. Как мы знаем, режим машинного обучения требует от исследователей обучать свои модели данным обучения, выбирать модели-кандидаты по набору проверок и сообщать о точности на наборе испытаний. В очень строгом исследовании тестовый набор может использоваться только один раз. Тем не …

2
Джекниф против LOOCV
Есть ли какая-то разница между складным ножом и перекрестной проверкой? Процедура кажется идентичной, я что-то упустил?

3
Сплайны против регрессии гауссовского процесса
Я знаю, что Гауссова регрессия процесса (GPR) является альтернативой использованию сплайнов для подгонки гибких нелинейных моделей. Я хотел бы знать, в каких ситуациях одна из них более подходит, чем другая, особенно в рамках байесовской регрессии. Я уже рассмотрел Какие преимущества / недостатки использования сплайнов, сглаженных сплайнов и эмуляторов гауссовских процессов? …

1
Существует ли какое-либо необходимое количество отклонений, выявленных PCA, чтобы провести последующий анализ?
У меня есть набор данных с 11 переменными и PCA (ортогональный) был сделан для сокращения данных. Принимая решение о количестве компонентов для сохранения, для меня было очевидно, что по моим знаниям о предмете и графике осыпей (см. Ниже) двух основных компонентов (ПК) было достаточно, чтобы объяснить данные, а остальные компоненты …
15 variance  pca 

1
Как CNN's избегают исчезающей проблемы градиента
Я много читал о сверточных нейронных сетях и удивлялся, как они избегают исчезающей проблемы градиента. Я знаю, что сети глубокого убеждения объединяют одноуровневые автокодеры или другие предварительно обученные мелкие сети и, таким образом, могут избежать этой проблемы, но я не знаю, как этого избежать в CNN. Согласно Википедии : «Несмотря …

4
Сколько данных вам нужно для сверточной нейронной сети?
Если у меня есть сверточная нейронная сеть (CNN), которая имеет около 1 000 000 параметров, сколько нужно обучающих данных (предположим, я делаю стохастический градиентный спуск)? Есть ли эмпирическое правило? Дополнительные примечания: Когда я выполнил стохастический градиентный спуск (например, 64 патча за 1 итерацию), после ~ 10000 итераций точность классификатора может …

3
Выбор оптимального К для КНН
Я выполнил 5-кратное резюме, чтобы выбрать оптимальный K для KNN. И кажется, что чем больше К, тем меньше ошибка ... Извините, у меня не было легенды, но разные цвета представляют разные испытания. Всего их 5, и кажется, что между ними мало различий. Кажется, что ошибка всегда уменьшается, когда K становится …

2
Объяснение для нецелых степеней свободы в t-тесте с неравными отклонениями
Процедура t-теста SPSS сообщает о 2 анализах при сравнении двух независимых средних: один анализ с одинаковыми предполагаемыми отклонениями и один с равными отклонениями не предполагаемый. Степени свободы (df), когда предполагаются равные отклонения, всегда являются целочисленными значениями (и равны n-2). Значение df, когда равные отклонения не предполагаются, не является целым числом …

3
Как выбрать оптимальное количество скрытых факторов при неотрицательной матричной факторизации?
Принимая во внимание матрицы Vm×nVm×n\mathbf V^{m \times n} , неотрицательная матрица Факторизация (ФС) находит две неотрицательных матрицы Wm×kWm×k\mathbf W^{m \times k} и Hk×nHk×n\mathbf H^{k \times n} (то есть со всеми элементами ≥0≥0\ge 0 ) , чтобы представить разложившуюся матрицу , как: V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, например, требуя , …

4
Значение скрытых черт?
Я пытаюсь понять модели матричной факторизации для рекомендательных систем и всегда читаю «скрытые функции», но что это значит? Я знаю, что означает особенность для учебного набора данных, но я не могу понять идею скрытых возможностей. Каждая статья по теме, которую я могу найти, слишком мелкая. Редактировать: если вы хотя бы …

1
Как рассчитать чистоту?
В кластерном анализе, как мы рассчитываем чистоту? Какое уравнение? Я не ищу код, чтобы сделать это для меня. Пусть - кластер k, а - класс j.ωkωk\omega_kcjcjc_j Так чистота практически точность? похоже, что суммирование действительно классифицированного класса на кластер по размеру выборки. источник уравнения Вопрос в том, какова связь между выходом …
15 clustering 

3
Рассчитать расхождение Кульбака-Лейблера на практике?
Я использую KL Divergence как меру различия между 2 p.m.f.p.m.f.p.m.f. PPP и QQQ . =-ΣР(Хя)лп(В(Хя))+ΣР(Хя)лп(Р(Хя))DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Если то мы можем легко вычислить, что P ( X i ) l n ( Q ( X i ) ) = 0 …

4
Как сохранить переменные, не зависящие от времени, в модели с фиксированными эффектами
У меня есть данные о сотрудниках крупной итальянской фирмы за десять лет, и я хотел бы увидеть, как гендерный разрыв в заработках мужчин и женщин менялся с течением времени. Для этого я запускаю объединенные OLS: где - это логарифм за год, X_ {это} включает ковариаты, которые различаются по индивидам и …

2
Смешивать непрерывные и двоичные данные с линейным SVM?
Так что я играл с SVM, и мне интересно, хорошо ли это делать: У меня есть набор непрерывных функций (от 0 до 1) и набор категориальных функций, которые я преобразовал в фиктивные переменные. В этом конкретном случае я кодирую дату измерения в фиктивной переменной: У меня есть 3 периода, из …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.