Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Регуляризация: зачем умножать на 1 / 2м?
В неделю 3 - конспектов в классе Coursera Machine Learning Эндрю Нг , термин добавляется к функции стоимости реализации упорядочению: J+( θ ) = J( θ ) + λ2 мΣJ = 1Nθ2JJ+(θ)знак равноJ(θ)+λ2мΣJзнак равно1NθJ2J^+(\theta) = J(\theta) + \frac{\lambda}{2m} \sum_{j=1}^n \theta_j^2 В примечаниях к лекции говорится: Мы также можем упорядочить все …

2
Недоумение и кросс-энтропия для моделей с n-граммами
Попытка понять связь между перекрестной энтропией и недоумением. В общем случае для модели M , Недоумение (М) = 2 ^ энтропии (M) . Действуют ли эти отношения для всех разных n-грамм, то есть униграмм, биграмм и т. Д.

3
Почему стандартная ошибка пропорции, для данного n, наибольшая для 0.5?
Стандартная ошибка пропорции будет наибольшей, которая может быть для данного N, когда рассматриваемая пропорция составляет 0,5, и становится меньше, чем дальше пропорция от 0,5. Я могу понять, почему это так, когда я смотрю на уравнение для стандартной ошибки пропорции, но я не могу объяснить это дальше. Есть ли объяснение помимо …

3
Оцените расхождение Куллбека Лейблера (КЛ) с Монте-Карло
Я хочу оценить KL-расхождение между двумя непрерывными распределениями f и g. Однако я не могу записать плотность ни для f, ни для g. Я могу сделать выборку как из f, так и из g с помощью какого-либо метода (например, цепочки Маркова Монте Карло). Расхождение KL от f до g определяется …

1
Почему мы не можем использовать
Представьте, что у нас есть модель линейной регрессии с зависимой переменной . Мы находим его . Теперь мы делаем другую регрессию, но на этот раз для , и аналогично находим ее . Мне сказали, что я не могу сравнить оба чтобы увидеть, какая модель лучше подходит. Это почему? Причиной для …

1
Доказательство теоремы Питмана – Купмана – Дармуа
Где найти доказательство теоремы Питмана – Купмана – Дармуа? Я уже давно погуглил. Как ни странно, во многих заметках упоминается эта теорема, но ни в одной из них нет доказательства.

1
Существует ли многовариантный критерий Колмогорова-Смирнова с двумя выборками?
Существует ли многовариантная альтернатива двукратному критерию Колмогорова-Смирнова ? Я имею в виду тест, который можно использовать для проверки, когда два базовых многомерных распределения различаются.

1
Джеффрис до приёма биномиальной вероятности
Если я использую предварительное значение Джеффриса для параметра биномиальной вероятности то это подразумевает использование распределения .thetas ; ~ б е т ( 1 / 2 , 1 / 2 )θθ\thetaθ∼beta(1/2,1/2)θ∼beta(1/2,1/2)\theta \sim beta(1/2,1/2) Если я перейду на новую систему координат то ясно, что также не распространяется как . φ б е …

2
K-ближайший сосед с непрерывными и двоичными переменными
У меня есть набор данных с колонками a b c(3 атрибута). aявляется числовым и непрерывным в то время как bи cявляются категориальными каждый с двумя уровнями. Я использую метод K-Nearest Neighbours для классификации aи bдалее c. Таким образом, чтобы иметь возможность измерять расстояния, я преобразовываю свой набор данных, удаляя bи …

2
Основано ли использование стандартного отклонения на предположении о нормальном распределении?
Мне интересно, было ли стандартное отклонение всегда построено в предположении нормального распределения. Другими словами, если выборка не распределяется нормально, следует ли считать использование стандартного отклонения ошибкой?

3
Разница между MLE и Baum Welch на фитингах HMM
В этом популярном вопросе ответ с высоким голосом разделяет MLE и Baum Welch в подгонке HMM. Для задачи обучения мы можем использовать следующие 3 алгоритма: MLE (оценка максимального правдоподобия), обучение Витерби (НЕ путать с декодированием Витерби), Baum Welch = алгоритм прямого и обратного хода НО в википедии написано Алгоритм Баума …

2
В Факторном анализе (или в PCA), что означает загрузку фактора больше 1?
Я только что запустил FA, используя наклонное вращение (promax), и элемент дал коэффициент загрузки 1,041 для одного фактора (и коэффициент загрузки -131, -.119 и .065 для других факторов с использованием матрицы шаблонов ) , И я не уверен, что это значит, я думал, что это может быть только между -1 …

2
Анкер Faster RCNN
В статье Faster RCNN, когда речь идет об привязке, что они подразумевают под использованием «пирамид справочных блоков» и как это делается? Означает ли это, что в каждой из опорных точек W * H * k создается ограничивающий прямоугольник? Где W = ширина, H = высота и k = количество соотношений …

1
Как SVM = соответствие шаблона?
Я прочитал о SVM и узнал, что они решают проблему оптимизации, и идея максимальной маржи была очень разумной. Теперь, используя ядра, они могут найти даже нелинейные границы разделения, что было здорово. До сих пор я действительно не представляю, как SVM (специальная машина ядра) и машины ядра связаны с нейронными сетями? …

1
Почему вы прогнозируете по модели смешанного эффекта, не включая случайные эффекты для прогноза?
Это скорее концептуальный вопрос, но по мере использования Rя буду ссылаться на пакеты в R. Если цель состоит в том, чтобы подогнать линейную модель для целей прогнозирования, а затем делать прогнозы в тех случаях, когда случайные эффекты могут быть недоступны, есть ли польза от использования модели смешанных эффектов или вместо …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.