Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
На что указывает клиновидная форма графика PCA?
В своей работе по автоассоциатор для текста классификации Хинтон и Салахутдинов показал сюжет , полученный на 2-мерной LSA (который тесно связан с PCA) . Применяя PCA к совершенно другим слегка многомерным данным, я получил похожий график: (за исключением этого случая, я действительно хотел узнать, существует ли какая-либо внутренняя структура). Если …


1
Сколько данных для глубокого изучения?
Я изучаю глубокое обучение (особенно CNN) и то, как обычно требуется очень много данных для предотвращения переобучения. Однако мне также сказали, что чем больше емкость / больше параметров в модели, тем больше данных требуется для предотвращения переобучения. Поэтому мой вопрос: почему вы не можете просто уменьшить количество слоев / узлов …

1
Когда можно написать «мы предположили нормальное распределение» эмпирического измерения?
В преподавании прикладных дисциплин, таких как медицина, заложено, что измерения биомедицинских величин в популяции следуют нормальной «кривой колокола». Поиск из Google в строке «мы предполагали , нормальное распределение» возвращает результатов! Они звучат так: «учитывая небольшое количество экстремальных точек данных, мы предполагали нормальное распределение температурных аномалий» в исследовании изменения климата; или …

2
Прогнозирование доверия нейронной сети
Предположим, я хочу обучить глубокую нейронную сеть выполнять классификацию или регрессию, но я хочу знать, насколько достоверным будет прогноз. Как я мог этого добиться? Моя идея состоит в том, чтобы вычислить кросс-энтропию для каждого тренировочного материала, основываясь на его прогнозирующей способности в нейросчетчиках выше. Затем я подготовил бы вторую нейронную …

1
Алгебраические классификаторы, больше информации?
Я прочитал алгебраические классификаторы: общий подход к быстрой перекрестной проверке, онлайн-обучению и параллельному обучению, и был поражен эффективностью производных алгоритмов. Тем не менее, кажется, что помимо наивных байесовских (и GBM), не так много алгоритмов, адаптированных к этой структуре. Есть ли другие документы, которые работали над различными классификаторами? (SVM, случайные леса)

2
1D свертка в нейронных сетях
Я понимаю, как работает свертка, но я не понимаю, как одномерные свертки применяются к двумерным данным. В этом примере вы можете увидеть 2D свертку в 2D данных. Но как было бы, если бы была 1D свертка? Просто 1D ядро ​​скользит таким же образом? А если шага было 2? Спасибо!

1
Реальные примеры неэффективного генератора случайных чисел
Все мы знаем, что генераторы случайных чисел в компьютерах не генерируют истинные случайные числа, а вместо этого генерируют псевдослучайные числа. Кроме того, некоторые RNG лучше, чем другие, а некоторые реализованы лучше, чем другие. Каковы некоторые примеры того, когда использовался плохой ГСЧ или ГСБ был плохо реализован и эксплуатировался? Примеры, которые …

2
Реальные примеры различий между независимостью и корреляцией
Хорошо известно, что независимость случайных величин подразумевает нулевую корреляцию, но нулевая корреляция не обязательно подразумевает независимость. Я наткнулся на множество математических примеров, демонстрирующих зависимость, несмотря на нулевую корреляцию. Есть ли реальные примеры, подтверждающие этот факт?

2
Помощь в максимизации ожидания от бумаги: как включить предварительное распространение?
Вопрос основан на статье под названием «Восстановление изображений в диффузной оптической томографии с использованием связанной излучательной транспортно-диффузионной модели». Ссылка на скачивание Авторы применяют EM-алгоритм с разреженности неизвестного вектора \ mu для оценки пикселей изображения. Модель даетсяl1l1l_1μμ\mu y=Aμ+e(1)(1)y=Aμ+ey=A\mu + e \tag{1} Оценка дана в уравнении (8) как μ^=argmaxlnp(y|μ)+γlnp(μ)(2)(2)μ^=arg⁡maxln⁡p(y|μ)+γln⁡p(μ)\hat{\mu} = \arg max …

2
Присвоение большего веса более поздним наблюдениям регрессии
Как мне придать больший вес более поздним наблюдениям в R? Я предполагаю, что это часто задаваемый вопрос или желание, но мне трудно понять, как именно это реализовать. Я пытался много искать для этого, но я не могу найти хороший практический пример. В моем примере у меня будет большой набор данных …

2
Почему информационный критерий (не скорректированный
В моделях временных рядов, таких как ARMA-GARCH, для выбора подходящего лага или порядка модели используются разные информационные критерии, такие как AIC, BIC, SIC и т. Д. Мой вопрос очень прост, почему мы не используем скорректированный чтобы выбрать подходящую модель? Мы можем выбрать модель, которая приведет к более высокому значению скорректированной …

2
Что такое оператор в правиле цепочки, получая градиент однослойной нейронной сети по ее входам?
Проблема в следующем: Получите градиент относительно входного слоя для нейронной сети с одним скрытым слоем, используя сигмоид для ввода -> скрытый, softmax для скрытого -> выход, с перекрестной потерей энтропии. Я могу пройти через большую часть деривации, используя правило цепочки, но я не уверен, как на самом деле «связать» их …

1
Случайные перекрывающиеся интервалы
Как найти аналитическое выражение в следующей задаче?D(n,l,L)D(n,l,L)D(n,l,L) Я случайно выбрасываю «баров» длиной в интервал . «Бары» могут перекрываться. Я хотел бы найти среднюю общую длину интервала занятую хотя бы одним «баром».nnnlll[0,L][0,L][0,L]DDD[0,L][0,L][0,L] В пределе "низкой плотности" перекрытие должно быть незначительным, и . В «высокой плотности» предел, приближается . Но как я …

2
В чем разница между этими двумя тестами Бреуша-язычества?
Используя R на некоторых данных и пытаясь определить , являются ли мои данные гетероскедастичными, я нашел две реализации теста Бреуша -Пагана: bptest (package lmtest) и ncvTest (package car). Однако они дают разные результаты. Какая разница между двумя? Когда вы должны использовать один или другой? > model <- lm(y ~ x) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.