Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Количество особенностей против количества наблюдений
Существуют ли какие-либо документы / книги / идеи о взаимосвязи между количеством признаков и количеством наблюдений, которые необходимы для обучения «надежного» классификатора? Например, предположим, что у меня есть 1000 объектов и 10 наблюдений из двух классов в качестве обучающего набора и 10 других наблюдений в качестве набора для тестирования. Я …

3
Как вычислить доверительный интервал отношения двух нормальных средних
Я хочу вывести пределы для доверительного интервала для отношения двух средних. Предположим, что и независимы, среднее отношение . Я пытался решить: но это уравнение не может быть решено во многих случаях (без корней). Я делаю что-то неправильно? Есть ли лучший подход? БлагодарностьX 1 ∼ N ( θ 1 , σ …

2
Опорные векторные машины и регрессия
Уже было отличное обсуждение того, как машины опорных векторов справляются с классификацией, но я очень озадачен тем, как машины опорных векторов обобщаются в регрессию. Кто-нибудь хочет меня просветить?

5
Какова ожидаемая корреляция между остаточной и зависимой переменной?
При множественной линейной регрессии я могу понять, что корреляции между остатком и предикторами равны нулю, но какова ожидаемая корреляция между остатком и переменной критерия? Должно ли оно быть нулевым или сильно коррелированным? Что это значит?

5
Стоит ли когда-нибудь стандартизировать бинарные переменные?
У меня есть набор данных с набором функций. Некоторые из них являются двоичными активен или запущен, неактивен или неактивен), а остальные являются действительными, например, .( 1 =(1=(1=4564,3420 =0=0=4564.3424564.3424564.342 Я хочу , чтобы кормить эти данные для алгоритма машинного обучения, так что я -score всех вещественных функций. Я получаю их между …

4
Нейронная сеть с пропуском слоев
Я заинтересован в регрессии с нейронными сетями. Нейронные сети с нулевыми скрытыми узлами + соединения с пропуском слоев являются линейными моделями. А как насчет тех же нейронных сетей, но со скрытыми узлами? Мне интересно, какова будет роль соединений с пропуском слоя? Интуитивно, я бы сказал, что если вы включите соединения …

3
Связь между гамма-распределением и нормальным распределением
Недавно я счел необходимым получить pdf для квадрата нормальной случайной величины со средним значением 0. По какой-то причине я предпочел не нормализовать дисперсию заранее. Если я сделал это правильно, то этот PDF-файл выглядит следующим образом: N2(x;σ2)=1σ2π−−√x−−√e−x2σ2N2(x;σ2)=1σ2πxe−x2σ2 N^2(x; \sigma^2) = \frac{1}{\sigma \sqrt{2 \pi} \sqrt{x}} e^{\frac{-x}{2\sigma^2}} Я заметил, что на самом деле …

5
Время, затраченное на то, чтобы поразить голову и хвост в серии бросков
Вдохновленный выступлением Питера Доннелли на TED , в котором он обсуждает, сколько времени потребуется, чтобы определенный шаблон появился в серии бросков монет, я создал следующий сценарий на языке R. Учитывая два шаблона: «hth» и «htt», он вычисляет, сколько времени в среднем (то есть сколько монет бросит), прежде чем вы нажмете …

5
Какова математическая разница между случайными и фиксированными эффектами?
Я нашел много в интернете относительно интерпретации случайных и фиксированных эффектов. Однако я не мог получить источник, фиксирующий следующее: Какова математическая разница между случайными и фиксированными эффектами? Под этим я подразумеваю математическую формулировку модели и способ оценки параметров.

3
Матрица нормализации по столбцам в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 лет назад . Я хотел бы выполнить по столбцам нормализацию матрицы в R. Учитывая матрицу m, я хочу нормализовать каждый столбец путем деления …

4
Когда регистрировать преобразование временного ряда перед установкой модели ARIMA
Ранее я использовал прогноз Pro для прогнозирования одномерных временных рядов, но переключаю свой рабочий процесс на R. Пакет прогноза для R содержит много полезных функций, но он не выполняет никаких преобразований данных перед запуском auto. .arima (). В некоторых случаях прогноз Pro решает записать данные преобразования, прежде чем делать прогнозы, …

2
Как оценить потери KLD и потери реконструкции в вариационном авто-кодировщике
почти во всех примерах кода, которые я видел в VAE, функции потерь определяются следующим образом (это код с тензорным потоком, но я видел похожее для theano, torch и т. д. Это также для коннета, но это также не слишком актуально) , только влияет на оси, суммы принимаются): # latent space …

4
Как правильно использовать scale_pos_weight в xgboost для несбалансированных наборов данных?
У меня очень несбалансированный набор данных. Я пытаюсь следовать советам по настройке и использовать, scale_pos_weightно не знаю, как мне его настроить. Я вижу, что RegLossObj.GetGradientделает: if (info.labels[i] == 1.0f) w *= param_.scale_pos_weight таким образом, градиент положительного образца будет более влиятельным. Однако, согласно статье xgboost , статистика градиента всегда используется локально …

1
Статистические таблицы в старых книгах целенаправленно неверны?
Я помню, как читал некоторое время назад, что в старых (до компьютерных дней) книгах последние цифры теоретических квантилей, показанных в приложениях, были неточными, чтобы препятствовать плагиату (идея состояла в том, что если в другой книге есть таблица в Приложение, где последние цифры совпадают с найденными в вашем, тогда этот автор, …

2
Правда ли, что байесовские методы не подходят больше?
Правда ли, что байесовские методы не подходят больше? (Я видел некоторые документы и учебные пособия, делающие это утверждение) Например, если мы применяем гауссовский процесс к MNIST (классификация рукописных цифр), но показываем только одну выборку, будет ли он возвращаться к предыдущему распределению для любых входных данных, отличных от этой одной выборки, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.