Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Почему мы должны обсуждать поведение конвергенции разных оценок в разных топологиях?
В первой главе книги « Алгебраическая геометрия и теория статистического обучения», в которой говорится о сходимости оценок в разных функциональных пространствах, упоминается, что байесовская оценка соответствует топологии распределения Шварца, тогда как оценка максимального правдоподобия соответствует топологии sup-norm. (на странице 7): Например, sup-норма, LpLpL^p -норма, слабая топология гильбертова пространства L2L2L^2 , …

5
Как подогнать распределение Вейбулла к входным данным, содержащим нули?
Я пытаюсь воспроизвести существующий алгоритм прогнозирования, переданный отставным исследователем. Первым шагом является согласование некоторых наблюдаемых данных с распределением Вейбулла, чтобы получить форму и масштаб, которые будут использоваться для прогнозирования будущих значений. Я использую R, чтобы сделать это. Вот пример моего кода: x<-c(23,19,37,38,40,36,172,48,113,90,54,104,90,54,157,51,77,78,144,34,29,45,16,15,37,218,170,44,121) f<-fitdistr(x, 'weibull') Это работает нормально, если во входном …

1
Ограниченная оптимизация библиотеки для ограничений равенства и неравенства
Любые рекомендации по выбору библиотеки оптимизации с ограничениями, подходящей для моей функции оптимизации? Я минимизирую ai) нелинейную функцию с линейным ограничением равенства и неравенства, и ii) имею доступный градиент и гессиан функции. Если это помогает, функция, которую я минимизирую, - это дивергенция Кульбака-Либлера . constrOptim имеет дело только с ограничениями …

4
«Модерация» против «взаимодействия»?
Я сталкивался с этими двумя терминами, которые взаимозаменяемы во многих контекстах. По сути, модератор (M) - это фактор, который влияет на отношения между X и Y. Анализ модерации обычно выполняется с использованием регрессионной модели. Например, пол (M) может влиять на отношения между «исследованием продукта» (X) и «покупкой продукта» (Y). Во …

2
Какое отношение имеет ARMA / ARIMA к моделированию смешанных эффектов?
При анализе панельных данных я использовал многоуровневые модели со случайными / смешанными эффектами для решения проблем автокорреляции (т. Е. Наблюдения сгруппированы внутри отдельных лиц во времени) с другими параметрами, добавленными для корректировки некоторой спецификации времени и шоков интереса. , ARMA / ARIMA, похоже, предназначены для решения подобных проблем. Ресурсы, которые …

3
Что означает усеченное распределение?
В исследовательской статье об анализе чувствительности модели обыкновенного дифференциального уравнения динамической системы автор представил распределение параметра модели в виде нормального распределения (среднее = 1e-4, std = 3e-5), усеченного до диапазона [0.5e -4 1,5е-4]. Затем он использует образцы из этого усеченного распределения для моделирования модели. Что значит иметь усеченный дистрибутив и …

1
Когда несбалансированные классы с избыточной / недостаточной выборкой, отличается ли максимальная точность от минимизации затрат на неправильную классификацию?
Прежде всего, я хотел бы описать некоторые распространенные макеты, которые используются в книгах Data Mining, и объяснить, как работать с несбалансированными наборами данных . Обычно основной раздел называется несбалансированными наборами данных, и они охватывают эти два подраздела: чувствительная к затратам классификация и методы выборки. Кажется, что, столкнувшись с проблемой редкого …

4
Как переварить статистический контекст?
Во-первых, я полагаю, что не все активные участники этого интересного сайта занимаются статистикой. Иначе вопрос, который задают следующим образом, не имеет никакого смысла! Я их уважаю, конечно, но мне нужно объяснение, которое будет немного более практичным, чем концептуальным. Я начну с примера из Википедии, чтобы определить point process: Пусть S …

8
Каковы «горячие алгоритмы» для машинного обучения?
Это наивный вопрос от того, кто начинает изучать машинное обучение. Я читаю в эти дни книгу «Машинное обучение: алгоритмическая перспектива» от Марсленда. Я считаю ее полезной в качестве вводной книги, но теперь я хотел бы перейти к продвинутым алгоритмам, которые в настоящее время дают лучшие результаты. В основном меня интересует …


3
Как использовать функцию теста Левена в R?
Я новичок в статистике и R, и у меня возникли проблемы с использованием функции Левена (я хотел бы проверить равенство дисперсии двух выборок). В документации сказано, что я должен запустить: levene.test (у, группа) Но я понятия не имею, что я должен поставить как у и группа? У меня есть два …

1
Интерпретация расстояния от гиперплоскости в SVM
У меня есть несколько сомнений в интуитивном понимании SVM. Предположим, что мы обучили модель SVM для классификации с использованием некоторого стандартного инструмента, такого как SVMLight или LibSVM. Когда мы используем эту модель для прогнозирования тестовых данных, модель генерирует файл, имеющий значения «альфа» для каждой тестовой точки. Если альфа-значение положительное, контрольная …

2
Есть ли различия в байесовских и частых подходах к EDA?
Проще говоря: есть ли различия в байесовском и частом подходах к исследовательскому анализу данных? Я не знаю присущих методов EDA, поскольку гистограмма - это гистограмма, диаграмма рассеяния - это диаграмма рассеяния и т. Д., А также я не нашел примеров различий в том, как преподается или преподносится EDA (игнорируя особенно …

4
Логистическая регрессия с двоичными зависимыми и независимыми переменными
Целесообразно ли делать логистическую регрессию, когда зависимые и независимые переменные являются двоичными? например, зависимая переменная равна 0 и 1, а предикторы - это переменные с контрастным кодом -1 и 1?
14 logistic 

3
Генерировать равномерно распределенные веса, которые составляют единицу?
Обычно используются веса в приложениях, таких как моделирование смесей, и для линейного объединения базисных функций. Веса часто должны подчиняться 0 и . Я бы хотел случайным образом выбрать вектор веса из равномерного распределения таких векторов.wiwiw_iwi≥wi≥w_i ≥∑iwi=1∑iwi=1\sum_{i} w_i=1w=(w1,w2,…)w=(w1,w2,…)\mathbf{w} = (w_1, w_2, …) Может быть заманчиво использовать где U (0, 1), однако, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.