Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Шаги, чтобы выяснить апостериорное распределение, когда может быть достаточно просто иметь аналитическую форму?
Это также спросили в вычислительной науке. Я пытаюсь вычислить байесовскую оценку некоторых коэффициентов для авторегрессии с 11 выборками данных: Yi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi Y_{i} = \mu + \alpha\cdot{}Y_{i-1} + \epsilon_{i} гдеϵiϵi\epsilon_{i} является гауссовым со средним 0 и дисперсиейσ2eσe2\sigma_{e}^{2} априорное распределение на векторе(μ,α)t(μ,α)t(\mu, \alpha)^{t} является гауссовым со средним(0,0)(0,0)(0,0) и диагональной ковариационной матрицы с диагональными …

1
Влияет ли разреженный тренировочный комплекс на SVM?
Я пытаюсь классифицировать сообщения по различным категориям, используя SVM. Я составил список желаемых слов / символов из учебного набора. Для каждого вектора, который представляет сообщение, я устанавливаю соответствующую строку, 1если слово присутствует: "корпус" это: [Мария, маленькая, ягненок, звезда, мерцание] первое сообщение: "у марии был маленький ягненок" -> [1 1 1 …

2
Инженерно-независимый признак, который сохраняет смысловой смысл?
Функциональное проектирование часто является важным компонентом машинного обучения (оно активно использовалось для победы в KDD Cup в 2010 году ). Тем не менее, я считаю, что большинство технических характеристик техники либо уничтожить любое интуитивное значение основных функций или очень специфичны для конкретного домена или даже определенных типов функций. Классическим примером …

2
Применение машинного обучения для фильтрации DDoS
В курсе машинного обучения Стэнфорда Эндрю Нг упомянул применение ML в IT. Некоторое время спустя, когда я получил DDoS умеренного размера (около 20 тыс. Ботов) на нашем сайте, я решил бороться с ним, используя простой классификатор Neural Network. Я написал этот скрипт на python примерно за 30 минут: https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos Он …


2
Регулировка значения p для адаптивного последовательного анализа (для теста хи-квадрат)?
Я хотел бы знать, какая статистическая литература имеет отношение к следующей проблеме, и, возможно, даже идея о том, как ее решить. Представьте себе следующую проблему: У нас есть 4 возможных лечения некоторых заболеваний. Чтобы проверить, какое лечение лучше, мы проводим специальное исследование. В испытании мы начинаем с отсутствия субъектов, затем, …

2
Прогнозирование нескольких целей или классов?
Предположим, я строю прогностическую модель, в которой я пытаюсь предсказать несколько событий (например, бросок кубика и бросок монеты). Большинство известных мне алгоритмов работают только с одной целью, поэтому мне интересно, существует ли стандартный подход к такого рода вещам. Я вижу два возможных варианта. Возможно, самым наивным подходом было бы просто …


2
SVM, переменное взаимодействие и подбор данных обучения
У меня есть 2 общих / более теоретических вопроса. 1) Мне интересно, как SVM обрабатывают переменные взаимодействия при построении прогностических моделей. Например, если у меня есть две функции f1 и f2, а цель зависит от f1, f2 и, скажем, f1 * f2 (или некоторой функции h (f1, f2)), подходит ли …

1
Наименование средней абсолютной ошибки, аналогичной шкале Бриера?
Вчерашний вопрос « Определить точность модели, которая оценивает вероятность события» , заинтересовал меня оценкой вероятности. Оценка Бриера - это мера среднего квадрата ошибки. Показывает ли аналогичная средняя абсолютная погрешность показатели эффективности есть имя тоже?11NΣя = 1N( Р г е дя с т я о пя- р е фe r e …

1
Определить точность модели, которая оценивает вероятность события
Я моделирую событие с двумя исходами, а и б. Я создал модель, которая оценивает вероятность того, что a или b произойдут (то есть модель рассчитает, что a произойдет с вероятностью 40%, а b произойдет с вероятностью 60%). У меня есть большая запись результатов испытаний с оценками из модели. Я хотел …

2
RFM и моделирование ценности жизни клиента в R
Кто-нибудь может сказать мне, как сделать моделирование недавних событий, частоты и денежной стоимости (RFM) и моделирование потребительской ценности в R? Кроме того, кто-нибудь может направить мне немного литературы об этом?

3
Иллюстративные наборы данных и анализ для многоуровневого моделирования
Недавно я прошла вводный курс по многоуровневому моделированию. Большинство наборов данных и примеров, которые мы использовали, были из социальных наук. Я только что получил 2-х недельную стажировку в отделе биостатистики, где они хотят, чтобы я начал проект, касающийся различий на уровне больниц в исходах для неотложных состояний с высоким уровнем …

3
Вычисление режима выборки данных из непрерывного распределения
Каковы наилучшие методы для подбора «режима» данных, взятых из непрерывного распределения? Поскольку этот режим технически не определен (верно?) Для непрерывного распространения, я действительно спрашиваю: «Как вы находите наиболее распространенное значение»? Если вы предполагаете, что родительский дистрибутив является гауссовским, вы можете скопировать данные и найти, скажем, режим - это местоположение бина …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.