Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Использование LASSO в случайном лесу
Я хотел бы создать случайный лес, используя следующий процесс: Построить дерево на случайных выборках данных и объектов, используя прирост информации для определения разбиений Завершить листовой узел, если он превышает предопределенную глубину, ИЛИ любое разделение приведет к тому, что число листьев будет меньше, чем предопределенный минимум Вместо того, чтобы назначать метку …

1
Можно ли смешивать категориальные и непрерывные данные для SVM (Машины опорных векторов)?
У меня есть набор данных, как +--------+------+-------------------+ | income | year | use | +--------+------+-------------------+ | 46328 | 1989 | COMMERCIAL EXEMPT | | 75469 | 1998 | CONDOMINIUM | | 49250 | 1950 | SINGLE FAMILY | | 82354 | 2001 | SINGLE FAMILY | | 88281 | 1985 …

3
Выбор байесовской переменной - действительно ли это работает?
Я подумал, что могу поиграть с некоторыми байесовскими переменными, после хорошего поста в блоге и связанных с ним статей. Я написал программу на rjags (где я довольно новичок) и получил данные о ценах на Exxon Mobil, а также некоторые вещи, которые вряд ли могут объяснить его доходность (например, цены на …

1
Прогнозирующая эффективность зависит больше от опыта аналитика данных, чем от метода?
Я сталкивался со слухами о том, что некоторые исследования показали, что эффективность прогностических моделей больше зависит от опыта аналитика данных с выбранным методом, чем от выбора метода. Другими словами, утверждается, что более важно, чтобы аналитик данных был знаком с выбранным методом, чем то, насколько «подходящим» этот метод может показаться для …

2
Пространственная автокорреляция против пространственной стационарности
Давайте предположим, что у нас есть точки в двумерном пространстве, и мы хотим измерить влияние атрибутов на атрибут y . Типичная модель линейной регрессии, конечно, y = X β + ϵИксИксXYYyY= Хβ+ ϵYзнак равноИксβ+εy= X\beta + \epsilon Есть две проблемы здесь: во - первых, что & термины могут быть пространственно …

3
Вопросы по параметрическому и непараметрическому бутстрапу
Я читаю главу о частой статистике из книги Кевина Мерфи « Машинное обучение - вероятностная перспектива ». Раздел по начальной загрузке гласит: Бутстрап является простой техникой Монте-Карло для аппроксимации распределения выборки. Это особенно полезно в тех случаях, когда оценка является сложной функцией истинных параметров. Идея проста. Если бы мы знали …

2
Нерегулярно расположенные временные ряды в исследованиях финансов / экономики
В исследованиях финансовой эконометрики очень часто исследуют отношения между финансовыми временными рядами, которые принимают форму ежедневных данных . Переменная будет часто иметь значение , например, беря разницу в логах; ln ( P t ) - ln ( P t - 1 ) .I(0)I(0)I(0)ln(Pt)−ln(Pт -1)ln⁡(PT)-пер⁡(пT-1)\ln(P_t)-\ln(P_{t-1}) Однако ежедневные данные означают, что каждую …

3
Какова функция стоимости в cv.glm в загрузочном пакете R?
Я делаю перекрестную проверку, используя метод "оставь один". Я получил бинарный ответ и использую загрузочный пакет для R и функцию cv.glm . Моя проблема в том, что я не до конца понимаю часть затрат в этой функции. Из того, что я могу понять, это функция, которая решает, следует ли классифицировать …

3
Как бы вы сделали байесовский ANOVA и регрессия в R? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . У меня есть довольно простой набор данных, состоящий из одной независимой переменной, одной зависимой переменной и категориальной переменной. У …

3
Можно ли использовать тест Колмогорова-Смирнова и оценить параметры распределения?
Я читал, что критерий Колмогорова-Смирнова не должен использоваться для проверки правильности соответствия распределения, параметры которого были оценены по выборке. Имеет ли смысл разделить мою выборку на две части и использовать первую половину для оценки параметров, а вторую - для теста KS? заранее спасибо

2
Как: интервалы прогнозирования для линейной регрессии с помощью начальной загрузки
У меня возникли проблемы, чтобы понять, как использовать начальную загрузку для расчета интервалов прогнозирования для модели линейной регрессии. Может кто-нибудь наметить пошаговую процедуру? Я искал через Google, но на самом деле ничего не имеет смысла для меня. Я понимаю, как использовать начальную загрузку для расчета доверительных интервалов для параметров модели.

1
Как предсказать один временной ряд из другого временного ряда, если они связаны
Я пытался решить эту проблему больше года без особого прогресса. Это часть исследовательского проекта, которым я занимаюсь, но я проиллюстрирую его на примере истории, которую я составил, потому что реальная область проблемы немного сбивает с толку (отслеживание глаз). Вы - самолет, следящий за вражеским кораблем, который путешествует через океан, поэтому …

3
Плюсы и минусы метаанализа
Я подумывал о том, чтобы провести некоторый метаанализ для конкретной области изучения эволюции, но прежде чем идти дальше, я хотел бы узнать; Каковы положительные и отрицательные стороны процесса? Например, отсутствие необходимости в практическом эксперименте является преимуществом (время и деньги), но будет предвзятость публикации (будут опубликованы более интересные результаты), что будет …

2
LME () ошибка - достигнут предел итерации
При определении модели скрещенных смешанных эффектов я пытаюсь включить взаимодействия. Тем не менее, я получаю следующее сообщение об ошибке: Error in lme.formula(rate ~ nozzle, random = ~nozzle | operator, data = Flow) : nlminb problem, convergence error code = 1 message = iteration limit reached without convergence (10) Модель имеет …

2
Нарушает ли использование данных подсчета в качестве независимой переменной какое-либо из предположений GLM?
Я хотел бы использовать данные подсчета в качестве ковариат при подборе модели логистической регрессии. Мой вопрос: Нарушаю ли я какое-либо предположение о логистической (и, в целом, об обобщенной линейной) модели, используя в качестве независимых переменных неотрицательные целочисленные переменные? Я нашел много ссылок в литературе относительно использования данных подсчета в качестве …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.