Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как найти и оценить оптимальную дискретизацию для непрерывной переменной с критерием
У меня есть набор данных с непрерывной переменной и двоичной целевой переменной (0 и 1). Мне нужно дискретизировать непрерывные переменные (для логистической регрессии) по отношению к целевой переменной и с ограничением, что частота наблюдений в каждом интервале должна быть сбалансирована. Я пробовал алгоритмы машинного обучения, такие как Chi Merge, деревья …

1
Учитывая две поглощающие цепи Маркова, какова вероятность того, что одна из них прервется раньше другой?
У меня есть две разные цепи Маркова, каждая с одним поглощающим состоянием и известной стартовой позицией. Я хочу определить вероятность того, что цепь 1 достигнет поглощающего состояния за меньшее количество шагов, чем цепь 2. Я думаю, что могу вычислить вероятность достижения поглощающего состояния в определенной цепочке после n шагов: при …

2
Как найти веса для меры диссимилиарности
Я хочу узнать (вывести) веса атрибутов для моей меры отличия, которую я могу использовать для кластеризации. У меня есть несколько примеров(ai,bi)(ai,bi)(a_i,b_i) пар объектов, которые «похожи» (должны быть в одном кластере), а также некоторые примеры пар объектов, которые «не похожи» (не должны быть в том же кластере). Каждый объект имеет ряд …

4
Точный тест Фишера по парным данным
Приведено случаев с раком легких и подобранных контролей (без рака легких) (сопоставление по возрасту, полу и т. Д.). Чтобы попытаться найти доказательства между влиянием курения на рак легких, я использовал точный критерий Фишера в таблице непредвиденных обстоятельств. Это, однако, не принимало во внимание, что контроль и случаи были сопоставлены. 40404040404040 …

2
Улавливают ли деревья CART взаимодействия между предикторами?
В этой статье утверждается, что в CART, поскольку двоичное разбиение выполняется в одной ковариате на каждом шаге, все разбиения являются ортогональными и, следовательно, взаимодействия между ковариатами не рассматриваются. Тем не менее, многие очень серьезные ссылки утверждают, напротив, что иерархическая структура дерева гарантирует, что взаимодействия между предикторами будут автоматически смоделированы (например, …

2
Как я могу использовать эти данные для калибровки маркеров с разным уровнем щедрости при оценке студенческих работ?
12 учителей обучают 600 учеников. 12 преподавателей, преподаваемых этими учителями, имеют размер от 40 до 90 учеников, и мы ожидаем систематических различий между когортами, поскольку аспиранты были непропорционально распределены по отдельным когортам, а предыдущий опыт показал, что аспиранты в среднем набирают значительно выше, чем студенты старших курсов. Учителя оценили все …

2
Линейная комбинация двух случайных ненормалей, которые все еще являются членами одной семьи
Хорошо известно, что линейная комбинация 2 случайных нормальных переменных также является случайной нормальной переменной. Существуют ли общие семейства ненормальных распределений (например, Вейбулла), которые также имеют это свойство? Кажется, есть много контрпримеров. Например, линейная комбинация униформ обычно не однородна. В частности, существуют ли ненормальные семейства распределения, в которых выполняются оба следующих …

2
Как представить потребление кВтч по годам по отношению к средней температуре?
Просто для удовольствия я хочу составить график моего ежемесячного потребления электроэнергии домохозяйствами по сравнению с прошлым годом. Тем не менее, я хотел бы включить некоторую ссылку на месячную температуру, чтобы я мог определить, улучшается ли мой дом или поведение, ухудшается или остается стабильным в отношении использования кВтч. Данные, с которыми …

1
Использование теории информации в прикладной науке о данных
Сегодня я наткнулся на книгу Джеймса Стоуна «Теория информации: введение в учебное пособие» и несколько минут думал о степени использования теории информации в прикладной науке о данных (если вас не устраивает этот еще несколько нечеткий термин, вспомним анализ данных , который ИМХО в науке о данных является прославленной версией). Я …

5
Проверка гипотезы Пуассона для двух параметров
Итак, ради интереса, я беру некоторые данные о вызовах из колл-центра, в котором я работаю, и пытаюсь проверить их на гипотезы, в частности, количество звонков, полученных за неделю, и использую распределение Пуассона, чтобы соответствовать ему. Из-за предмета моей работы, есть два типа недель, давайте назовем одну из них неделями, когда …

1
В чем разница между подготовкой к регрессорам и обработкой их как фиксированных?
Иногда мы предполагаем, что регрессоры являются фиксированными, то есть они нестохастические. Я думаю, это означает, что все наши предикторы, оценки параметров и т. Д. Безусловны, верно? Могу ли я даже пойти так далеко, что они больше не являются случайными переменными? Если, с другой стороны, мы признаем, что большинство регрессоров в …

4
Ожидаемое количество бросков костей требует, чтобы сумма была больше или равна K?
6-сторонняя матрица катится итеративно. Какое ожидаемое количество бросков требуется, чтобы сумма была больше или равна K? Перед редактированием P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 P(Sum>=3 in exactly 2 rolls)=2/6 P(Sum>=3 in exactly 3 rolls)=1/36 P(Sum>=4 in …



1
LASSO для объяснительных моделей: сжатые параметры или нет?
Я провожу анализ, основной задачей которого является понимание данных. Набор данных достаточно велик для перекрестной проверки (10 КБ), и предикторы включают как непрерывные, так и фиктивные переменные, а результат - непрерывный. Главная цель состояла в том, чтобы увидеть, имеет ли смысл исключать некоторые предикторы, чтобы облегчить интерпретацию модели. Вопросов: Мой …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.