Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Понимание меры концентрации неравенства
В духе этого вопроса Понимая доказательство леммы, используемой в неравенстве Хеффдинга , я пытаюсь понять шаги, которые приводят к неравенству Хеффдинга. Что является для меня самым загадочным в доказательстве, так это то, что экспоненциальные моменты вычисляются для суммы переменных iid, после чего применяется неравенство Маркова. Моя цель состоит в том, …

2
Бинарные модели (Probit и Logit) с логарифмическим смещением
У кого-нибудь есть вывод о том, как смещение работает в бинарных моделях, таких как пробит и логит? В моей задаче контрольное окно может быть разной длины. Предположим, что пациенты получают профилактический укол в качестве лечения. Выстрел происходит в разное время, поэтому, если результат является бинарным индикатором того, произошли ли какие …

4
Лучший способ просто хранить данные для статистического анализа в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 6 лет назад . Я уже некоторое время использую текстовые файлы для хранения своих данных для R без каких-либо проблем. Но для недавнего …
12 r  dataset 

2
Как применять нейронные сети в задачах классификации по нескольким меткам?
Описание: Пусть проблемная область будет классификацией документов, где существует набор векторов признаков, каждый из которых принадлежит одному или нескольким классам. Например, документ doc_1может принадлежать Sportsи Englishкатегориям. Вопрос: Используя нейронную сеть для классификации, какой будет метка для вектора признаков? будет ли это вектор, составляющий все классы, так что значение 0 дается …

1
Критерии выбора «лучшей» модели в скрытой марковской модели
У меня есть набор данных временного ряда, к которому я пытаюсь подогнать скрытую марковскую модель (HMM), чтобы оценить количество скрытых состояний в данных. Мой псевдокод для этого следующий: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest BIC" ... } …

2
Смешанная модель с 1 наблюдением за уровень
Я подгоняю модель случайных эффектов glmerк некоторым бизнес-данным. Цель состоит в том, чтобы проанализировать показатели продаж по дистрибьюторам с учетом региональных различий. У меня есть следующие переменные: distcode: идентификатор дистрибьютора, около 800 уровней region: географический идентификатор верхнего уровня (север, юг, восток, запад) zone: география среднего уровня region, около 30 уровней …

4
Ожидаемое число: я буду после розыгрыша карт, пока не получу туза, 2, 3 и т. Д.
У меня возникли проблемы с решением следующего. Вы берете карты из стандартной колоды из 52 карт без замены, пока не получите туза. Вы вытягиваете из того, что осталось, пока не получите 2. Вы продолжаете с 3. Какое ожидаемое число вы будете иметь после того, как закончится вся колода? Было естественно …

2
Связь и разница между временными рядами и регрессией?
Какова связь и разница между временными рядами и регрессией? Для моделей и допущений , правильно ли, что регрессионные модели предполагают независимость между выходными переменными для разных значений входной переменной, в то время как модель временного ряда - нет? Какие еще отличия? Для методов , с сайта Дарлингтона Существует несколько подходов …

2
Как мне сделать выборку из дискретного (категориального) распределения в пространстве журнала?
Предположим, у меня есть дискретное распределение, определенное вектором такое, что категория будет нарисована с вероятностью и так далее. Затем я обнаружил, что некоторые из значений в распределении настолько малы, что не соответствуют представлению чисел с плавающей запятой моего компьютера, поэтому для компенсации я делаю все свои вычисления в лог-пространстве. Теперь …

2
Интегрирование оценки плотности ядра в 2D
Я исхожу из этого вопроса на случай, если кто-нибудь захочет пойти по следу. По сути, у меня есть набор данных состоящий из объектов, где к каждому объекту прикреплено заданное количество измеренных значений (два в данном случае):NΩΩ\OmegaNNN Ω=o1[x1,y1],o2[x2,y2],...,oN[xN,yN]Ω=o1[x1,y1],o2[x2,y2],...,oN[xN,yN]\Omega = o_1[x_1, y_1], o_2[x_2, y_2], ..., o_N[x_N, y_N] Мне нужен способ определить вероятность …

3
Когда фиксированный эффект действительно фиксирован?
Рассмотрим линейную модель ненаблюдаемых эффектов типа: где - ненаблюдаемая, но не зависящая от времени характеристика, а - ошибка, и индекс отдельных наблюдений и времени соответственно. Типичный подход в регрессии с фиксированными эффектами (FE) будет состоять в том, чтобы удалить помощью отдельных макетов (LSDV) / де-значения или путем первого различия. c …

1
Тестирование определенных контрастов: это трудная проблема или нет?
Я отправил это в mathoverflow, и никто не отвечает: Метод Шеффе для выявления статистически значимых контрастов широко известен. Контраст среди средств , из популяций является линейной комбинацией , в котором , и скалярное кратное контрастности - это, по сути, один и тот же контраст, поэтому можно сказать, что набор контрастов …

1
Алгоритм нормализации данных временных рядов в реальном времени?
Я работаю над алгоритмом, который берет вектор самой последней точки данных из ряда потоков датчиков и сравнивает евклидово расстояние с предыдущими векторами. Проблема заключается в том, что разные потоки данных поступают от совершенно разных датчиков, поэтому простое евклидово расстояние резко переоценит некоторые значения. Понятно, что мне нужен какой-то способ нормализации …

1
Вывод байесовской сети с использованием pymc (путаница для начинающих)
В настоящее время я прохожу курс PGM Дафни Коллер на Coursera. При этом мы обычно моделируем байесовскую сеть как причинно-следственный ориентированный график переменных, которые являются частью наблюдаемых данных. Но в учебниках и примерах PyMC я обычно вижу, что он не совсем смоделирован так же, как PGM, или, по крайней мере, …

2
Можно ли вычислить p-значения для корреляционного теста Пирсона только из коэффициента корреляции и размера выборки?
Предыстория: я прочитал одну статью, где авторы сообщают о корреляции Пирсона 0,754 от размера выборки 878. Результирующее значение p для корреляционного теста является значимым «две звезды» (т. Е. Р <0,01). Тем не менее, я думаю, что при таком большом размере выборки соответствующее значение p должно быть меньше 0,001 (т. Е. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.