Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Эффективное обновление линейной регрессии при добавлении наблюдений и / или предикторов в R
Мне было бы интересно найти пути в R для эффективного обновления линейной модели при добавлении наблюдения или предиктора. У biglm есть возможность обновления при добавлении наблюдений, но мои данные достаточно малы, чтобы находиться в памяти (хотя у меня есть большое количество экземпляров для обновления). Есть способы сделать это голыми руками, …

4
Как указать нулевую гипотезу в проверке гипотез
Какое хорошее правило для того, как выбрать вопрос для нулевой гипотезы. Например, если я хочу проверить, верна ли гипотеза B, должен ли я использовать B в качестве нулевой, B в качестве альтернативной гипотезы или НЕ B в качестве нулевой? Я надеюсь, что вопрос ясен. Я знаю, что это как-то связано …

5
Есть ли вероятность больше, чем байесовский?
Будучи студентом-физиком, я читал лекцию «Почему я байесовский», наверное, полдюжины раз. Это всегда одно и то же - ведущий самодовольно объясняет, как байесовская интерпретация превосходит частую интерпретацию, предположительно используемую массами. Они упоминают правило Байеса, маргинализацию, приоры и постеры. Какая настоящая история? Существует ли законная область применимости для статистики частых пользователей? …

4
Оптимальный выбор штрафа для лассо
Существуют ли аналитические результаты или экспериментальные работы относительно оптимального выбора коэффициента штрафного члена . Под оптимальным я подразумеваю параметр, который максимизирует вероятность выбора наилучшей модели или минимизирует ожидаемые потери. Я спрашиваю, потому что часто нецелесообразно выбирать параметр путем перекрестной проверки или начальной загрузки, либо из-за большого количества случаев проблемы, либо …

3
CDF поднят на власть?
Если - это CDF, похоже, что ( ) также является CDF.FZFZF_ZFZ(z)αFZ(z)αF_Z(z)^\alphaα>0α>0\alpha \gt 0 В: Это стандартный результат? Q: Есть ли хороший способ найти функцию с st , гдеgggX≡g(Z)X≡g(Z)X \equiv g(Z)FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alphax≡g(z)x≡g(z) x \equiv g(z) По сути, у меня есть еще один CDF, FZ(z)αFZ(z)αF_Z(z)^\alpha . В некотором смысле уменьшенной формы …

2
Применение логистической регрессии с низкой частотой событий
У меня есть набор данных , в котором частота событий очень низка (40000 отказа от ). Я применяю логистическую регрессию по этому вопросу. У меня была дискуссия с кем-то, где выяснилось, что логистическая регрессия не даст хорошей матрицы путаницы для данных с такой низкой частотой событий. Но из-за бизнес-проблемы и …
15 logistic 

2
Как рассчитать дисперсию разбиения переменных
Я провожу эксперимент, в котором я собираю (независимые) выборки параллельно, я вычисляю дисперсию каждой группы выборок, и теперь я хочу объединить все тогда, чтобы найти общую дисперсию всех выборок. Мне трудно найти выход для этого, так как я не уверен в терминологии. Я думаю об этом как о разделе одного …
15 variance 

3
Как построить вывод данных кластеризации?
Я попытался кластеризовать набор данных (набор меток) и получил 2 кластера. Я хотел бы представить это графически. Немного запутался в представлении, так как у меня нет координат (x, y). Также ищем функцию MATLAB / Python для этого. РЕДАКТИРОВАТЬ Я думаю, что размещение данных делает вопрос более ясным. У меня есть …

3
Интерпретация логрансформированных предикторов в логистической регрессии
Один из предикторов в моей логистической модели был преобразован в лог. Как вы интерпретируете оценочный коэффициент логарифмического предиктора и как рассчитываете влияние этого предиктора на отношение шансов?
15 logistic 

2
Понимание запаздывания в расширенном тесте Дики Фуллера R
Я поигрался с некоторым модульным тестированием корня в R, и я не совсем уверен, что делать с параметром k lag. Я использовал дополненной тест Дики Фуллера и тест Филиппс Перрона из tseries пакета. Очевидно, что параметр по умолчанию (для ) зависит только от длины ряда. Если я выберу разные k-значения, …
15 r  time-series  trend 

1
Каково точное определение «дела Хейвуда»?
Я несколько неофициально использовал термин «случай Хейвуда» для обозначения ситуаций, когда онлайновая итеративно обновляемая оценка «конечного ответа» дисперсии становилась отрицательной из-за проблем с числовой точностью. (Я использую вариант метода Уэлфорда для добавления данных и удаления более старых данных.) У меня сложилось впечатление, что он применяется к любой ситуации, когда оценка …

3
Почему среднее 0 и стандартное отклонение 1 всегда используются?
Моя статистика была самоучкой, но многие материалы, которые я прочитал, указывают на набор данных, имеющий среднее значение 0 и стандартное отклонение 1. Если это так, то: Почему среднее значение 0 и SD 1 - это хорошее свойство? Почему случайная величина, взятая из этой выборки, равна 0,5? Вероятность получения 0,001 равна …

2
Моделирование распределения Пуассона с избыточной дисперсией
У меня есть набор данных, который я ожидаю, чтобы следовать распределению Пуассона, но он разбросан примерно в 3 раза. В настоящее время я моделирую эту избыточную дисперсию, используя что-то вроде следующего кода в R. ## assuming a median value of 1500 med = 1500 rawdist = rpois(1000000,med) oDdist = rawDist …

3
Когда использовать GAM против GLM
Я понимаю, что это может быть потенциально широкий вопрос, но мне было интересно, существуют ли обобщенные предположения, которые указывают на использование GAM (Обобщенная аддитивная модель) над GLM (Обобщенная линейная модель)? Кто-то недавно сказал мне, что GAM следует использовать только тогда, когда я предполагаю, что структура данных является «аддитивной», то есть …

1
Почему один ReLU не может выучить ReLU?
В качестве продолжения Моей нейронной сети не могу даже изучить евклидово расстояние, я упростил еще больше и попытался обучить один ReLU (со случайным весом) одному ReLU. Это самая простая сеть, которая существует, и все же половину времени она не может сходиться. Если исходное предположение имеет ту же ориентацию, что и …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.