Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Допустимо ли объединять временные ряды, чтобы они выглядели более значимыми?
Еще один вопрос о временных рядах от меня. У меня есть набор данных, в котором ежедневно регистрируются случаи насилия в психиатрической больнице в течение трех лет. С помощью моего предыдущего вопроса я возился с этим и теперь немного счастливее. У меня сейчас есть то, что ежедневные сериалы очень шумные. Он …

6
Сомнительное использование принципов обработки сигналов для определения тенденции
Я предлагаю попытаться найти тенденцию в некоторых очень шумных долгосрочных данных. Данные в основном представляют собой еженедельные измерения чего-то, что переместилось на 5 мм за период около 8 месяцев. Данные с точностью до 1 мм и очень шумные, регулярно меняются +/- 1 или 2 мм в неделю. У нас есть …

2
Триединство тестов с максимальной вероятностью: что делать, когда сталкиваются с противоречивыми выводами?
Тесты Вальда, отношения правдоподобия и множителя Лагранжа в контексте оценки максимального правдоподобия асимптотически эквивалентны. Однако для небольших выборок они имеют тенденцию к значительному расхождению, а в некоторых случаях приводят к различным выводам. Как они могут быть ранжированы в соответствии с вероятностью отклонения нуля? Что делать, если тесты дают противоречивые ответы? …


1
Теорема об отсутствии свободного обеда и согласованность K-NN
В вычислительном обучении теорема НФЛ утверждает, что универсального ученика не существует. Для каждого алгоритма обучения существует распределение, которое приводит к тому, что учащийся выдает гипотезу с большой ошибкой и высокой вероятностью (хотя гипотеза с низкой ошибкой существует). Вывод заключается в том, что для обучения класс гипотезы или ее распределение должны …

1
Какова вероятность этого процесса?
Пациент госпитализирован. Продолжительность их пребывания зависит от двух факторов: тяжести травмы и суммы, которую их страховка готова заплатить, чтобы удержать их в больнице. Некоторые пациенты уйдут преждевременно, если их страховка решит прекратить оплачивать свое пребывание. Предположим следующее: 1) Продолжительность пребывания распределена по Пуассону (предположим, что на данный момент это может …

1
Почему Байесовская статистика становится все более популярной темой исследований? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто в прошлом году . Просматривая область исследования 100 лучших статистических программ новостей США, почти все из них …

1
t-SNE со смешанными непрерывными и двоичными переменными
В настоящее время я изучаю визуализацию многомерных данных с использованием t-SNE. У меня есть некоторые данные со смешанными двоичными и непрерывными переменными, и данные, похоже, слишком быстро группируют двоичные данные. Конечно, это ожидается для масштабированных (между 0 и 1) данных: евклидово расстояние всегда будет наибольшим / наименьшим между двоичными переменными. …

1
Имеют ли плотности случайные процессы, такие как процесс Гаусса / процесс Дирихле? Если нет, то как к ним можно применить правило Байеса?
Процесс Дирихле и процесс Гаусса часто называют «распределениями по функциям» или «распределениями по распределениям». В таком случае, могу ли я осмысленно говорить о плотности функции под GP? То есть, есть ли у гауссовского процесса или процесса Дирихле понятие плотности вероятности? Если это не так, как мы можем использовать правило Байеса, …

2
Минимальный размер выборки на кластер в модели случайных эффектов
Существует ли рациональное число наблюдений на кластер в модели случайных эффектов? У меня размер выборки 1500 с 700 кластерами, смоделированными как обменный случайный эффект. У меня есть возможность объединить кластеры, чтобы построить меньше, но больше кластеров. Интересно, как я могу выбрать минимальный размер выборки для кластера, чтобы получить значимые результаты …

2
В линейной регрессии, почему мы должны включать квадратные члены, когда нас интересуют только термины взаимодействия?
Предположим, меня интересует модель линейной регрессии для , потому что я хотел бы увидеть, влияет ли взаимодействие между двумя ковариатами на Y.Yi=β0+β1x1+β2x2+β3x1x2Yi=β0+β1x1+β2x2+β3x1x2Y_i = \beta_0 + \beta_1x_1 + \beta_2x_2 + \beta_3x_1x_2 В заметках профессора (с которыми у меня нет контактов) говорится: При включении терминов взаимодействия вы должны включать их термины второй …

1
Найти UMVUE из где
Пусть это случайные переменные, имеющие pdfX1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) где θ>0θ>0\theta >0 . Задайте UMVUE для 1θ1θ\frac{1}{\theta} и вычислите его дисперсию Я узнал о двух таких методах для полученных UMVUE: Нижняя граница Крамера-Рао (CRLB) Леманн-Шеффе Терем Я собираюсь попробовать это, используя первый из двух. …

1
Интерпретация фиксированных эффектов из логистической регрессии смешанных эффектов
Меня смущают заявления на веб-странице UCLA о логистической регрессии со смешанными эффектами. Они показывают таблицу коэффициентов с фиксированными эффектами от подбора такой модели, и первый абзац ниже, кажется, интерпретирует коэффициенты точно так же, как нормальная логистическая регрессия. Но затем, когда они говорят о коэффициентах шансов, они говорят, что вы должны …

2
«Значимая переменная», которая не улучшает прогнозирование вне выборки - как интерпретировать?
У меня есть вопрос, который, я думаю, будет довольно простым для многих пользователей. Я использую модели линейной регрессии для (i) исследования взаимосвязи нескольких объясняющих переменных и моей переменной отклика и (ii) прогнозирования моей переменной отклика с использованием объяснительных переменных. Одна конкретная объясняющая переменная X, по-видимому, существенно влияет на мою переменную …

2
Беспристрастная, положительная оценка для квадрата среднего
Предположим, у нас есть доступ к выборкам iid из распределения с истинным (неизвестным) средним и дисперсией , и мы хотим оценить .μ , σ2μ,σ2\mu, \sigma^2μ2μ2\mu^2 Как мы можем построить объективную, всегда положительную оценку этой величины? Взяв квадрат выборки, среднее значение смещено и будет переоценивать количество, особенно если близко к 0 …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.