Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Когда выбрать PCA против LSA / LSI
Вопрос: Существуют ли общие рекомендации относительно характеристик входных данных, которые можно использовать для выбора между применением PCA и LSA / LSI? Краткое описание PCA против LSA / LSI: Принципиальный компонентный анализ (PCA) и скрытый семантический анализ (LSA) или скрытое семантическое индексирование (LSI) схожи в том смысле, что все они основаны …

1
Как определить, что такое «образец»?
Если я дам вам три числа, которые независимо и одинаково взяты из стандартного нормального распределения, то я дал вам три образца или один образец? Если ответ - один из примеров, то есть ли краткое название того, что я дал вам три?

2
Как подогнать регрессию типа
У меня есть данные временного ряда, где измеряемая переменная представляет собой дискретные положительные целые числа (числа). Я хочу проверить, есть ли тенденция со временем (или нет). Независимая переменная (x) находится в диапазоне 0-500, а зависимая переменная (y) находится в диапазоне 0-8. Я думал, что я отвечу на это, подгоняя регрессию …
9 r  regression  python 

1
Советы для аспирантов в области статистики
Я начал свою докторскую степень в области статистики в этом году, и я ищу ваши лучшие практики, советы и (мета-советы) относительно того, как расти и стать хорошим академическим исследователем в области статистики / ML. Общие мысли и ссылки приветствуются, но для того, чтобы начать работу, вот несколько вопросов, собранных из …
9 careers  phd  academia 

1
Как объединить прогнозы, когда переменная отклика в моделях прогнозирования была другой?
Введение А яСJAяСJAIC_jJJjА яСJAяСJAIC_jА яС*= минJА яСJAяС*знак равноминJAяСJAIC^* = \min_j{AIC_j}R PJ= е( А яС*- А яСJ) / 2рпJзнак равное(AяС*-AяСJ)/2RP_j = e^{(AIC^*-AIC_j)/2}JJj весJ= R PJΣJR PJвесJзнак равнорпJΣJрпJw_j = \frac{RP_j}{\sum_j RP_j} проблема Трудность, которую я пытаюсь преодолеть, состоит в том, что модели оцениваются по различным образом трансформированным ответным (эндогенным) переменным. Например, некоторые …

4
Как количественно определить, сгруппированы ли данные 1D вокруг 1 или 3 значений?
У меня есть некоторые данные о времени между ударами сердца человека. Одним из признаков эктопических (дополнительных) ударов является то, что эти интервалы сгруппированы вокруг трех значений вместо одного. Как я могу получить количественную меру этого? Я хочу сравнить несколько наборов данных, и эти две гистограммы по 100 бинов являются репрезентативными …

4
Как реализовать фиктивную переменную, используя n-1 переменные?
Если у меня есть переменная с 4 уровнями, теоретически мне нужно использовать 3 фиктивные переменные. На практике, как это на самом деле осуществляется? Я использую 0-3, я использую 1-3 и оставляю 4 пустыми? Какие-либо предложения? ПРИМЕЧАНИЕ: я собираюсь работать в R. ОБНОВЛЕНИЕ: Что случилось бы, если бы я только использовал …

1
Распределение обратного коэффициента регрессии
Предположим, что у нас есть линейная модель которая удовлетворяет всем стандартным предположениям регрессии (Гаусса-Маркова). Мы заинтересованы в . θ = 1 / β 1Yя= β0+ β1Икся+ ϵяYязнак равноβ0+β1Икся+εяy_i = \beta_0 + \beta_1 x_i + \epsilon_iθ = 1 / β1θзнак равно1/β1\theta = 1/\beta_1 Вопрос 1: Какие предположения необходимы для того, чтобы …

3
Каким может быть четкое практическое определение «семейства гипотез» (в отношении уровня ошибок по семейным обстоятельствам)?
Пытаясь оценить, что составляет семейство гипотез в рамках эксперимента / проекта / анализа, я обнаружил, что «сходные по назначению» и «сходные по содержанию» приведены в качестве руководства для разграничения семей, но они оставляют довольно много возможностей для интерпретации ( мягко говоря). Кажется очевидным, что если в ходе анализа я проведу …


2
Могу ли я доверять регрессии, если переменные автокоррелированы?
Обе переменные (зависимая и независимая) показывают автокорреляционные эффекты. Данные временные и стационарные Когда я запускаю регрессионные остатки, похоже, не связаны. Моя статистика Дурбина-Ватсона больше верхнего критического значения, поэтому есть свидетельства того, что условия ошибок не имеют положительной корреляции. Также, когда я строю ACF для ошибок, похоже, что там нет никакой …

1
Визуализация последовательных пропорций
Я пытаюсь визуализировать некоторые потребительские данные, которые имеют 4 категории. Пользователи могут свободно переключаться между различными категориями. Я хотел бы визуализировать последние три или четыре переключателя для каждого человека. Таким образом, мы начнем с графика с колонкой с 4 сложенными пропорциями. После этого у нас будет 16, поскольку каждая категория …


2
Лучшие практики при обработке данных о дальности как непрерывных
Я смотрю на то, связано ли изобилие с размером. Размер (конечно) непрерывен, однако, численность записывается в таком масштабе, что A = 0-10 B = 11-25 C = 26-50 D = 51-100 E = 101-250 F = 251-500 G = 501-1000 H = 1001-2500 I = 2501-5000 J = 5001-10,000 etc... …

1
Коэффициент логарифмического правдоподобия при суммировании документов
Первоначально я спросил это о переполнении стека и был передан на этот сайт, так что здесь идет: Я внедряю некоторые неконтролируемые методы обобщения документов на основе выбора контента / извлечения, и меня смущает то, что в моем учебнике называется «логарифмическое отношение правдоподобия». Книга « Обработка речи и языка» Jurafsky & …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.