Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


2
Как использовать анализ главных компонентов для выбора переменных для регрессии?
В настоящее время я использую анализ основных компонентов, чтобы выбрать переменные для моделирования. В настоящий момент я делаю измерения A, B и C в своих экспериментах. Что я действительно хочу знать: могу ли я сделать меньше измерений и прекратить запись C и / B, чтобы сэкономить время и усилия? Я …

1
Условная гомоскедастичность против гетероскедастичности
Из эконометрики Фумио Хаяси (Гл. 1): Безусловная гомоскедастичность: Второй момент ошибки членов E (εᵢ²) постоянен по наблюдениям Функциональная форма E (εᵢ² | xi) постоянна по наблюдениям Условная гомоскедастичность: Снято ограничение, что второй момент слагаемых ошибки E (εᵢ²) постоянен по наблюдениям, снят Таким образом, условный второй момент E (εᵢ² | xi) …

2
Нахождение точности оценки моделирования Монте-Карло
Фон Я проектирую симуляцию Монте-Карло, которая объединяет результаты ряда моделей, и я хочу быть уверенным, что симуляция позволит мне сделать разумные заявления о вероятности смоделированного результата и точности этой вероятностной оценки. В ходе симуляции будет найдена вероятность того, что суд присяжных, выбранный из указанного сообщества, осудит определенного подсудимого. Это шаги …


3
Переход от использования статистического программного обеспечения для понимания математических уравнений?
Контекст: Я аспирант кафедры психологии. Как и многие аспиранты по психологии, я знаю, как выполнять различные статистические анализы с использованием статистического программного обеспечения, вплоть до таких методов, как PCA, деревья классификации и кластерный анализ. Но это не совсем удовлетворительно, потому что, хотя я могу объяснить, почему я провел анализ и …

4
Корреляция Пирсона наборов данных с возможно нулевым стандартным отклонением?
У меня проблема с вычислением коэффициента корреляции Пирсона для наборов данных с возможным нулевым стандартным отклонением (т. Е. Все данные имеют одинаковое значение). Предположим, что у меня есть следующие два набора данных: float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; Коэффициент корреляции …

1
Проверка эквивалентности не вложенных моделей
Скажем, - линейная функция от и фиктивная . Моя гипотеза состоит в том, что само по себе , как гедонистическому индексу вектора других переменных, . У меня есть поддержка для этого в из (т.е. , , ..., ) на . Есть ли способ проверить эквивалентность этих двух моделей:x d d …

3
Подходящий способ справиться с 3-уровневой таблицей непредвиденных обстоятельств
У меня есть трехуровневая таблица непредвиденных обстоятельств с данными подсчета для нескольких видов, растения-хозяина, из которого они были собраны, и была ли эта коллекция в дождливый день (это действительно имеет значение!) Используя R, поддельные данные могут выглядеть примерно так: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) host <- …

2
Как быстро сэмплировать X, если exp (X) ~ Gamma?
У меня есть простая проблема выборки, где мой внутренний цикл выглядит так: v = sample_gamma(k, a) где sample_gammaобразцы из гамма-распределения, чтобы сформировать образец Дирихле. Это работает хорошо, но для некоторых значений k / a некоторые из последующих вычислений теряются. Я адаптировал его для использования переменных пространства журнала: v = log(sample_gamma(k, …

1
Общая ошибка типа I при многократном тестировании накапливающихся данных
У меня вопрос по групповым последовательным методам . Согласно Википедии: В рандомизированном исследовании с двумя группами лечения классическое групповое последовательное тестирование используется следующим образом: если доступны n субъектов в каждой группе, промежуточный анализ проводится на 2n субъектах. Статистический анализ проводится для сравнения двух групп, и если альтернативная гипотеза принимается, испытание …

2
Что я должен знать о разработке хорошего гибридного / гамильтонова алгоритма Монте-Карло?
Я разрабатываю алгоритм выборки Гибридного Монте-Карло для PyMC , и я стараюсь сделать его максимально беспроблемным и общим, поэтому я ищу хороший совет по разработке алгоритма HMC. Я прочитал главу обзора Рэдфорда и Beskos et. В недавней статье al. об оптимальной (размер шага) настройке HMC я собрал следующие советы: Переменные …

2
GLM после выбора модели или регуляризации
Я хотел бы поставить этот вопрос в двух частях. Оба имеют дело с обобщенной линейной моделью, но первый касается выбора модели, а другой - регуляризации. Справочная информация: Я использую модели GLM (линейная, логистическая, гамма-регрессия) как для прогнозирования, так и для описания. Когда я ссылаюсь на « нормальные вещи, которые каждый …

7
Что такое пакеты интеллектуального анализа текста для R и существуют ли другие программы для анализа текста с открытым исходным кодом?
Можете ли вы порекомендовать пакет интеллектуального анализа текста в R, который можно использовать для больших объемов данных? Во-вторых, есть ли графический интерфейс для любого из пакетов интеллектуального анализа текста в R? В-третьих, есть ли другая программа для анализа текста с открытым исходным кодом, которая проста и интуитивно понятна в использовании?
12 r  text-mining 

1
Онлайн, масштабируемые статистические методы
Это было вдохновлено эффективной линейной регрессией онлайн , которая мне показалась очень интересной. Существуют ли какие-либо тексты или ресурсы, посвященные крупномасштабным статистическим вычислениям, с помощью которых вычисления с наборами данных слишком велики, чтобы помещаться в оперативную память, и, возможно, слишком разнообразны для эффективной подвыборки. Например, можно ли разместить модели со …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.