Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Что вызывает U-образный рисунок на пространственной коррелограмме?
Я заметил в своей работе этот паттерн при изучении пространственной коррелограммы на разных расстояниях, и в корреляциях появляется U-образный паттерн. В частности, сильные положительные корреляции на небольших дистанционных бункерах уменьшаются с расстоянием, затем достигают ямы в определенной точке и затем поднимаются обратно вверх. Вот пример из блога «Сохранение экологии», площадка …

1
Как сформировать кривую Precision-Recall, когда у меня есть только одно значение для PR?
У меня есть задание по извлечению данных, где я создаю систему поиска изображений на основе контента. У меня 20 изображений 5 животных. Итак, всего 100 изображений. Моя система возвращает 10 наиболее релевантных изображений для входного изображения. Теперь мне нужно оценить производительность моей системы с помощью кривой Precision-Recall. Однако я не …

2
Пробит двухступенчатых наименьших квадратов (2SLS)
Мне сказали, что можно провести двухэтапную IV регрессию, где первая стадия - это пробит, а вторая стадия - МНК. Можно ли использовать 2SLS, если первая стадия является пробитом, а вторая - моделью пробита / пуассона?

1
Проверка большого набора данных на нормальность - как и насколько это надежно?
Я изучаю часть моего набора данных, содержащую 46840 двойных значений в диапазоне от 1 до 1690, сгруппированных в две группы. Чтобы проанализировать различия между этими группами, я начал с изучения распределения значений, чтобы выбрать правильный тест. Следуя руководству по тестированию на нормальность, я сделал qqplot, гистограмму и boxplot. Это не …

2
Как выполнить перекрестную проверку для PCA, чтобы определить количество основных компонентов?
Я пытаюсь написать свою собственную функцию для анализа главных компонентов, PCA (конечно, многое уже написано, но я просто заинтересован в том, чтобы реализовать что-то самостоятельно). Основная проблема, с которой я столкнулся, - это этап перекрестной проверки и вычисления прогнозируемой суммы квадратов (PRESS). Неважно, какую перекрестную проверку я использую, речь идет …

3
Разработка подходящей модели временных рядов для прогнозирования продаж на основе данных за прошлый месяц
Я занимаюсь онлайн-бизнесом уже два года подряд, поэтому у меня есть данные о ежемесячных продажах за два года. На мой бизнес каждый месяц, безусловно, влияют сезонные колебания (лучше на Рождество и т. Д.) И, возможно, некоторые другие факторы, о которых я не знаю. Чтобы лучше прогнозировать будущие продажи и оценить …


2
Методы MCMC - сжигание образцов?
В методах MCMC я продолжаю читать о burn-inвремени или количестве образцов до "burn". Что это такое и зачем это нужно? Обновить: Как только MCMC стабилизируется, останется ли он стабильным? Как понятие burn-inвремени связано с понятием времени смешивания?
12 sampling  mcmc 

4
Выполнение PCA только с дистанционной матрицей
Я хочу объединить массивный набор данных, для которого у меня есть только попарные расстояния. Я реализовал алгоритм k-medoids, но его запуск занимает слишком много времени, поэтому я хотел бы начать с уменьшения масштабов моей проблемы путем применения PCA. Тем не менее, единственный способ, которым я знаю, чтобы выполнить этот метод, …

1
Сравнение коэффициентов регрессии одной и той же модели в разных наборах данных
Я оцениваю два (2) хладагента (газа), которые использовались в одной и той же системе охлаждения. У меня есть данные о температуре всасывания ( ), температуре конденсации ( ) и силе тока ( ) для оценки. Есть два (2) набора данных; 1-й хладагент ( ) и 2-й хладагент ( ). Я …

1
Интуитивно понятные примеры важности выборки
Мой опыт - информатика. Я довольно новичок в методах выборки Монте-Карло, и, хотя я понимаю математику, мне трудно придумывать интуитивные примеры для выборки по важности. Точнее, кто-то может привести примеры: оригинальное распределение, из которого нельзя выбрать образец, но можно оценить распределение важности, из которого можно взять выборку и адекватное для …

2
Лучшие практики для создания «аккуратных данных»
В прошлом году Хэдли Уикхем написала в JSS звездную статью под названием «Tidy Data» ( ссылка ) о манипулировании данными и приведении данных в «оптимальное» состояние для выполнения анализа. Однако мне было интересно, каковы наилучшие методы представления табличных данных в рабочих условиях? Допустим, ваш коллега просит вас предоставить ему некоторые …
12 dataset  tables 

1
Точный критерий Фишера и гипергеометрическое распределение
Я хотел лучше понять точный критерий Фишера, поэтому я разработал следующий пример игрушки, где f и m соответствуют мужской и женской части, а n и y соответствуют «потреблению соды», например: > soda_gender f m n 0 5 y 5 0 Очевидно, это резкое упрощение, но я не хотел, чтобы контекст …

2
Почему Томас Байес нашел теорему Байеса такой сложной?
Это больше вопрос истории науки, но я надеюсь, что он здесь по теме. Я читал, что Томасу Байесу удалось обнаружить теорему Байеса только для частного случая равномерного априора, и даже тогда он, очевидно, боролся с ней. Учитывая, насколько тривиальна общая теорема Байеса в современной трактовке, почему она представляла проблему для …

3
Нормальное приближение к распределению Пуассона
Здесь, в Википедии, написано: Для достаточно больших значений λλλ (скажем, λ>1000λ>1000λ>1000 ) нормальное распределение со средним λλλ и дисперсией λλλ (стандартное отклонение λ−−√λ\sqrt{\lambda} ) является отличным приближением к распределению Пуассона. Если λλλ больше, чем приблизительно 10, то нормальное распределение является хорошим приближением, если выполняется соответствующая коррекция непрерывности, то есть P(X≤x),P(X≤x),P(X …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.