Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Оцените размер популяции по количеству повторных наблюдений
Скажем, у меня 50 миллионов уникальных вещей, и я беру 10 миллионов образцов (с заменой) ... Первый прикрепленный график показывает, сколько раз я выбираю одну и ту же "вещь", что относительно редко население больше, чем моя выборка. Однако, если моя популяция составляет всего 10 миллионов штук, и я беру 10 …

6
Короткие онлайн-видео, которые могут помочь лекции по статистике
При чтении статистики, может быть полезно включить случайное короткое видео. Мои первые мысли включали: Анимация и визуализация статистических понятий Рассказы о применении определенной техники Юмористические видео, которые имеют отношение к статистической идее Интервью со статистиком или исследователем, который использует статистику Есть ли какие-нибудь видео, которые вы используете при обучении статистике, …

3
Как смоделировать пользовательский анализ мощности модели lm (используя R)
Следуя недавним вопросам, которые у нас были здесь . Я прыгал, чтобы узнать, сталкивался ли кто-нибудь или может поделиться кодом R для выполнения пользовательского анализа мощности, основанного на моделировании для линейной модели? Позже я, очевидно, хотел бы расширить его на более сложные модели, но мне кажется, что мне стоит начать …

1
Тестирование двух независимых образцов на ноль с одинаковым перекосом?
Какие тесты доступны для тестирования двух независимых выборок для нулевой гипотезы о том, что они происходят из популяций с одинаковым перекосом? Существует классический 1-выборочный тест для определения того, равняется ли перекос фиксированному числу (тест включает 6-й момент выборки!); есть ли прямой перевод для теста с двумя образцами? Существуют ли методы, …

4
Как обобщить категориальные данные?
Я боролся со следующей проблемой, надеюсь, она проста для статистиков (я программист, немного знакомый со статистикой). Мне нужно обобщить ответы на опрос (для руководства). В опросе содержится более 100 вопросов, сгруппированных по разным областям (от 5 до 10 вопросов на область). Все ответы являются категоричными (по порядковой шкале они похожи …

3
Экспресс-ответы в исходных единицах, в преобразованных Бокс-Коксом данных
Для некоторых измерений результаты анализа соответствующим образом представлены в преобразованной шкале. Однако в большинстве случаев желательно представлять результаты в исходной шкале измерений (в противном случае ваша работа более или менее бесполезна). Например, в случае данных, преобразованных в лог, возникает проблема с интерпретацией в исходной шкале, потому что среднее значение зарегистрированных …

3
Использование информационной геометрии для определения расстояний и объемов ... полезно?
Я натолкнулся на большое количество литературы, в которой пропагандируется использование информационной метрики Фишера в качестве естественной локальной метрики в пространстве распределений вероятностей, а затем ее интеграция для определения расстояний и объемов. Но действительно ли эти «интегрированные» величины полезны для чего-либо? Я не нашел никаких теоретических обоснований и очень мало практических …

5
Когнитивная обработка / интерпретация методов визуализации данных
Кто-нибудь знает об исследованиях, которые исследуют эффективность (понятность?) Различных методов визуализации? Например, как быстро люди понимают одну форму визуализации поверх другой? Помогает ли интерактивность с визуализацией людям вспомнить данные? Что-нибудь в этом роде. Примером визуализаций могут быть: точечные диаграммы, графики, графики времени, карты, интерактивные интерфейсы (например, параллельные координаты) и т. …

1
Интуиция для высших моментов в круговой статистике
В круговой статистике, среднее значение случайной величины со значениями на окружности S определяются как м 1 ( Z ) = ∫ S г Р Z ( θ ) d θ (см википедия ). Это очень естественное определение, как и определение дисперсии V a r ( Z ) = 1 - …

5
Уменьшение размерности SVD для временных рядов различной длины
Я использую Singular Value Decomposition в качестве техники уменьшения размерности. Заданные Nвекторы размерностиD идея состоит в том, чтобы представить элементы в преобразованном пространстве некоррелированных измерений, в котором большая часть информации данных содержится в собственных векторах этого пространства в порядке убывания важности. Сейчас я пытаюсь применить эту процедуру к данным временных …

4
Отделение двух популяций от образца
Я пытаюсь отделить две группы значений из одного набора данных. Я могу предположить, что одна из популяций обычно распределена и составляет не менее половины размера выборки. Значения второго значения ниже или выше значений первого (распределение неизвестно). То, что я пытаюсь сделать, - это найти верхний и нижний пределы, которые бы …

4
Программное обеспечение для анонимизации данных
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Кто-нибудь знает хорошее программное обеспечение для анонимизации данных? Или, может быть, пакет для R, который выполняет анонимизацию данных? Очевидно, не ожидая безотказной …
13 software 

3
Модели линейных смешанных эффектов
Я часто слышал, что модели LME более надежны при анализе данных о точности (т. Е. В психологических экспериментах), поскольку они могут работать с биномиальными и другими ненормальными распределениями, которые не могут традиционные методы (например, ANOVA). Какова математическая основа моделей LME, которая позволяет им включать эти другие распределения, и что некоторые …

5
Когда использовать несколько моделей для прогнозирования?
Это довольно общий вопрос: Как правило, я обнаружил, что использование нескольких различных моделей превосходит одну модель при попытке предсказать временной ряд из выборки. Есть ли хорошие статьи, которые демонстрируют, что комбинация моделей превзойдет одну модель? Есть ли лучшие практики по объединению нескольких моделей? Некоторые ссылки: Hui Zoua, Yuhong Yang "Объединение …

2
Использование анализа временных рядов для анализа / прогнозирования насильственного поведения
Это немного легкомысленный вопрос, но у меня есть серьезный интерес к ответу. Я работаю в психиатрической больнице, и у меня есть данные за три года, собираемые каждый день по каждому отделению, относительно уровня насилия в этом отделении. Очевидно, что модель, которая соответствует этим данным, является моделью временного ряда. Я должен …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.