Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как число соединений может быть гауссовым, если оно не может быть отрицательным?
Я анализирую социальные сети (не виртуальные) и наблюдаю за связями между людьми. Если человек выберет другого человека для случайного подключения, количество соединений в группе людей будет распределено нормально - по крайней мере, в соответствии с книгой, которую я сейчас читаю. Как мы можем знать, что распределение является гауссовым (нормальным)? Существуют …

6
В чем разница между эффективностью и действенностью при определении пользы терапии «А» при условии «В»?
Контекст этого вопроса находится в рамках здравоохранения, т. Е. Рассматривает один или несколько методов лечения при заболевании. Похоже, что даже уважаемые исследователи путают термины действенность и эффективность , используя термины взаимозаменяемо. Как можно думать об эффективности по сравнению с эффективностью таким образом, чтобы помочь устранить путаницу? Какой тип дизайна исследования …

2
Вычисление корреляции (и значимости указанной корреляции) между парой временных рядов
У меня есть два временных ряда S и T. Они имеют одинаковую частоту и одинаковую длину. Я хотел бы рассчитать (используя R) корреляцию между этой парой (т.е. S и T), а также иметь возможность рассчитать значимость корреляции), чтобы я мог определить, является ли корреляция случайной или нет. Я хотел бы …

5
Matlab / октава или R лучше подходят для симуляции Монте-Карло?
Я начал заниматься Монте-Карло в R как хобби, но в конце концов финансовый аналитик посоветовал перейти на Matlab. Я опытный разработчик программного обеспечения. но начинающий Монте-Карло. Я хочу построить статические модели с анализом чувствительности, позже динамические модели. Нужны хорошие библиотеки / алгоритмы, которые меня направляют. Мне кажется, что R имеет …
14 r  matlab  monte-carlo 

2
Заказ временных рядов для машинного обучения
Прочитав один из «Советов по исследованию» Р. Дж. Хиндмана о перекрестной проверке и временных рядах, я вернулся к своему старому вопросу, который я постараюсь сформулировать здесь. Идея состоит в том, что в задачах классификации или регрессии порядок данных не важен, и, следовательно, можно использовать перекрестную проверку в k- кратном порядке. …

4
Сглаживание данных временных рядов
Я создаю приложение для Android, которое записывает данные акселерометра во время сна, чтобы анализировать тенденции сна и, по желанию, будить пользователя в нужное время во время легкого сна. Я уже построил компонент, который собирает и хранит данные, а также сигнализацию. Мне все еще нужно разобраться с чудовищем отображения и сохранения …

2
Тригонометрические операции на стандартных отклонениях
Сложение, вычитание, умножение и деление нормальных случайных величин хорошо определены, но как насчет тригонометрических операций? Например, предположим, что я пытаюсь найти угол треугольного клина (смоделированного как прямоугольный треугольник) с двумя катетами, имеющими размеры и d 2 , оба описанные как нормальные распределения.d1d1d_1d2d2d_2 И интуиция, и симуляция говорят мне, что полученное …

2
Управление ошибками с помощью GPS-маршрутов (теоретическая основа?)
Я ищу подходящую теоретическую базу или специальность, чтобы помочь мне разобраться, как справляться с ошибками, которые имеет система GPS - особенно при работе с маршрутами. По сути, я ищу требования к данным и любые алгоритмы, чтобы использовать, чтобы иметь возможность установить длину следа. Ответ должен быть заслуживающим доверия. Мой друг …
14 error  sampling 

1
Как сделать возрастную пирамиду похожей на сюжет в R?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Возрастная пирамида выглядит следующим образом: я хотел бы сделать что-то похожее, а именно 2 барплота (не гистограммы) с одинаковыми категориями, повернутыми вертикально …

3
Как определить, когда регрессионная модель перегружена?
Когда вы выполняете эту работу, осознавая, что вы делаете, у вас появляется чувство, когда вы переоцениваете модель. Во-первых, вы можете отследить тренд или ухудшение скорректированного квадрата R модели. Также можно отследить аналогичное ухудшение значений p коэффициентов регрессии основных переменных. Но когда вы просто читаете чужое исследование, и у вас нет …

4
МЕНЬШЕ, что позволяет разрывы
Существует ли метод моделирования, такой как LOESS, который допускает ноль, один или несколько разрывов, где время разрывов не известно априори? Если метод существует, есть ли существующая реализация в R?

3
Можно ли сделать модели CART надежными?
Коллега в моем офисе сказал мне сегодня: «Модели деревьев не хороши, потому что их ловят экстремальные наблюдения». Поиск здесь привел к этой теме, которая в основном поддерживает претензию. Что приводит меня к вопросу - в какой ситуации модель CART может быть надежной и как это показано?

2
Почему оценка ошибки случайного леса OOB улучшается при уменьшении количества выбранных объектов?
Я применяю алгоритм случайного леса в качестве классификатора для набора данных микрочипов, который разделен на две известные группы с тысячами объектов. После первого запуска я смотрю на важность функций и снова запускаю алгоритм дерева с 5, 10 и 20 наиболее важными функциями. Я обнаружил, что для всех 10-ти и 20-ти …

3
Блок-схемы, помогающие выбрать правильную методику анализа и тестирования
Как человек, который нуждается в статистических знаниях, но не является формально обученным статистиком, я бы счел полезным иметь блок-схему (или какое-то дерево решений), чтобы помочь мне выбрать правильный подход для решения конкретной проблемы (например, " нужно ли это и знать то и то и считать ли данные нормально распределенными? Используйте …

3
Пакет R для логистической регрессии с фиксированным эффектом
Я ищу Rпакет для оценки коэффициентов логит-моделей с индивидуальным фиксированным эффектом (индивидуальный перехват) с использованием оценки Чемберлена 1980 года. Это часто называют оценкой логита Чемберлена с фиксированным эффектом. Это классическая оценка при работе с бинарными данными панели результатов (по крайней мере, в эконометрике), но я просто не нахожу ничего связанного …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.