Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Престиж фокусника-парадокса
Вы, наверное, знаете фокус в фильме «Престиж» : [СПОЙЛЕР ФИЛЬМА] Фокусник обнаружил впечатляющий фокус: он входит в машину, закрывает дверь, а затем исчезает и появляется в другой части комнаты. Но машина не идеальна: вместо того, чтобы просто телепортировать его, она дублирует его. Маг остается там, где он есть, и копия …

3
Как проверить чрезвычайно низкий уровень ошибок
Я столкнулся с попыткой продемонстрировать путем тестирования чрезвычайно низкого уровня ошибок для датчика (не более 1 ошибки в 1 000 000 попыток). У нас есть ограниченное время для проведения эксперимента, поэтому мы ожидаем, что не сможем получить более 4000 попыток. Я не вижу проблем, показывающих, что датчик не соответствует требованию, …

5
Что я могу сделать, кроме корреляции Пирсона?
Проверяя, были ли две переменные коррелированными, я заметил, что применение корреляции Пирсона позволило получить числа, равные 0,1, что указывает на отсутствие корреляции. Что я могу сделать, чтобы усилить это утверждение? Набор данных (подмножество из-за ограничений публикации), на который я смотрю, таков: 6162.178176 0.049820046 4675.14432 0.145022261 5969.056896 0.47210138 5357.506176 0.052263122 33.796224 …

1
Оцените доверительный интервал среднего значения методом начальной загрузки или просто начальной загрузкой?
При оценке доверительного интервала среднего значения, я думаю, можно применять как метод начальной загрузки, так и непараметрический метод начальной загрузки, но первый требует немного больше вычислений. Интересно, каковы преимущества и недостатки начальной загрузки по сравнению с обычной непараметрической начальной загрузкой? Почему? Есть ли ссылки для объяснения этого?

2
Какой тип регрессии использовать, учитывая одну переменную с верхней границей?
Я не уверен, какой метод использовать для моделирования отношений между двумя переменными ( и y ) в эксперименте, описанном ниже:xxxyyy Есть 3 переменные: , x и y .xaimxaimx_{aim}xxxyyy Значение устанавливается при проведении эксперимента. Однако x и x a i m не всегда равны.xaimxaimx_{aim}xxxxaimxaimx_{aim} Коэффициент корреляции Пирсона между и x составляет …

4
Можно ли пропустить данные из исследований, потому что они не значимы?
Я встречал это предложение, читая статью на sciencemag.org . В конце были включены ответы только от 7600 исследователей в 12 странах, потому что остальные данные не считались статистически значимыми. Это правильный способ исследования? Оставить результаты, потому что они не считались статистически значимыми?

3
Априорный алгоритм на простом английском?
Я прочитал вики статью об Априори. У меня проблемы с пониманием чернослива и шага соединения. Может кто-нибудь объяснить мне, как алгоритм Apriori работает в простых терминах (таких, что новичок, как я, может легко понять)? Будет хорошо, если кто-то объяснит пошаговый процесс, связанный с этим.

5
Нужны ли исправления множественных сравнений для неформальных / визуальных «множественных сравнений»?
У меня есть своего рода философский вопрос о том, когда необходима коррекция множественного сравнения. Я измеряю непрерывный изменяющийся во времени сигнал (в дискретные моменты времени). Время от времени происходят отдельные события, и я хотел бы установить, оказывают ли эти события существенное влияние на измеряемый сигнал. Таким образом, я могу принять …

3
Как быстро выбрать важные переменные из очень большого набора данных?
У меня есть набор данных с около 2000 двоичных переменных / 200 000 строк, и я пытаюсь предсказать одну двоичную зависимую переменную. Моя главная цель на данном этапе - не получить точность прогноза, а скорее определить, какие из этих переменных являются важными предикторами. Я хотел бы уменьшить количество переменных в …

4
Почему t-тест необходим, если у нас есть z-тест?
Может кто-нибудь дать объяснение, почему t-тест «происходит»? Меня учили пользоваться t-тестом, когда вы не знаете стандартное отклонение популяции (т.е. вы знаете только стандартное отклонение вашей выборки), но я не уверен, почему это отличает его от z-теста ,

2
Тестирование разницы (некоторого) квантиля-Q между группами?
Для некоторой переменной Y, которая разделена на 3 группы (X), я хочу сравнить группы и для гипотезы, что квантиль 90% одинаков для всех трех групп. Какие тесты я могу использовать? Один из вариантов, который я могу придумать, - это использовать квантильную регрессию, есть ли другие альтернативы / приложения? Я полагаю, …

2
Является ли выборка из сложенного нормального распределения эквивалентной выборке из нормального распределения, усеченной до 0?
Я хочу моделировать с нормальной плотностью (скажем, среднее = 1, SD = 1), но хочу только положительные значения. Одним из способов является симуляция с нормой и получение абсолютного значения. Я думаю об этом как о сложенном нормальном. Я вижу в R есть функции для генерации усеченной случайной величины. Если я …

3
Лучший алгоритм для классификации данных двигателя временных рядов
Я работаю над проектом управления машиной. Мы можем измерить ток двигателя во время работы. Пример данных от двух двигателей, успешно выполняющих операцию, приведен ниже. Красная кривая показывает ток от одного двигателя, синяя - ток от другого. Я хотел бы попытаться придумать алгоритм для выявления проблем с поведением машины. Проблемы могут …

2
Разрешить данным диктовать приоры, а затем запустить модель, используя эти приоры? (например, управляемые данными априоры из одного и того же набора данных)
Насколько я понимаю, мы не должны позволять тому же набору данных, который мы анализируем, управлять / определять, как выглядят предыдущие распределения в байесовском анализе. В частности, неуместно определять предыдущие распределения для байесовского анализа, основанные на сводной статистике из того же набора данных, который вы затем будете использовать приоры, чтобы помочь …
9 bayesian  prior 


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.