Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Обнаружение выбросов на асимметричных распределениях
Согласно классическому определению выброса в качестве точки данных, превышающей 1,5 * IQR из верхнего или нижнего квартиля, существует предположение о неравномерном распределении. Для искаженных распределений (экспоненциальное, пуассоновское, геометрическое и т. Д.) Является наилучшим способом обнаружения выброса путем анализа преобразования исходной функции? Например, распределения, слабо регулируемые экспоненциальным распределением, могут быть преобразованы …

2
Почему алгоритм максимизации ожидания гарантированно сходится к локальному оптимуму?
Я прочитал несколько объяснений алгоритма EM (например, из Бишопа «Распознавание образов и машинное обучение» и из «Первого курса по машинному обучению» Роджера и Джеролами). Вывод ЭМ в порядке, я понимаю это. Я также понимаю, почему алгоритм охватывает что-то: на каждом шаге мы улучшаем результат, и вероятность ограничена 1,0, поэтому, используя …

5
Какова польза от рассмотрения фактора как случайного в смешанной модели?
У меня есть проблема, заключающаяся в использовании преимуществ маркировки модельного фактора как случайного по нескольким причинам. Мне кажется, что почти во всех случаях оптимальное решение состоит в том, чтобы рассматривать все факторы как фиксированные. Во-первых, различие между фиксированным и случайным совершенно произвольно. Стандартное объяснение состоит в том, что, если кто-то …

4
Является ли Шапиро-Уилк лучшим тестом на нормальность? Почему это может быть лучше, чем другие тесты, такие как Андерсон-Дарлинг?
Я читал где-то в литературе, что тест Шапиро – Вилка считается лучшим тестом нормальности, потому что для данного уровня значимости, , вероятность отклонения нулевой гипотезы, если она ложна, выше, чем в случае другого тесты на нормальность.αα\alpha Не могли бы вы объяснить мне, используя математические аргументы, если это возможно, как именно …


3
Перекрестная проверка или начальная загрузка для оценки эффективности классификации?
Какой метод выборки является наиболее подходящим для оценки производительности классификатора на конкретном наборе данных и сравнения его с другими классификаторами? Перекрестная проверка кажется стандартной практикой, но я читал, что такие методы, как .632 начальной загрузки, являются лучшим выбором. В качестве продолжения: влияет ли выбор метрики производительности на ответ (если я …

2
В анализе выживаемости, почему мы используем полупараметрические модели (пропорциональные риски Кокса) вместо полностью параметрических моделей?
Этот вопрос был перенесен из Математического стека обмена, потому что на него можно ответить по перекрестной проверке. Мигрировал 6 лет назад . Я изучал модель пропорциональных рисков Кокса, и этот вопрос скрыт в большинстве текстов. Кокс предложил подгонку коэффициентов функции Хазарда с использованием метода частичного правдоподобия, но почему бы просто …

4
Учитывая истинно положительные и ложно отрицательные показатели, вы можете рассчитать ложноположительные, истинно отрицательные?
У меня есть значения для True Positive (TP)и False Negative (FN)следующим образом: TP = 0.25 FN = 0.75 Из этих значений мы можем рассчитать False Positive (FP)и True Negative (TN)?

3
Определить различные кластеры 1d данных из базы данных
У меня есть таблица базы данных передачи данных между различными узлами. Это огромная база данных (около 40 миллионов переводов). Одним из атрибутов является количество байтов (nbytes), которые варьируются от 0 до 2 терабайт. Я хотел бы кластеризовать n-байты так, чтобы при заданных k кластерах некоторые передачи x1 принадлежали кластеру k1, …

2
Насколько большой тренировочный набор необходим?
Существует ли общий метод, используемый для определения того, сколько обучающих выборок требуется для обучения классификатора (в данном случае LDA) для получения минимальной пороговой точности обобщения? Я спрашиваю, потому что я хотел бы минимизировать время калибровки, обычно требуемое в интерфейсе мозг-компьютер.

2
Как спроектировать и реализовать асимметричную функцию потерь для регрессии?
проблема В регрессии обычно вычисляют среднеквадратическую ошибку (MSE) для выборки: MSE=1n∑i=1n(g(xi)−gˆ(xi))2MSE=1n∑i=1n(g(xi)−g^(xi))2 \text{MSE} = \frac{1}{n} \sum_{i=1}^n\left(g(x_i) - \widehat{g}(x_i)\right)^2 для измерения качества предсказателя. Сейчас я работаю над проблемой регрессии, цель которой состоит в том, чтобы предсказать цену, которую клиенты готовы заплатить за продукт, учитывая ряд числовых характеристик. Если прогнозируемая цена слишком высока, …

1
Интервал прогнозирования линейной регрессии
Если наилучшим линейным приближением (с использованием наименьших квадратов) моих точек данных является линия y=mx+by=mx+by=mx+b , как я могу рассчитать ошибку аппроксимации? Если я вычислю стандартное отклонение различий между наблюдениями и предсказаниями , могу ли я потом сказать, что действительное (но не наблюдаемое) значение принадлежит интервалу ( ) с вероятностью ~ …

1
Как определить условие завершения градиентного спуска?
На самом деле, я хотел спросить вас, как я могу определить условие завершения градиентного спуска. Могу ли я остановить его, основываясь на количестве итераций, т.е. учитывая значения параметров, скажем, для 100 итераций? Или мне следует подождать, чтобы различия в значениях двух параметров 'new' и 'old' были очень малы, скажем, ? …

5
Насколько надежен независимый выборочный t-критерий, когда распределение образцов ненормальное?
Я читал, что t- тест является «достаточно надежным», когда распределение выборок отклоняется от нормального. Конечно, важны именно выборочные распределения различий. У меня есть данные для двух групп. Одна из групп сильно отклонена от зависимой переменной. Размер выборки довольно мал для обеих групп (n = 33 в одной и 45 в …

4
В чем разница между математической статистикой и статистикой?
В чем разница математической статистики и статистики? Я прочитал это : Статистика - это изучение сбора, организации, анализа и интерпретации данных. В нем рассматриваются все аспекты этого, в том числе планирование сбора данных с точки зрения планирования обследований и экспериментов. И это : Математическая статистика - это изучение статистики с …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.