Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Должен ли байесовский апостериор иметь правильное распределение?
Я знаю, что априорные значения не обязательно должны быть правильными и что функция правдоподобия также не интегрируется с 1. Но должен ли апостериор быть правильным распределением? Каковы последствия, если это / нет?

2
Объединение информации из нескольких исследований для оценки среднего значения и дисперсии нормально распределенных данных - байесовский и метааналитический подходы
Я рассмотрел ряд документов, в каждом из которых сообщалось о наблюдаемом среднем значении и SD измерения в соответствующей выборке известного размера, . Я хочу высказать наиболее вероятное предположение о вероятном распределении той же меры в новом исследовании, которое я проектирую, и о том, насколько неопределенны эти предположения. Я счастлив предположить, …

6
Задний очень отличается от предыдущего и вероятности
Если априор и вероятность сильно отличаются друг от друга, то иногда возникает ситуация, когда апостериор не похож ни на один из них. Посмотрите, например, эту картинку, которая использует нормальные распределения. Хотя это математически правильно, это, похоже, не соответствует моей интуиции - если данные не соответствуют моим убеждениям или данным, я …

1
Преобразование (нормализация) очень малых значений вероятности в вероятность
Я пишу алгоритм, в котором, учитывая модель, я вычисляю вероятности для списка наборов данных, а затем должен нормализовать (для вероятности) каждый из вероятностей. Таким образом, что-то вроде [0.00043, 0.00004, 0.00321] может быть преобразовано в что-то вроде [0.2, 0.03, 0.77]. Моя проблема заключается в том, что вероятность журналов, с которыми я …

6
В чем разница между описательной и логической статистикой?
Насколько я понимаю, описательная статистика количественно описывает особенности выборки данных, в то время как логическая статистика делает выводы о группах населения, из которых были взяты выборки. Тем не менее, страница Википедии для статистического вывода состояний: По большей части статистический вывод делает предположения о популяциях, используя данные, взятые из интересующей популяции …

3
Как проверить нормальное распространение с помощью Excel для выполнения t-теста?
Я хочу знать, как проверить набор данных на нормальность в Excel, просто чтобы убедиться, что требования для использования t-критерия выполняются . Для правого хвоста уместно просто рассчитать среднее и стандартное отклонение, добавить 1, 2 и 3 стандартных отклонения от среднего, чтобы создать диапазон, а затем сравнить его с нормальным значением …

3
Как и когда использовать настройку Бонферрони
У меня есть два вопроса относительно того, когда использовать настройку Бонферрони: Целесообразно ли использовать корректировку Бонферрони во всех случаях множественного тестирования? Если кто-то выполняет тест на наборе данных, то он разбивает этот набор на более мелкие уровни (например, разбивает данные по полу) и выполняет те же тесты, как это может …

5
Случайный лес против регрессии
Я запустил модель регрессии МНК на наборе данных с 5 независимыми переменными. Независимые переменные и зависимые переменные являются непрерывными и линейно связаны. Площадь R составляет около 99,3%. Но когда я запускаю то же самое, используя случайный лес в R, мой результат выглядит так: «% Var объяснено: 88.42». Почему случайный лесной …

3
Наличие сопряженного априора: глубокая собственность или математическая случайность?
Некоторые дистрибутивы имеют сопряженные приоры, а некоторые нет. Это различие просто случайность? То есть вы занимаетесь математикой, и она работает так или иначе, но на самом деле она не говорит вам ничего важного о распределении, кроме самого факта? Или наличие или отсутствие сопряженного априора отражает более глубокое свойство распределения? Распространяются …

5
Как контролировать стоимость ошибочной классификации в случайных лесах?
Можно ли контролировать стоимость ошибочной классификации в пакете R randomForest ? В моей собственной работе ложные отрицания (например, отсутствие по ошибке того, что у человека может быть заболевание) намного дороже ложных срабатываний. Пакет rpart позволяет пользователю контролировать затраты на неправильную классификацию, указывая матрицу потерь для неправильной классификации веса по-разному. Существует …

1
Обнаружение выбросов в данных подсчета
У меня есть то, что я наивно думал, что это довольно прямая проблема, которая включает в себя обнаружение выбросов для множества различных наборов данных подсчета. В частности, я хочу определить, является ли одно или несколько значений в серии данных подсчета выше или ниже ожидаемого по сравнению с остальными подсчетами в …

1
Каковы некоторые известные улучшения по сравнению с алгоритмами MCMC из учебников, которые люди используют для байесовского вывода?
Когда я кодирую симуляцию Монте-Карло для какой-то проблемы, и модель достаточно проста, я использую очень простую выборку из учебника Гиббса. Когда невозможно использовать выборку Гиббса, я пишу учебник «Метрополис-Гастингс», который я выучил много лет назад. Единственная мысль, которую я ему даю, - это выбор прыгающего распределения или его параметров. Я …

4
Многократное вменение и выбор модели
Многократное вменение довольно просто, если у вас есть априори линейная модель, которую вы хотите оценить. Тем не менее, вещи кажутся немного сложнее, когда вы на самом деле хотите сделать выбор модели (например, найти «лучший» набор переменных-предикторов из большего набора переменных-кандидатов - я думаю конкретно о LASSO и дробных многочленах с …

3
Что происходит, когда вы применяете SVD к проблеме совместной фильтрации? Какая разница между двумя?
В совместной фильтрации у нас есть значения, которые не заполняются. Предположим, что пользователь не смотрел фильм, тогда мы должны добавить туда «na». Если я собираюсь взять SVD этой матрицы, то я должен добавить туда некоторое число - скажем, 0. Теперь, если я разложу матрицу, у меня есть метод для поиска …

2
Как проверить равенство дисперсий с круговыми данными
Я заинтересован в сравнении количества изменчивости в пределах 8 различных выборок (каждая из другой популяции). Мне известно, что это можно сделать несколькими методами с данными отношения: F-критерий равенства дисперсии, критерий Левена и т. Д. Тем не менее, мои данные являются круговыми / направленными (то есть данные, которые показывают периодичность, такую …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.