Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Какие алгоритмы машинного обучения хороши для оценки того, какие функции важнее?
У меня есть данные с минимальным количеством функций, которые не меняются, и несколькими дополнительными функциями, которые могут измениться и оказать большое влияние на результат. Мой набор данных выглядит так: Особенности: A, B, C (всегда присутствует) и D, E, F, G, H (иногда присутствует) A = 10, B = 10, C …

1
AIC для не вложенных моделей: нормализующая константа
АИК определяется как , где θ является оценкой максимального правдоподобия и р является размерность пространства параметров. Для оценки θА яС= - 2 журнала( L ( θ^) ) + 2 рAIC=−2log⁡(L(θ^))+2pAIC=-2 \log(L(\hat\theta))+2pθ^θ^\hat\thetaпppθθ\thetaобычно пренебрегают постоянным фактором плотности. Это фактор, который не зависит от параметров, чтобы упростить вероятность. С другой стороны, этот фактор …

2
Случайный лес: что если я знаю, что переменная важна
Насколько я понимаю, случайный лес выбирает случайным образом переменные mtry для построения каждого дерева решений. Таким образом, если mtry = ncol / 3, то каждая переменная будет использоваться в среднем на 1/3 деревьев. И 2/3 деревьев не будут их использовать. Но что, если я знаю, что одна переменная, вероятно, очень …

6
Надежная (непараметрическая) мера, такая как коэффициент вариации - IQR / медиана или альтернатива?
Для данного набора данных разброс часто рассчитывается либо как стандартное отклонение, либо как IQR (межквартильный диапазон). Принимая во внимание, что a standard deviationнормализовано (z-показатели и т. Д.), И поэтому его можно использовать для сравнения разброса по двум различным популяциям, это не относится к IQR, поскольку выборки из двух разных популяций …

2
Каково расстояние между конечной гауссовой смесью и гауссовой?
Предположим, у меня есть смесь конечного числа гауссиан с известными весами, средними и стандартными отклонениями. Средства не равны. Конечно, можно рассчитать среднее и стандартное отклонение смеси, поскольку моменты представляют собой средневзвешенные значения моментов компонентов. Смесь не является нормальным распределением, но насколько это далеко от нормального распределения? На изображении выше показана …

3
Существует ли вариант с несколькими выборками или альтернатива тесту Колмогорова-Смирнова?
Я сравниваю распределение по размеру деревьев на шести парах участков, где один участок подвергался обработке, а другой - контролю. Используя тест Колмогорова-Смирнова на каждой паре графиков, я обнаружил, что находится в диапазоне от 0,0003707 до 0,75 . Существуют ли какие-либо подходящие методы для работы со всеми репликами вместе, например, расширение …

1
Линейная регрессия с повторными измерениями в R
Я не смог понять, как выполнить линейную регрессию в R для повторного измерения проекта. В предыдущем вопросе (все еще без ответа) мне было предложено не использовать, lmа использовать смешанные модели. Я использовал lmследующим образом: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (более подробную информацию о наборе данных можно найти по ссылке выше) Однако …

2
Как оценить третий квартиль бин-данных?
Есть ли какая-то техническая хитрость для определения третьего квартиля, если он принадлежит открытому интервалу, который содержит более четверти населения (поэтому я не могу закрыть интервал и использовать стандартную формулу)? редактировать В случае, если я что-то неправильно понял, я предоставлю более или менее полный контекст. У меня есть данные, расположенные в …

4
Может ли прогнозируемая вероятность логистической регрессии быть интерпретирована как уверенность в классификации
Можем ли мы интерпретировать апостериорную вероятность, полученную из классификатора, который выводит прогнозируемое значение класса и вероятность (например, логистическая регрессия или наивный байесовский критерий), как некоторый вид доверительной оценки, которая присваивается этому прогнозируемому значению класса?

3
STL на временных рядах с пропущенными значениями для обнаружения аномалий
Я пытаюсь обнаружить аномальные значения во временном ряду климатических данных с некоторыми отсутствующими наблюдениями. При поиске в Интернете я нашел много доступных подходов. Из них stl разложение кажется привлекательным в смысле удаления трендовых и сезонных компонентов и изучения остатка. Чтение STL: Процедура разложения по сезонным трендам, основанная на Loess , …

4
Выбор модели PCA с использованием AIC (или BIC)
Я хочу использовать Информационный критерий Акаике (AIC), чтобы выбрать соответствующее количество факторов для извлечения в PCA. Единственная проблема заключается в том, что я не уверен, как определить количество параметров. Рассмотрим матрицу , где представляет количество переменных, а - количество наблюдений, таких что . Поскольку ковариационная матрица симметрична, то оценка максимального …

3
Математическая база для интеллектуального анализа данных и алгоритмов искусственного интеллекта
Не могли бы вы дать мне некоторые разъяснения об алгоритмах интеллектуального анализа данных и искусственного интеллекта? Какую математическую базу они использовали? Не могли бы вы дать мне отправную точку в математике, чтобы понять эти типы алгоритмов?

1
Почему собственные и svd-разложения ковариационной матрицы на основе разреженных данных дают разные результаты?
Я пытаюсь разложить ковариационную матрицу на основе набора данных разреженных / gappy. Я замечаю, что сумма лямбда (объясненная дисперсия), рассчитанная с помощью svd, усиливается с помощью все более и более дурацких данных. Без пробелов, да svdи eigenте же результаты. Это, кажется, не происходит с eigenразложением. Я склонялся к использованию, svdпотому …
12 r  svd  eigenvalues 

2
randomForest выбирает регрессию вместо классификации
Я использую пакет randomForest в R и использую данные радужной оболочки, генерируемый случайный лес является классификацией, но когда я использую набор данных с примерно 700 объектами (каждый объект представлен в пикселе размером 28x28 пикселей), а столбец метки называется label, то randomForestгенерируется регресс. Я использую следующую строку: rf <- randomForest(label ~ …
12 r  random-forest 

1
иерархические байесовские модели против эмпирических байесовских
Считаете ли вы, что HBM против EB - это две альтернативы, в которых гиперпараметры «в игре» отбираются / оцениваются / и т.д.? Существует очевидная связь между этими двумя. Считаете ли вы HBM более "полностью байесовским", чем EB? Есть ли место, где я могу увидеть разницу между тем, чтобы быть «полностью …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.