Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
множественная регрессия и множественные сравнения
Скажем, я подхожу для множественной регрессии p объясняющих переменных. T-тест позволит мне проверить, является ли какой-либо один из них значимым ( ). Я могу сделать частичный F-тест, чтобы проверить, является ли какое-то их подмножество значимым ( ).H 0 : β i = β j = . , , = β …

1
Есть ли общее определение величины эффекта?
У effect-sizeтега нет вики. Страница википедии о размере эффекта не дает точного общего определения. И я никогда не видел общего определения величины эффекта . Однако, читая некоторые дискуссии, подобные этой, у меня складывается впечатление, что люди имеют в виду общее представление о величине эффекта в контексте статистических тестов . Я …

1
Как сравнить два наклона регрессии для одного предиктора для двух разных результатов?
Мне нужно сравнить два наклона регрессии, где: $ y_1 ~ a + b_1x y_2 ~ a + b_2x $ Как я могу сравнить b1 и b2? Или на языке моего конкретного примера с грызунами я хочу сравнить antero-posterior diameter ~ a + b1 * humeral length de naso-occipital length ~ …

1
Аксиома выбора Люса, вопрос об условной вероятности [закрыто]
Закрыто . Этот вопрос нуждается в деталях или ясности . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Добавьте детали и проясните проблему, отредактировав этот пост . Закрыто 2 года назад . Я читаю Люси (1959) . Тогда я нашел это утверждение: Когда человек выбирает среди альтернатив, …

1
Что является более точным glm или glmnet?
R glm и glmnet используют разные алгоритмы. Я замечаю нетривиальные различия между оценочными коэффициентами, когда использую оба. Меня интересует, когда одно является более точным, чем другое, и время, чтобы решить / точность компромисса. В частности, я имею в виду случай, когда в glmnet-й задается значение lambda = 0, оно оценивает …

3
Исправлено против случайных эффектов
Совсем недавно я начал изучать обобщенные линейные смешанные модели и использовал R для изучения того, какое значение имеет отношение к членству в группе как к фиксированному, так и к случайному эффекту. В частности, я смотрю на пример набора данных, который обсуждался здесь: http://www.ats.ucla.edu/stat/mult_pkg/glmm.htm http://www.ats.ucla.edu/stat/r/dae/melogit.htm Как показано в этом уроке, эффект …

1
Как LASSO выбирает среди коллинеарных предикторов?
Я ищу интуитивно понятный ответ, почему модель GLM LASSO выбирает конкретный предиктор из группы сильно коррелированных и почему это делает иначе, чем выбор лучшего подмножества. Исходя из геометрии LASSO, показанной на рис. 2 в Tibshirani 1996, я считаю, что LASSO выбирает предиктор с большей дисперсией. Теперь предположим, что я использую …

2
Какова связь между причинным выводом и предсказанием?
Каковы взаимосвязи и различия между причинным выводом и предсказанием (как классификация, так и регрессия)? В контексте прогнозирования у нас есть переменные предиктор / вход и переменные ответ / выход. Означает ли это, что существует причинно-следственная связь между входными и выходными переменными? Итак, относится ли предсказание к причинному выводу? Если я …

2
Почему коэффициент вариации недопустим при использовании данных с положительными и отрицательными значениями?
Я не могу найти окончательный ответ на мой вопрос. Мои данные состоят из нескольких графиков с измеренными средними значениями от 0,27 до 0,57. В моем случае все значения данных положительные, но само измерение основано на соотношении значений отражательной способности, которое может варьироваться от -1 до +1. Графики представляют значения NDVI …

2
Нахождение известного числа центров окружностей, которые максимизируют количество точек на фиксированном расстоянии
У меня есть набор двумерных данных, где я хочу найти центры с указанным количеством центров окружностей ( ), которые максимизируют общее количество точек на указанном расстоянии ( ).RNNNрRR например, у меня есть 10000 точек данных и я хочу найти центры из окружностей, которые захватывают как можно больше точек в радиусе …
10 r  clustering  distance 

1
Модели дискретного времени опасности (cloglog) в R
survivalПакет вR появляешься , чтобы сосредоточиться на непрерывные моделях выживания времени. Я заинтересован в оценке версии пропорциональной модели риска с дискретным временем, дополнительной модели log-log. У меня довольно простая модель выживания с простой правильной цензурой. Я знаю, что одним из способов оценки этой модели является создание набора данных, который имеет …
10 r  survival 

1
Гистограмма с однородными и неоднородными ячейками
Этот вопрос описывает принципиальное различие между равномерной и неоднородной гистограммой. И в этом вопросе обсуждается эмпирическое правило для выбора количества бинов однородной гистограммы, которое оптимизирует (в некотором смысле) степень, в которой гистограмма представляет распределение, из которого были взяты выборки данных. Похоже, я не могу найти такой же вид «оптимальности» в …

1
Как извлечь / вычислить кредитное плечо и расстояния Кука для моделей с линейными смешанными эффектами
Кто-нибудь знает, как вычислить (или извлечь) рычаги и расстояния Кука для merобъекта класса (полученного через lme4пакет)? Я хотел бы построить их для анализа остатков.

5
Как вы решаете, каков ваш процент обучения, валидации и тестирования?
При разделении моих помеченных данных на обучающие, проверочные и тестовые наборы я слышал все от 50/25/25 до 85/5/10. Я уверен, что это зависит от того, как вы собираетесь использовать свою модель и насколько склонен к переоснащению вашего алгоритма обучения. Есть ли способ решить или все по эмпирическому правилу? Даже ELSII …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.