Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как бороться с опущенными фиктивными переменными в модели с фиксированным эффектом?
Я использую модель с фиксированным эффектом для своих данных панели (9 лет, 1000+ наблюдений), поскольку мой тест Хаусмана показывает значение . Когда я добавляю фиктивные переменные для отраслей, которые включили мои фирмы, они всегда опускаются. Я знаю, что между различными отраслевыми группами существует большая разница в отношении DV (индекса раскрытия). …

1
Имеет ли смысл критерий значимости сравнивать рандомизированные группы на исходном уровне?
Многие работы рандомизированного контролируемого исследования (РКИ) сообщают о значимых тестах базовых параметров сразу после / до рандомизации, чтобы показать, что группы действительно похожи. Это часто является частью таблицы «базовых характеристик». Однако тесты значимости измеряют вероятность случайного получения наблюдаемой (или более сильной) разницы, не так ли? И если тест является значимым, …

4
Анимация эффекта изменения ширины ядра в R
У меня есть некоторые данные в R, хранящиеся в списке. Считать d <- c(1,2,3,4) хотя это не мои данные. Если я тогда введите команду plot(density(d, kernel="gaussian", width=1)) тогда я получаю оценку плотности вероятности ядра, где ядро ​​стандартно нормально. Если я заменю 1 на другие числа, конечно, картина изменится. Я хотел …

1
Коэффициент внутриклассовой корреляции против F-критерия (односторонний ANOVA)?
Я немного запутался в отношении коэффициента внутриклассовой корреляции и одностороннего ANOVA. Насколько я понимаю, оба рассказывают, насколько похожи наблюдения внутри группы по сравнению с наблюдениями в других группах. Может ли кто-то объяснить это немного лучше и, возможно, объяснить ситуацию, в которой каждый метод более выгоден?

4
Какой тест для сравнения состава сообщества?
Надеюсь, что этот вопрос новичка является правильным вопросом для этого сайта: Предположим, я хотел бы сравнить состав экологических сообществ на двух участках A, B. Я знаю, что на всех трех участках есть собаки, кошки, коровы и птицы, поэтому я проверяю их численность на каждом участке (на самом деле у меня …

1
Значение (GAM) коэффициентов регрессии, когда вероятность модели не значительно выше нуля
Я запускаю регрессию на основе GAM, используя пакет R gamlss и предполагаю, что бета-распределение данных с нулевым раздуванием. У меня есть только один объясняющей переменной в моей модели, так это в основном: mymodel = gamlss(response ~ input, family=BEZI). Алгоритм дает мне коэффициент для влияния объясняющей переменной на среднее ( ) …

1
Можно ли аналитически интегрировать
Во-первых, под аналитической интеграцией, я имею в виду, существует ли правило интеграции для решения этой проблемы, в отличие от числового анализа (например, правил трапеции, Гаусса-Лежандра или Симпсона)? У меня есть функция где - это функция плотности вероятности логнормального распределения с параметры и . Ниже я сокращу обозначение до и буду …

5
Смещается ли логистическая регрессия, когда переменная результата делится на 5% - 95%?
Я строю модель склонности, используя логистическую регрессию для служебного клиента. Меня беспокоит то, что из всей выборки мои «плохие» аккаунты составляют всего 5%, а остальные все хороши. Я предсказываю «плохо». Будет ли результат смещен? Что является оптимальным соотношением «плохое к хорошему» для построения хорошей модели?

8
Графическая энциклопедия
Мне нужно создать многопользовательское веб-приложение, которое будет об измерениях трафика, прогнозах и т. Д. На данный момент я знаю, что буду использовать гистограммы и круговые диаграммы. К сожалению, эти типы диаграмм недостаточно богаты для представления всех данных, которые я собираю и вычисляю. Я ищу коллекцию графических диаграмм. Это очень хорошо, …

4
Большая картина по анализу выживаемости и анализу данных о жизни
Я слышал об анализе выживания и анализе данных о жизни, но не совсем понимаю общую картину. Мне было интересно, какие темы они затрагивают? Это чистая статистика или просто применение статистики по какой-то конкретной области? Является ли анализ даты жизни частью анализа выживания? Спасибо и всего наилучшего!

3
Как отобразить матрицу корреляций с отсутствующими записями?
Я хотел бы получить графическое представление корреляций в статьях, которые я собрал до сих пор, чтобы легко изучить взаимосвязи между переменными. Раньше я рисовал (грязный) график, но у меня сейчас слишком много данных. В основном у меня есть таблица с: [0]: имя переменной 1 [1]: имя переменной 2 [2]: значение …

1
Советы по определению формы кривой с помощью квантерега
Я использую пакет Quantreg , чтобы создать модель регрессии, используя 99-й процентиль моих значений в наборе данных. Основываясь на совете из предыдущего вопроса о стековом потоке, который я задал, я использовал следующую структуру кода. mod <- rq(y ~ log(x), data=df, tau=.99) pDF <- data.frame(x = seq(1,10000, length=1000) ) pDF <- …

3
Проверка гипотез на ноль-завышенных непрерывных данных
Буду очень признателен за совет по следующей проблеме: У меня есть большой непрерывный набор данных с большим количеством нулей (~ 95%), и мне нужно найти лучший способ проверить, являются ли некоторые его подмножества «интересными», то есть, кажется, не взяты из того же дистрибутива, что и остальные. Нулевая инфляция происходит из-за …

2
Распараллеливание пакета caret с использованием doSMP
ОБНОВЛЕНИЕ: каретка теперь используется foreachвнутри, поэтому этот вопрос больше не актуален. Если вы можете зарегистрировать рабочий параллельный бэкэнд для foreach, caret будет использовать его. У меня есть пакет каретки для R, и мне интересно использовать trainфункцию для перекрестной проверки моих моделей. Тем не менее, я хочу ускорить процесс, и, похоже, …

2
Как я могу определить параметры Weibull из данных?
У меня есть гистограмма данных о скорости ветра, которая часто представлена ​​с использованием распределения Вейбулла. Я хотел бы рассчитать форму и масштабные коэффициенты Вейбулла, которые наилучшим образом соответствуют гистограмме. Мне нужно численное решение (в отличие от графических решений ), потому что цель состоит в том, чтобы программно определить форму Вейбулла. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.