Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Генерация выборок данных из регрессии Пуассона
Мне было интересно, как вы будете генерировать данные из уравнения регрессии Пуассона в R? Я немного растерялся, как подойти к проблеме. Поэтому, если я предполагаю, что у нас есть два предиктора и X 2, которые распределены N ( 0 , 1 ) . И перехват равен 0, и оба коэффициента …

2
Что такое чанк-тесты?
В ответ на вопрос о выборе модели в наличии мультиколлинеарности , Франк Харрелл предложил : Поместите все переменные в модель, но не проверяйте влияние одной переменной, скорректированной с учетом влияния конкурирующих переменных ... Кусочные тесты конкурирующих переменных являются мощными, потому что коллинеарные переменные объединяют силы в общем тесте ассоциации множественной …

2
Как преобразовать порядковые данные из вопросника в надлежащие интервальные данные?
Существуют ли какие-либо простые методы преобразования данных порядкового уровня в интервальный уровень (точно так же, как это делается наоборот)? И выполнимо в Excel или SPSS? Имея данные, скажем: 10 вопросов на порядковом уровне (скажем, шкала 0-5, где 0 = «совсем нет», 5 = «все время»), я хочу преобразовать их, чтобы …

3
Двумерный Колмогоров-Смирнов
Я хотел бы провести несколько двумерных тестов Колмогорова-Смиронова, чтобы определить, соответствует ли двумерное распределение эталонной. Есть ли какой-нибудь пакет или приложение, которое я мог бы использовать относительно простым способом? Или есть другой алгоритм, который предпочтительнее? У меня есть только базовые статистические знания.


2
Как получить реальный непрерывный выход из нейронной сети?
В большинстве примеров нейронных сетей, которые я видел до сих пор, сеть используется для классификации, а узлы трансформируются сигмоидальной функцией. Тем не менее, я хотел бы использовать нейронную сеть для вывода непрерывного реального значения (реально выходной сигнал обычно находится в диапазоне от -5 до +5). Мои вопросы: 1. Should I …

3
Рубин как верстак статистики
Это также вопрос, который в значительной степени относится к Python как инструменту статистики и превосходит его как инструмент статистики . Я знаю, что существует большая дискуссия о Ruby против Python, но это не главное в этом вопросе. Я подумал, что Ruby быстрее Python и обладает очень естественным синтаксисом, может помочь …
13 r  python  software  ruby 

3
Разница между односторонним и двусторонним тестированием?
Во время учебы по курсу статистики я пытался понять разницу между односторонними и двусторонними проверками гипотез. В частности, почему односторонний тест отклоняет нулевое значение, а двусторонний - нет? Пример:

2
Результаты оценок Монте-Карло, полученные с помощью выборки по важности
В течение прошлого года я довольно тесно работал над выборкой важных данных, и у меня есть несколько открытых вопросов, с которыми я надеялся получить некоторую помощь. Мой практический опыт работы со схемами выборки по важности заключался в том, что они могут иногда давать фантастические оценки с низким отклонением и смещением. …

3
Существует ли формула или правило для определения правильного размера выборки для randomForest?
Я играю с randomForest и обнаружил, что обычно увеличение SampSize приводит к повышению производительности. Существует ли правило / формула / и т. Д., В котором предлагается оптимальный размер sampSize или это метод проб и ошибок? Я предполагаю другой способ сформулировать это; каковы мои риски слишком малого размера или слишком большого …
13 r  random-forest 


2
Проанализируйте пропорции
У меня есть набор данных, содержащий несколько пропорций, которые в сумме составляют 1. Меня интересует изменение этих пропорций вдоль градиента (см. Пример данных ниже). gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 …
13 r  multinomial 

3
Различение отсутствующих наугад (MAR) от отсутствующих наугад (MCAR)
Мне эти два объяснили несколько раз. Они продолжают готовить мой мозг. Пропустить не случайно имеет смысл быть, а Пропустить совершенно случайно имеет смысл ... это Пропадает случайно, что не так много. Что дает данные, которые будут MAR, но не MCAR?

2
Интерпретация и проверка модели регрессии пропорциональных рисков Кокса с использованием R на простом английском языке
Может кто-нибудь объяснить мне мою модель Кокса на простом английском? Я использовал следующую модель регрессии Кокса для всех моих данных, используя cphфункцию. Мои данные сохраняются в объекте под названием Data. Переменные w, xи yнепрерывны; zэто фактор двух уровней. Время измеряется месяцами. У некоторых из моих пациентов отсутствуют данные для переменной …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.