Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Взвешивание более свежих данных в модели Random Forest
Я обучаю классификационную модель случайному лесу, чтобы различать 6 категорий. Мои транзакционные данные имеют около 60 тыс. Наблюдений и 35 переменных. Вот пример того, как это выглядит примерно. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 | PNG …

2
Неравные размеры выборки: когда вызывать
Я рецензирую статью в академическом журнале, и авторы написали следующее в качестве оправдания для того, чтобы не сообщать какие-либо логические выводы (я определил природу двух групп): В общей сложности 25 из 2349 (1,1%) респондентов сообщили X . Мы надлежащим образом воздерживаемся от представления анализов, которые статистически сравнивают группу X с …

4
Докажите эквивалентность следующих двух формул для корреляции Спирмена
Из википедии ранговая корреляция Спирмена рассчитывается путем преобразования переменных и в ранжированные переменные и , а затем расчета корреляции Пирсона между ранговыми переменными:XiXiX_iYiYiY_ixixix_iyiyiy_i Однако в статье утверждается, что если между переменными и нет связей , приведенная выше формула эквивалентнаXiXiX_iYiYiY_i где di=yi−xidi=yi−xid_i = y_i - x_i , разница в званиях. Может …

4
Может ли метод случайного леса применяться к линейным регрессиям?
Случайные леса работают путем создания множества деревьев решений, где каждое дерево создается с использованием начальной загрузки исходных обучающих данных (выборка как входных переменных, так и наблюдений). Можно ли применить аналогичный процесс для линейной регрессии? Создайте k моделей линейной регрессии, используя случайную выборку начальной загрузки для каждой из k регрессий Каковы …

3
Понимание доверительной полосы от полиномиальной регрессии
Я пытаюсь понять результат, который вижу на графике ниже. Обычно я использую Excel и получаю линию линейной регрессии, но в приведенном ниже случае я использую R и получаю полиномиальную регрессию с помощью команды: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Поэтому мои вопросы сводятся к следующему: Что такое серая область (стрелка …

3
Как получить прогнозы с точки зрения времени выживания из модели Кокса PH?
Я хочу разработать модель прогнозирования (Кокс-РН) для смертности от всех причин в наборе данных участников, из которых (почти) все умерли в конце периода наблюдения (например, 1 год). Вместо того, чтобы прогнозировать абсолютный риск смерти в определенный момент времени, я хотел бы предсказать время выживания (в месяцах) для каждого человека. Можно …

3
Является ли р = 5,0% значимым?
Сегодня меня спросили, считается ли значение р 0,05 (точно) значимым (учитывая альфа = 5%) или нет. Я не знал ответа, и Google нашел оба ответа: (a) результат значим, если p меньше 5%, и (b) если p меньше 5% или равен 5%. Конечно, ни один из этих сайтов никого не цитировал. …

1
Как правильно оценить корреляцию между порядковым и непрерывным переменным?
Я хотел бы оценить соотношение между: Порядковая переменная: испытуемых просят оценить предпочтение 6 видов фруктов по шкале от 1 до 5 (от очень отвратительных до очень вкусных). В среднем предметы используют только 3 балла. Непрерывная переменная: одним и тем же субъектам предлагается быстро идентифицировать эти фрукты, что приводит к средней …

3
Алгоритм дерева регрессии с моделями линейной регрессии в каждом листе
Короткая версия: я ищу R-пакет, который может строить деревья решений, тогда как каждый лист в дереве решений является полной моделью линейной регрессии. AFAIK, библиотека rpartсоздает деревья решений, в которых зависимая переменная является постоянной в каждом листе. Есть ли другая библиотека (или rpartнастройка, о которой я не знаю), которая может создавать …
14 r  regression  rpart  cart 

2
Повторные измерения с течением времени с небольшим
Мне дали данные для анализа исследования, изучающего влияние лечения на уровни железа в четыре разных момента времени (до лечения, день лечения закончился, через 4 недели после лечения и через 2-4 месяца после лечения). Контрольной группы нет. Они хотят увидеть, наблюдается ли значительное повышение уровня железа в каждой из 3 временных …

3
Откуда берутся дескрипторы альфа-значений Кронбаха (например, плохо, отлично)?
Кажется довольно распространенным, чтобы описать альфа-значения Кронбаха следующим образом: α ≥ 0,9 Отлично 0,7 ≤ α <0,9 Хорошо 0,6 ≤ α <0,7 Приемлемо 0,5 ≤ α <0,6 Плохо α <0,5 Недопустимо Откуда эти ценности? Я не могу найти оригинальную исследовательскую статью, описывающую их. Редактировать: я на 90% уверен, что это …

1
Когда необходимо включать отставание зависимой переменной в регрессионную модель и какое отставание?
Данные, которые мы хотим использовать в качестве зависимой переменной, выглядят следующим образом (это данные подсчета). Мы опасаемся, что, поскольку он имеет циклический компонент и структуру тренда, регрессия оказывается как-то предвзятой. Мы будем использовать отрицательную биномиальную регрессию, если это поможет. Данные представляют собой сбалансированную панель, один манекен на человека (штаты). Показанное …

1
Бета-дистрибуция в Scipy
Согласно Википедии распределение бета-вероятности имеет два параметра формы: и β .αα\alphaββ\beta Когда я звоню scipy.stats.beta.fit(x)в Python, где xнаходится ряд чисел в диапазоне , возвращаются 4 значения. Это кажется мне странным.[0,1][0,1][0,1] После поиска в Google я обнаружил, что одно из возвращаемых значений должно быть 'location', поскольку третья переменная равна 0, если …

2
Почему k-means не оптимизировано с использованием градиентного спуска?
Я знаю, что k-средних обычно оптимизируется с использованием максимизации ожиданий . Однако мы можем оптимизировать его функцию потерь так же, как мы оптимизируем любую другую! Я нашел несколько работ, которые на самом деле используют стохастический градиентный спуск для больших k-средних, но я не смог получить ответ на свой вопрос. Итак, …

1
Работа с отсутствующими данными в модели экспоненциального сглаживания
Похоже, не существует стандартного способа справиться с отсутствующими данными в контексте семейства моделей экспоненциального сглаживания. В частности, реализация R, называемая ets в пакете прогноза , кажется, просто берет самую длинную подпоследовательность без пропущенных данных, и книга «Прогнозирование с экспоненциальным сглаживанием» Hyndman et al. похоже не говорит о пропущенных данных вообще. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.