Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
SOM кластеризация для номинальных / циклических переменных
Просто интересно, знаком ли кто-нибудь с кластеризацией номинальных входов. Я рассматривал SOM как решение, но, видимо, оно работает только с числовыми функциями. Есть ли расширения для категориальных функций? В частности, мне было интересно узнать о «Днях недели» как о возможностях. Конечно, его можно преобразовать в числовую характеристику (т. Е. Пн-Вс, …

4
Есть ли случаи, когда не существует оптимального k в k-средних?
Это было в моей голове, по крайней мере, несколько часов. Я пытался найти оптимальное k для вывода из алгоритма k-средних (с метрикой косинусного сходства ), поэтому в итоге я построил график искажения как функции от числа кластеров. Мой набор данных представляет собой коллекцию из 800 документов в 600-мерном пространстве. Из …

3
Как сравнить два набора данных с графиком QQ, используя ggplot2?
Как новичок в области статистики и R, мне было очень трудно пытаться сгенерировать qqplots с соотношением сторон 1: 1. ggplot2, кажется, предлагает гораздо больший контроль над построением графиков, чем стандартные пакеты графиков R, но я не вижу, как выполнить qqplot в ggplot2 для сравнения двух наборов данных. Итак, мой вопрос, …

2
Организация дерева классификации (в rpart) в набор правил?
Существует ли способ построения сложного дерева классификации с использованием rpart (в R) для организации правил принятия решений, создаваемых для каждого класса? Таким образом, вместо того, чтобы получить одно огромное дерево, мы получаем набор правил для каждого из классов? (если так, то как?) Вот простой пример кода для демонстрации примеров: fit …
11 r  classification  cart  rpart 

1
Какие вопросы задаст статистик об анализе вспышки кишечной палочки?
Возможно, вы слышали о недавней вспышке энтерогеморрагической кишечной палочки ( EHEC ) в Германии . Какие вопросы задаст статистик об анализе EHEC? Я думаю о Q + Что касается репортеров / государственных чиновников, не являющихся экспертами, скажем, учителя и инженеры со степенью Диплом / магистр, но не более чем статистикой. …

2
Визуализация многомерных данных (БИС) в 2D
Я использую скрытое семантическое индексирование, чтобы найти сходство между документами ( спасибо, JMS! ) После уменьшения размеров я попытался использовать кластеризацию k-средних для группировки документов в кластеры, что очень хорошо работает. Но я хотел бы пойти немного дальше и визуализировать документы как набор узлов, где расстояние между любыми двумя узлами …

7
Техника сокращения данных для определения типов стран
Я преподаю вводный курс экономической географии. Чтобы помочь моим студентам лучше понять виды стран, которые существуют в современной мировой экономике, и оценить методы сокращения данных, я хочу составить задание, которое создает типологию разных типов стран (например, добавленная стоимость, ожидаемая продолжительность жизни, средняя продолжительность жизни у экспортера природных ресурсов с высоким …

1
Ошибка сообщить со срединными и графическими представлениями?
Я использовал широкий спектр тестов для своих диссертационных данных, от параметрических ANOVA и t-тестов до непараметрических тестов Крускала-Уоллиса и Манна-Уитни, а также преобразованных в ранг 2-сторонних ANOVA и GzLM с двоичным кодом, пуассоновские и пропорциональные данные. Теперь мне нужно сообщать обо всем, так как я пишу все это в своих …

2
Какова мощность регрессионного теста F?
Классический F-тест для подмножеств переменных в полилинейной регрессии имеет вид где - сумма квадратов ошибок в «уменьшенной» модели, которая вложена в «большую» модель , а - степени свободы две модели. При нулевой гипотезе, что дополнительные переменные в «большой» модели не имеют линейной объяснительной силы, статистика распределяется как F с степенями …

2
Значение начальных переходных вероятностей в скрытой марковской модели
Каковы преимущества придания определенных начальных значений вероятностям перехода в скрытой марковской модели? В конце концов система изучит их, так какой смысл давать значения, отличные от случайных? Имеет ли базовый алгоритм такую ​​разницу, как Баум-Уэлч? Если бы я очень точно знал вероятности перехода в начале, и моя главная цель - предсказать …

3
Существуют ли какие-либо библиотеки для CART-подобных методов, использующих разреженные предикторы и ответы?
Я работаю с некоторыми большими наборами данных, используя пакет gbm в R. И моя матрица предикторов, и мой вектор ответов довольно редки (то есть большинство записей равно нулю). Я надеялся построить деревья решений, используя алгоритм, который использует преимущества этой редкости, как это было сделано здесь ). В этой статье, как …

1
Модификация моделирования линейного баллистического аккумулятора (LBA) в R
Модель «Линейный баллистический накопитель» (LBA) - довольно успешная модель поведения человека при выполнении простых простых задач. Донкин и др. (2009, PDF ) предоставляют код, который позволяет оценивать параметры модели с учетом данных о поведении человека, и я скопировал этот код (с некоторыми незначительными изменениями форматирования) здесь . Тем не менее, …

1
Сокращение количества уровней неупорядоченной категориальной предикторной переменной
Я хочу обучить классификатор, скажем SVM, или случайный лес, или любой другой классификатор. Одной из функций в наборе данных является категориальная переменная с 1000 уровнями. Каков наилучший способ уменьшить количество уровней в этой переменной. В R есть функция, называемая combine.levels()в пакете Hmisc , которая объединяет нечастые уровни, но я искал …

1
Определение, является ли изменение во временном ряду статистически значимым
У меня есть общее количество звонков, полученных каждую неделю, и я нанес их на график, возвращаясь почти 3 года назад. На первый взгляд кажется, что за Рождество произошло значительное падение, которое, похоже, не восстановилось, кажется, что в запросах произошла ступенчатая смена. Есть ли тест, который я могу сделать, чтобы измерить …

1
Что это за «максимальный коэффициент корреляции»?
Типичная статистика обработки изображений - это использование текстурных характеристик Харалика , которых 14. Я задаюсь вопросом о 14-й из этих функций: учитывая карту смежности (которую мы можем просто посмотреть на эмпирическое распределение двух целых чисел ), она определяется как: квадратный корень из второго собственного значения , где это:i , j …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.