Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Можно ли добавить данные обучения к существующим моделям SVM?
Я использую libsvm и заметил, что каждый раз, когда я вызываю svmtrain (), я создаю новую модель, и кажется, что нет возможности поместить данные в существующую модель. Возможно ли это сделать однако? Я просто не вижу этот аспект в libsvm?
14 svm  libsvm 

3
Скрытая марковская модель, порог
Я разработал концептуальную систему для распознавания звука с использованием моделей mfcc и скрытых марков. Это дает многообещающие результаты, когда я тестирую систему на известные звуки. Хотя система, когда вводится неизвестный звук, возвращает результат с наиболее близким соответствием, и оценка не настолько отлична, чтобы придумать, это неизвестный звук, например: Я подготовил …

2
Вы отвергаете нулевую гипотезу, когда
Это явно вопрос определения или соглашения, и он практически не имеет практического значения. Если для αα\alpha установлено традиционное значение 0,05, считается ли значение ppp 0,0500000000000 ... статистически значимым или нет? Является ли правило определения статистической значимости p&lt;αp&lt;αp < \alpha или p≤αp≤αp \leq \alpha ??

1
Дисперсионное распределение и продольные изменения в корреляции с двоичными данными
Я анализирую данные о 300 000 учеников в 175 школах с помощью логистической линейной модели смешанных эффектов (случайные перехваты). Каждый ученик встречается ровно один раз, а данные охватывают 6 лет. Как разделить разницу между уровнями школы и ученика, аналогично VPC / ICC для непрерывных результатов? Я видел эту статью, в …

1
Какие существуют разные типы кодировок для категориальных переменных (в R) и когда вы будете их использовать?
Если вы подходите к линейной или смешанной модели, существуют различные типы кодировок, доступных для преобразования категориальной или номинальной вариабельной переменной в ряд переменных, для которых оцениваются параметры, такие как фиктивная кондукция (по умолчанию R) и кодирование эффектов. Я слышал, что кодирование эффектов (иногда называемое отклонением или контрастным кодированием) является предпочтительным, …

3
Тематические модели для коротких документов
Вдохновленный этим вопросом , мне интересно, была ли проделана какая-либо работа над тематическими моделями для больших коллекций чрезвычайно коротких текстов. Моя интуиция заключается в том, что Twitter должен быть естественным источником вдохновения для таких моделей. Однако, из-за некоторых ограниченных экспериментов, похоже, что стандартные тематические модели (LDA и т. Д.) Довольно …

2
Могу ли я использовать алгоритмы glm для полиномиальной логистической регрессии?
Я использую Spotfire (S ++) для статистического анализа в моем проекте, и мне приходится выполнять многочленную логистическую регрессию для большого набора данных. Я знаю, что лучшим алгоритмом был бы mlogit, но, к сожалению, он не доступен в s ++. Тем не менее, у меня есть возможность использовать алгоритм GLM для …

5
Интерпретация расхождений между R и SPSS с помощью исследовательского факторного анализа
Я аспирант в области компьютерных наук. Я проводил некоторый исследовательский анализ факторов для исследовательского проекта. Мои коллеги (которые возглавляют проект) используют SPSS, а я предпочитаю использовать R. Это не имело значения, пока мы не обнаружили существенное расхождение между двумя статистическими пакетами. Мы используем фактор главной оси в качестве метода извлечения …

2
Вопрос о логистической регрессии
Я хочу запустить бинарную логистическую регрессию, чтобы смоделировать наличие или отсутствие конфликта (зависимой переменной) из набора независимых переменных в течение 10-летнего периода (1997-2006 гг.), Причем каждый год имеет 107 наблюдений. Мои независимые: деградация земель (категорически для 2 типов деградации); увеличение численности населения (0 - нет; 1 - да); тип средств …

2
Работа с наборами данных с переменным количеством функций
Каковы некоторые подходы для классификации данных с переменным количеством признаков? В качестве примера рассмотрим проблему, в которой каждая точка данных представляет собой вектор точек x и y, и у нас не одинаковое количество точек для каждого экземпляра. Можем ли мы рассматривать каждую пару точек x и y как особенность? Или …

3
Динамические рекомендательные системы
Система Рекомендатора будет измерять корреляцию между рейтингами разных пользователей и давать рекомендации для данного пользователя относительно пунктов, которые могут быть ему интересны. Однако вкусы меняются со временем, поэтому старые рейтинги могут не отражать текущие предпочтения и наоборот. Возможно, вы когда-то поместили «отлично» в книгу, которую вы сейчас оценили бы как …

3
Что можно рассказать школьнику о статистике и машинном обучении?
На следующей неделе у нас есть стажер из местной школы в доме. Идея его короткой стажировки заключается в том, чтобы понять, как работает реальный мир и с чем связаны определенные рабочие места, как выглядит повседневная работа и т. Д. Теперь мне стало интересно, что можно рассказать / показать / продемонстрировать …

2
Кодирование категориальных функций в числа для машинного обучения
Многие алгоритмы машинного обучения, например нейронные сети, предполагают работу с числами. Поэтому, когда у вас есть категорические данные, вам необходимо преобразовать их. Под категориальным я имею в виду, например: Марки автомобилей: Audi, BMW, Chevrolet ... Идентификаторы пользователей: 1, 25, 26, 28 ... Несмотря на то, что идентификаторы пользователей - это …

1
Связанный момент производящей функции
Этот вопрос возникает из вопроса, который здесь задают о функции, порождающей момент (MGF). Предположим, что XXX - ограниченная случайная величина со средним нулем, принимающая значения в [−σ,σ][−σ,σ][-\sigma, \sigma] и пусть G(t)=E[etX]G(t)=E[etX]G(t) = E[e^{tX}] - ее MGF. Из а связаны используется в доказательстве неравенства Хёфдинга , мы имеем , что G(t)=E[etX]≤eσ2t2/2G(t)=E[etX]≤eσ2t2/2G(t) …

3
Может ли кто-нибудь объяснить динамическое искажение времени для определения сходства временных рядов?
Я пытаюсь понять динамическое искажение времени для сравнения временных рядов вместе. У меня есть три набора данных временного ряда, как это: T1 &lt;- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.