Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Дискретные данные и альтернативы PCA
У меня есть набор данных с дискретными (порядковыми, меристическими и номинальными) переменными, описывающими морфологические признаки крыла нескольких близкородственных видов насекомых. То, что я хочу сделать, - это провести какой-то анализ, который бы дал мне визуальное представление о сходстве разных видов на основе морфологических характеристик. Первой вещью, которая пришла мне в …

2
Совместная фильтрация через матричную факторизацию с функцией логистических потерь
Рассмотрим проблему совместной фильтрации. У нас есть матрица размера #users * #items. если пользователь i любит элемент j, если пользователь i не любит элемент j иесли нет данных о (i, j) паре. Мы хотим предсказать для будущего пользователя, пары предметов.MMMMя , дж= 1Mя,Jзнак равно1M_{i,j} = 1Mя , дж= 0Mя,Jзнак равно0M_{i,j} …

2
Обучение на реляционных данных
Настройки Многие алгоритмы работают с одним отношением или таблицей, в то время как многие реальные базы данных хранят информацию в нескольких таблицах (Domingos, 2003). Вопрос: Какие типы алгоритмов хорошо усваиваются из нескольких (реляционных) таблиц. В частности, меня интересуют алгоритмы, применимые к задачам регрессии и классификации (не ориентированные на сетевой анализ, …

4
Расширение логистической регрессии для результатов в диапазоне от 0 до 1
У меня есть проблема регрессии, когда результаты не строго 0, 1, а скорее в диапазоне всех действительных чисел от 0 до 1, включая .Y= [ 0 , 0.12 , 0.31 , . , , , 1 ]Yзнак равно[0,0,12,0,31,,,,,1]Y = [ 0, 0.12, 0.31, ..., 1 ] Эта проблема уже обсуждалась …

3
Перемещение знака при добавлении еще одной переменной в регрессию и с гораздо большей величиной
Базовая настройка: регрессионная модель: где C - вектор управляющих переменных.y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon Я заинтересован в и ожидаю, что \ beta_1 и \ beta_2 будут отрицательными. Однако в модели существует проблема мультиколлинеарности, коэффициент корреляции определяется как: corr ( x_1 , x_2) = 0,9345, corr ( x_1 , x_3) = …

4
Коробка Кокса Преобразования для регрессии
Я пытаюсь согласовать линейную модель с некоторыми данными только одним предиктором (скажем, (x, y)). Данные таковы, что для малых значений x значения y обеспечивают плотное прилегание к прямой линии, однако при увеличении значений x значения y становятся более изменчивыми. Вот пример таких данных (R код) y = c(3.2,3.4,3.5,3.8,4.2,5.5,4.5,6.8,7.4,5.9) x = …

1
Парелл между LSA и pLSA
В оригинальной статье pLSA автор Томас Хоффман проводит параллель между структурами данных pLSA и LSA, которые я хотел бы обсудить с вами. Фон: Вдохновляясь Информация индексирование Предположим , у нас есть коллекция из NNN документов D={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbrace , и словарный запас MMM точки Ω={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega …

1
Как мне нормализовать данные датчика акселерометра?
Я работаю с большим набором данных акселерометра, собранных несколькими датчиками, которые носят многие люди. К сожалению, здесь никто не знает технических характеристик устройств, и я не думаю, что они когда-либо были откалиброваны. У меня нет много информации об устройствах. Я работаю над магистерской диссертацией, акселерометры были заимствованы из другого университета, …

2
Допущены ли зависимости Бенджамини-Хохберга?
У меня есть набор данных, в котором я проверяю наличие значительных различий между тремя популяциями в отношении примерно 50 различных переменных. Я делаю это, используя тесты Крускала-Уоллиса, с одной стороны, и тесты отношения правдоподобия для вложенных моделей GLM (с заполнением и без учета в качестве независимой переменной), с другой. В …

5
Помогает ли предварительная кластеризация построить лучшую прогностическую модель?
Для задачи моделирования оттока я рассматривал: Вычислить k кластеров для данных Постройте k моделей для каждого кластера индивидуально. Основанием для этого является то, что нечего доказывать, что совокупность подписчиков однородна, поэтому разумно предположить, что процесс генерирования данных может быть различным для разных «групп». У меня вопрос, это подходящий метод? Это …

4
Как построить 20 лет ежедневных данных во временных рядах
У меня есть следующий набор данных: https://dl.dropbox.com/u/22681355/ORACLE.csv и я хотел бы отобразить ежедневные изменения в «Open» по «Date», поэтому я сделал следующее: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") и я получаю следующее: Теперь это, очевидно, не самый хороший сюжет за всю историю, поэтому мне интересно, какой правильный метод использовать …

2
Перекошенные переменные в PCA или факторный анализ
Я хочу провести анализ основных компонентов (факторный анализ) по SPSS на основе 22 переменных. Однако некоторые из моих переменных очень искажены (асимметрия, рассчитанная по SPSS, колеблется от 2 до 80!). Итак, вот мои вопросы: Должен ли я оставить таким образом перекошенные переменные или я могу преобразовать переменные при анализе главных …

3
Доверительные интервалы против размера выборки?
Я абсолютно новичок в статистике и области доверительных интервалов. Так что это может быть очень тривиально или даже звучать глупо. Я был бы признателен, если бы вы могли помочь мне понять или указать мне литературу / текст / блог, который объясняет это лучше. Я вижу на различных новостных сайтах, таких …

2
Распределения на подмножествах
Мне интересно, есть ли какие-либо стандартные распределения на подмножествах целых чисел . Эквивалентно, мы могли бы выразить это как распределение по вектору длины двоичных результатов, например, если то соответствует вектору .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) В идеале я ищу некое распределение , происходящее …

1
Частые статистические ссылки на тех, кто хорошо разбирается в современной теории вероятностей
Исходя из строгого опыта анализа и современной теории вероятностей, я считаю, что байесовская статистика проста и легка для понимания, а статистика по частоте невероятно запутанная и неинтуитивная. Кажется, что частые люди действительно делают байесовскую статистику, за исключением «секретных априоров», которые недостаточно мотивированы или тщательно определены. С другой стороны, многие великие …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.