Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Требуется ли центрирование при начальной загрузке образца?
Читая о том, как приблизить распределение выборки, я наткнулся на непараметрический метод начальной загрузки. По- видимому, можно аппроксимировать распределение распределения ˉ Х * п - ˉ Х п , где ˉ Х * п обозначает образец среднего значения выборки начальной загрузки.Икс¯N- μИкс¯N-μ\bar{X}_n-\muИкс¯*N- Х¯NИкс¯N*-Икс¯N\bar{X}_n^*-\bar{X}_nИкс¯*NИкс¯N*\bar{X}_n^* Мой вопрос: мне нужно центрирование? Зачем? Разве …

2
Если p> n, лассо выбирает не более n переменных
Одним из мотивов для эластичной сетки было следующее ограничение LASSO: В случае p>np>np > n лассо выбирает не более n переменных, прежде чем оно насыщается, из-за характера задачи выпуклой оптимизации. Кажется, это ограничивающая особенность метода выбора переменных. Более того, лассо не является четко определенным, если только ограничение на L1-норму коэффициентов …

1
Задача оптимизации
Мой друг продает kkk моделей блендеров. Некоторые из блендеров очень простые и дешевые, другие очень сложные и более дорогие. Его данные за каждый месяц состоят из цен каждого блендера (которые он устанавливает) и количества проданных единиц для каждой модели. Чтобы установить некоторые обозначения, он знает в течение месяцев векторы где …

1
Линейная регрессия и пространственная автокорреляция
Я хочу предсказать высоту деревьев в определенной области, используя некоторые переменные, полученные с помощью дистанционного зондирования. Как приблизительная биомасса и т. Д. Я хочу сначала использовать линейную регрессию (я знаю, что это не лучшая идея, но это обязательный шаг для моего проекта). Я хотел знать, насколько сильно пространственная автокорреляция может …

2
Применимость критерия хи-квадрат, если многие ячейки имеют частоты менее 5
Чтобы найти связь между поддержкой сверстников (независимая переменная) и удовлетворенностью работой (зависимая переменная), я хочу применить критерий хи-квадрат. Поддержка сверстников - это категории в четырех группах в зависимости от степени поддержки: 1 = очень меньшая степень, 2 = в некоторой степени, 3 = в значительной степени и 4 = в …

1
Является ли начальная загрузка допустимым методом для оценки неопределенности средней оценки?
Начальная загрузка работает хорошо, чтобы получить доступ к неопределенности в средней оценке, однако я помню, что где-то чтение начальной загрузки не помогло оценить неопределенность в квантильных оценках (особенно медиана). Я не помню, где я читал это, и я не мог найти много с быстрым поиском Google. Мысли об этом и …

1
Ожидаемое значение и дисперсия следовой функции
Для случайных величин и положительной полуопределенной матрицы A : существует ли упрощенное выражение для ожидаемого значения E [ T r ( X T A X ) ] и дисперсии, ? Обратите внимание, что не является случайной величиной.X∈RhX∈RhX \in \mathbb{R}^hAAAE[Tr(XTAX)]E⁡[Tr(XTAX)]\mathop {\mathbb E}[Tr(X^TAX)]Var[Tr(XTAX)]Var[Tr(XTAX)]Var[Tr(X^TAX)]AAA

5
Подходящие методы кластеризации для временных данных?
У меня есть временные данные частот активности. Я хочу идентифицировать кластеры в данных, которые указывают различные периоды времени с подобными уровнями активности. В идеале я хочу идентифицировать кластеры без указания количества кластеров априори. Каковы подходящие методы кластеризации? Если в моем вопросе недостаточно информации, чтобы ответить, какую информацию мне нужно предоставить …

1
Вывод Negentropy. Застрять
Итак, этот вопрос несколько сложен, но я старательно пытался сделать его как можно более простым. Цель: Короче говоря, есть происхождение негэнтропии, которое не связано с кумулянтами более высокого порядка, и я пытаюсь понять, как это было получено. Фон: (Я все это понимаю) Я самостоятельно изучаю книгу «Анализ независимых компонентов» , …

3
Стандартная мера комковатости?
У меня много данных, и я хочу сделать что-то, что кажется очень простым. В этом большом наборе данных меня интересует, сколько конкретного элемента собирается вместе. Допустим, мои данные - это упорядоченный набор, подобный этому: {A, C, B, D, A, Z, T, C ...}. Допустим, я хочу знать, находятся ли буквы …

6
Ресурсы для изучения того, как реализовать методы ансамбля
Я теоретически (вроде) понимаю, как они будут работать, но не уверен, как на самом деле использовать метод ансамбля (такой как голосование, взвешенные смеси и т. Д.). Каковы хорошие ресурсы для реализации методов ансамбля? Существуют ли какие-либо конкретные ресурсы относительно реализации в Python? РЕДАКТИРОВАТЬ: Чтобы прояснить некоторые из них, основываясь на …

3
Действительно ли компоненты PCA представляют собой процент дисперсии? Могут ли они составить более 100%?
«Машинное обучение для хакеров» О'Рейли говорит, что каждый основной компонент представляет собой процент дисперсии. Я процитировал соответствующую часть страницы ниже (глава 8, с.207). Говоря с другим экспертом, они согласились, что это процент. Однако 24 компонента составляют 133,2095%. Как это может быть? Убедившись в том, что мы можем использовать PCA, как …
13 r  pca 

5
Оценка процентов как зависимой переменной в регрессии
У меня есть процентное соотношение студентов на 38 экзаменах в качестве зависимой переменной в моем исследовании. Процент ранга рассчитывается как (ранг студента / количество студентов на экзамене). Эта зависимая переменная имеет почти равномерное распределение, и я хочу оценить влияние некоторых переменных на зависимую переменную. Какой регрессионный подход я использую?

2
Как я могу использовать значение для проверки предположения о линейности в множественном регрессионном анализе?
Приведенные ниже графики являются графиками остаточного разброса регрессионного теста, для которого предположения о «нормальности», «гомоскедастичности» и «независимости» уже были точно соблюдены! Для проверки предположения о «линейности» , хотя, глядя на графики, можно догадаться, что отношение является криволинейным, но вопрос заключается в следующем: как можно использовать значение «R2 Linear» для проверки …

1
В чем разница между wilcox.test и coin :: wilcox_test в R?
Эти две функции существуют в R, но я не знаю их различий. Кажется, что они возвращают одинаковые p-значения только при вызове wilcox.testс correct=FALSE, и wilcox_test(в пакете для монет) с distribution="aymptotic". Для других значений они возвращают разные p-значения. Также wilcox.testвсегда возвращает W = 0 для моего набора данных, независимо от настроек …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.