Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Является ли f-мера синонимом точности?
Я понимаю, что f-мера (основанная на точности и отзыве) - это оценка точности классификатора. Кроме того, f-мера предпочтительнее точности, когда у нас есть несбалансированный набор данных. У меня есть простой вопрос (который больше об использовании правильной терминологии, чем о технологии). У меня несбалансированный набор данных, и я использую f-меру в …

2
Распределение для процентных данных
У меня есть вопрос о правильном распределении, используемом для создания модели с моими данными. Я провел инвентаризацию леса на 50 участков, каждый из которых имеет размеры 20 х 50 м. Для каждого участка я подсчитал процент деревьев, которые затеняют землю. Каждый участок имеет одно значение в процентах для покрытия навеса. …

3
Почему энтропия информации больше 1?
Я реализовал следующую функцию для вычисления энтропии: from math import log def calc_entropy(probs): my_sum = 0 for p in probs: if p > 0: my_sum += p * log(p, 2) return - my_sum Результат: >>> calc_entropy([1/7.0, 1/7.0, 5/7.0]) 1.1488348542809168 >>> from scipy.stats import entropy # using a built-in package # …

1
Параметр нецентральности - что это, что он делает, что было бы предложенным значением?
Я пытался освежить свои знания в области статистики, особенно в отношении определения размера выборки и статистического анализа мощности. Но кажется, что чем больше я читаю, тем больше мне нужно читать. В любом случае я нашел инструмент под названием G * Power, который, кажется, делает все, что мне нужно, но у …

1
Допущение нормальности в линейной регрессии
В качестве допущения о линейной регрессии нормальность распределения ошибки иногда ошибочно «расширяется» или интерпретируется как необходимость нормальности y или x. Можно ли построить сценарий / набор данных, где X и Y ненормальны, но ошибочный член есть, и, следовательно, полученные оценки линейной регрессии действительны?

3
Можно ли использовать значения масштабирования в линейном дискриминантном анализе (LDA) для построения объясняющих переменных на линейных дискриминантах?
Используя набор значений, полученных в результате анализа главных компонентов, можно изучить объясняющие переменные, составляющие каждый основной компонент. Возможно ли это и с помощью линейного дискриминантного анализа? Приведенные примеры используют данные «Данные Ириса Эдгара Андерсона» ( http://en.wikipedia.org/wiki/Iris_flower_data_set ). Вот данные радужной оболочки : id SLength SWidth PLength PWidth species 1 5.1 …

2
Соотношение двух колод карт?
Я написал программу для имитации сверху вниз перетасовать карты. Каждая карта пронумерована, начиная с масти CLUBS, DIAMONDS, HEARTS, SPADESи ранга от двух до десяти, затем Джек, Королева, Король и Туз. Таким образом, у двух клубов число 1, у трех клубов 2 ... Туз треф составляет 13 ... Туз пик составляет …

3
Как правильно применять тест Nemenyi post-hoc после теста Фридмана
Я сравниваю производительность нескольких алгоритмов на нескольких наборах данных. Поскольку эти показатели производительности не гарантируются для нормального распределения, я выбрал тест Фридмана с последующим специальным тестом Немени, основанным на Демшаре (2006) . Затем я нашел другую статью, в которой, помимо предложения других методов, таких как тест Quade, с последующим специальным …

4
Интернет-ресурсы по философии причинно-следственной связи
Можете ли вы порекомендовать какие-либо книги, статьи, эссе, онлайн-уроки / курсы и т. Д., Которые были бы интересны и полезны для эпидемиолога / биостатистика, чтобы узнать о философии причинно-следственной связи / причинно-следственной связи? Я довольно много знаю о том, как на самом деле делать причинно-следственные связи в рамках эпи и …

2
Как смоделировать ежемесячные эффекты в ежедневных данных временных рядов?
У меня есть два временных ряда ежедневных данных. Одна есть, sign-upsа другая terminationsиз подписок. Я хотел бы предсказать последнее, используя информацию, содержащуюся в обеих переменных. Глядя на график этих рядов, становится очевидным, что окончания связаны с кратными числами регистраций за предыдущие месяцы. То есть скачок числа подписок 10 мая приведет …

3
Доказательство взаимосвязи между уровнем опасности, плотностью вероятности, функцией выживания
Я читаю немного об анализе выживания и большинство учебников утверждают, что h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) где h(t)h(t)h(t) - уровень опасности, f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2) функция плотности, …
11 survival 


3
PCA, ICA и лапласианские собственные карты
Вопрос Я очень заинтересован в методе Лапласовых собственных карт. В настоящее время я использую его для уменьшения размеров моих медицинских данных. Однако я столкнулся с проблемой при использовании метода. Например, у меня есть некоторые данные (спектры сигналов), и я могу использовать PCA (или ICA) для получения некоторых ПК (или микросхем). …
11 pca  ica 

4
Как вы находите причинно-следственные связи в данных?
Допустим, у меня есть таблица с колонками "A", "B" Есть ли статистический метод, чтобы определить, вызывает ли «А» «В»? Нельзя реально использовать Пирсона, потому что: это только проверяет корреляцию между значениями корреляция не причинно-следственная R Пирсона может коррелировать только линейные отношения Итак, какие еще варианты у меня есть здесь?

3
Создание автокоррелированных случайных значений в R
Мы пытаемся создать автокоррелированные случайные значения, которые будут использоваться в качестве временных рядов. У нас нет существующих данных, на которые мы ссылаемся, и мы просто хотим создать вектор с нуля. С одной стороны, нам нужен, конечно, случайный процесс с распределением и его SD. С другой стороны, должна быть описана автокорреляция, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.