Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Могу ли я использовать маленький набор для проверки?
Я понимаю причину разделения данных на наборы тестов и наборов валидации. Я также понимаю, что размер раскола будет зависеть от ситуации, но обычно будет варьироваться от 50/50 до 90/10. Я построил RNN, чтобы исправить орфографию и начать с набора данных ~ 5м предложений. Я брею 500 тыс. Предложений, а затем …

2
Является ли среднее значение положительно определенных матриц также положительно определенным?
Является ли среднее значение нескольких положительно определенных матриц обязательно положительно определенным или положительным полуопределенным? Среднее является поэлементным.

5
Что означает объединенная дисперсия «на самом деле»?
Я новичок в статистике, так что вы, ребята, не могли бы вы мне помочь? Мой вопрос заключается в следующем: что на самом деле означает объединенная дисперсия ? Когда я ищу формулу для объединенной дисперсии в Интернете, я нахожу много литературы, использующей следующую формулу (например, здесь: http://math.tntech.edu/ISR/Maturgical_Statistics/Introduction_to_Statistical_Tests/thispage/newnode19.html ): S2p=S21(n1−1)+S22(n2−1)n1+n2−2Sp2=S12(n1−1)+S22(n2−1)n1+n2−2\begin{equation} \label{eq:stupidpooledvar} \displaystyle …
15 variance  mean  pooling 

2
Как логистическая регрессия может создавать кривые, которые не являются традиционными функциями?
Я думаю, что у меня есть некоторая фундаментальная путаница в отношении того, как работают функции в логистической регрессии (или, может быть, просто функции в целом). Как получается, что функция h (x) создает кривую, видимую слева на изображении? Я вижу, что это график двух переменных, но тогда эти две переменные (x1 …

1
Объединение калибровочных участков после многократного вменения
Я хотел бы получить совет по объединению калибровочных графиков / статистики после многократного вменения. В условиях разработки статистических моделей для прогнозирования будущего события (например, с использованием данных из больничных записей для прогнозирования выживаемости или событий после выписки из больницы) можно предположить, что существует некоторая или много недостающей информации. Множественное вменение …

2
Почему максимизация ожидания важна для моделей смесей?
Существует много литературы, в которой подчеркивается, что метод максимизации ожиданий на моделях смесей (смесь гауссовской, скрытой марковской модели и т. Д.). Почему EM важен? EM - это просто способ оптимизации, который широко не используется в качестве метода, основанного на градиенте (метод градиентного приличия или метод Ньютона / квазиньютона) или другого …

2
Что такое хороший метод для кластеризации коротких текстов?
Я работаю над проблемой кластеризации текста. Данные содержат несколько предложений. Есть хороший алгоритм, который достигает высокой точности на коротком тексте? Можете ли вы предоставить хорошие ссылки? Алгоритмы, такие как KMeans, спектральная кластеризация не работают хорошо для этой проблемы.

5
Является ли это мошенничеством, чтобы отбросить выбросы, основанные на диаграмме средней абсолютной ошибки, чтобы улучшить регрессионную модель
У меня есть модель прогнозирования, протестированная четырьмя методами, как вы можете видеть на рисунке ниже. Атрибут, который предсказывает модель, находится в диапазоне 0-8. Вы можете заметить, что во всех методах указаны один выброс верхней границы и три выброса нижней границы . Интересно, уместно ли удалять эти экземпляры из данных? Или …

5
Ошибка аппроксимации доверительного интервала для среднего при
Пусть - семейство случайных величин iid, принимающих значения в , имеющих среднее и дисперсию . Простой доверительный интервал для среднего значения, использующий всякий раз, когда он известен, задается как {Xi}ni=1{Икся}язнак равно1N\{X_i\}_{i=1}^n[0,1][0,1][0,1]μμ\muσ2σ2\sigma^2σσ\sigmaP(|X¯−μ|>ε)≤σ2nε2≤1nε2(1).п(|Икс¯-μ|>ε)≤σ2Nε2≤1Nε2(1), P( | \bar X - \mu| > \varepsilon) \le \frac{\sigma^2}{n\varepsilon^2} \le\frac{1}{n \varepsilon^2} \qquad (1). Кроме того, поскольку асимптотически распределяется …

2
Хорошая точность, несмотря на высокое значение потерь
Во время обучения простого нейронного бинарного классификатора я получаю высокую величину потерь, используя кросс-энтропию. Несмотря на это, значение точности на проверочном наборе остается достаточно хорошим. Это имеет какое-то значение? Нет строгой корреляции между потерей и точностью? У меня на тренировке и проверке есть следующие значения: 0,4011 - соотв: 0,8224 - …

1
В чем разница между обычным PCA и вероятностным PCA?
Я знаю, что обычный PCA не следует вероятностной модели для наблюдаемых данных. Так в чем же принципиальная разница между PCA и PPCA ? В PPCA модель скрытых переменных содержит, например, наблюдаемые переменные , скрытые (ненаблюдаемые переменные ) и матрицу , которая не должна быть ортонормированной, как в обычной PCA. Еще …
15 pca 

1
Беспристрастная оценка отношения двух коэффициентов регрессии?
Предположим, вы подходите к линейной / логистической регрессии с целью объективной оценки . Вы очень уверены, что и очень положительны по отношению к шуму в своих оценках.g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 Если у вас есть общая ковариация , вы можете рассчитать или, по крайней мере, смоделировать …

1
Как подобрать смешанную модель с переменной отклика от 0 до 1?
Я пытаюсь использовать lme4::glmer()для подгонки биномиальной обобщенной смешанной модели (GLMM) с зависимой переменной, которая является не двоичной, а непрерывной переменной от нуля до единицы. Можно думать об этой переменной как о вероятности; на самом деле это вероятность того, как сообщили человеческих субъектов (в эксперименте , который я помочь анализирующего). Т.е. …


4
В каких реальных ситуациях мы можем использовать алгоритм многорукого бандита?
Многорукие бандиты хорошо работают в ситуации, когда у вас есть выбор, и вы не уверены, какой из них увеличит ваше самочувствие. Вы можете использовать алгоритм для некоторых реальных жизненных ситуаций. В качестве примера, обучение может быть хорошей областью: Если ребенок изучает столярное дело, и он плохо в этом разбирается, алгоритм …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.