Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

9
Справочный запрос: обобщенные линейные модели
Я ищу вводную книгу среднего уровня по обобщенным линейным моделям. В идеале, в дополнение к теории, лежащей в основе моделей, я хотел бы, чтобы в нее были включены приложения и примеры на R или другом языке программирования - я слышал, SAS также является популярным выбором. Я намерен изучить его самостоятельно, …

3
Как вычислить стандартные ошибки коэффициентов логистической регрессии
Я использую Python Scikit-Learn для обучения и проверки логистической регрессии. scikit-learn возвращает коэффициенты регрессии независимых переменных, но не предоставляет стандартных ошибок коэффициентов. Мне нужны эти стандартные ошибки для вычисления статистики Вальда для каждого коэффициента и, в свою очередь, для сравнения этих коэффициентов друг с другом. Я нашел одно описание того, …

1
Что именно называется «основным компонентом» в PCA?
Предположим есть вектор , который максимизирует дисперсию проекции данных с конструкцией матрицы .uuuXXX Теперь я видел материалы , которые относятся в качестве (первого) основного компонента данных, который также является собственным вектором с наибольшим собственным значением.uuu Однако я также видел, что основным компонентом данных является .XuXuX u Очевидно, и разные вещи. …

1
Алгоритмы кластеризации, работающие с разреженными матрицами данных [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 5 лет назад . Я пытаюсь составить список алгоритмов кластеризации, которые: Реализовано в R Работа с разреженными матрицами данных (а не матрицами сходства), например, …
18 r  clustering  sparse 


2
Компоненты с низкой дисперсией в PCA, действительно ли они просто шум? Есть ли способ проверить это?
Я пытаюсь решить, следует ли сохранить компонент PCA или нет. Существует множество критериев, основанных на величине собственного значения, которые описаны и сравнены, например, здесь или здесь . Однако в моем приложении я знаю, что малое (est) собственное значение будет небольшим по сравнению с большим (st) собственным значением, и критерии, основанные …
18 pca 

9
Галерея диаграмм, диаграмм и типов графиков
Что бы вы порекомендовали в качестве всеобъемлющей галереи методов представления данных? Источник, на который можно ссылаться, когда вы думаете о лучших способах представления ваших данных? Я определил следующие, но буду рад, если вы добавите свой: Интернет-галереи: http://www.mathworks.com/discovery/gallery.html http://www.idlcoyote.com/gallery/ https://developers.google.com/chart/interactive/docs/gallery?csw=1 http://www.walkingrandomly.com/?p=4788 http://en.wikipedia.org/wiki/Category:Statistical_charts_and_diagrams (не предоставляет одностраничную графическую галерею) http://docs.ggplot2.org/current/ http://www.itl.nist.gov/div898/handbook/graphgal.htm http://scikit-learn.org/stable/auto_examples/index.html http://www.stata.com/support/faqs/graphics/gph/stata-graphs/ …

1
Как MANOVA связана с LDA?
В нескольких местах я видел утверждение о том, что MANOVA похожа на ANOVA плюс линейный дискриминантный анализ (LDA), но он всегда выполнялся в виде ручного махания. Я хотел бы знать, что именно это должно означать. Я нашел различные учебники, описывающие все детали вычислений MANOVA, но, кажется, очень трудно найти хорошее …

4
Как рассчитать количество функций на основе разрешения изображения?
Просто покрыта нелинейная Гипотеза Эндрю Нг из Neural Netowrks, и у нас был вопрос множественного выбора для определения количества функций для изображения разрешения 100x100 из grescale интенсивности. И ответ был 50 миллионов, 555 х 10710710^7 Тем не менее, ранее для 50 х 50 пикселей, серого изображения. количество функций 50х50 (2500) …

1
Бесплатный интернет или загружаемые ресурсы для расчета размера выборки
Сегодня я заметил этот вопрос , и я подумал , что было бы полезно , если бы у нас было что - нить перечисленных ресурсы , которые люди могли удобно доступ для анализа мощности / выборок расчетов размера, возможно , аналогичного эту тему: Ресурсы для обучения R .

1
Кластерные стандартные ошибки против многоуровневого моделирования?
Я пролистал несколько книг (Raudenbush & Bryk, Snijders & Bosker, Gelman & Hill и т. Д.) И несколько статей (Gelman, Jusko, Primo & Jacobsmeier и т. Д.), И я до сих пор не успокоился основные различия между использованием кластерных стандартных ошибок стихов многоуровневого моделирования. Я понимаю те части, которые связаны …

2
Влияние границ бина на основе данных на критерий пригодности хи-квадрат?
Оставляя в стороне очевидную проблему малой мощности хи-квадрата в подобных обстоятельствах, представьте себе, что вы проводите проверку качества хи-квадрата для некоторой плотности с неопределенными параметрами путем объединения данных. Для конкретности, скажем, экспоненциальное распределение с неизвестным средним и размером выборки, скажем, 100. Чтобы получить разумное количество ожидаемых наблюдений на одну ячейку, …

4
Линейная регрессия с ограничением наклона
Я хочу выполнить очень простую линейную регрессию в R. Формула так же проста, как . Однако я бы хотел, чтобы наклон ( ) находился внутри интервала, скажем, между 1,4 и 1,6.Y= а х + бYзнак равноaИкс+бy = ax + baaa Как это может быть сделано?

3
t-тест на сильно искаженных данных
У меня есть набор данных с десятками тысяч наблюдений за данными о медицинских расходах. Эти данные сильно искажены вправо и имеют много нулей. Это выглядит так для двух групп людей (в данном случае две возрастные группы с> 3000 человек в каждой): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 …

1
Как бороться с SVM с категориальными атрибутами
У меня есть пространство 35 измерений (атрибуты). Моя аналитическая проблема - простая классификационная. Из 35 измерений более 25 являются категориальными, и каждый атрибут принимает более 50 типов значений. В этом случае введение фиктивной переменной также не будет работать для меня. Как я могу запустить SVM в пространстве, которое имеет много …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.