Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Почему добавление эффекта запаздывания увеличивает среднее отклонение в байесовской иерархической модели?
Справочная информация: В настоящее время я занимаюсь сравнением различных байесовских иерархических моделей. Данные yijyijy_{ij} являются числовыми показателями благосостояния для участника iii и времени jjj . У меня около 1000 участников и от 5 до 10 наблюдений на каждого участника. Как и в случае большинства продольных наборов данных, я ожидаю увидеть …

2
Различные результаты от randomForest через каретку и базового пакета randomForest
Я немного растерялся: чем могут отличаться результаты обученной модели с помощью каретки от модели в оригинальной упаковке? Я прочитал , нужна ли предварительная обработка перед прогнозированием с использованием FinalModel из RandomForest с пакетом Caret? но я не использую никакой предварительной обработки здесь. Я тренировал разные случайные леса, используя набор карет …

1
Разница между логистической регрессией и машинами опорных векторов?
Я знаю, что логистическая регрессия находит гиперплоскость, которая разделяет тренировочные образцы. Я также знаю, что опорные векторные машины находят гиперплоскость с максимальным запасом. Мой вопрос: есть ли разница между логистической регрессией (LR) и машинами опорных векторов (SVM) в том, что LR находит любую гиперплоскость, которая разделяет обучающие выборки, в то …

2
GLM: проверка выбора распределения и функции связи
У меня есть обобщенная линейная модель, которая использует гауссово распределение и функцию логарифмической связи. После подгонки модели я проверяю невязки: график QQ, невязки против прогнозируемых значений, гистограмма невязок (признавая, что необходима должная осторожность). Все выглядит хорошо. Мне кажется, это говорит о том, что выбор гауссовского распределения был вполне разумным. Или, …

1
Когда мы будем использовать танилы и медиальные, а не квантили и медианные?
Я не могу найти определения для tantile или medial в Википедии или Wolfram Mathworld, но следующее объяснение дано в Bílková, D. and Mala, I. (2012), " Применение метода L-момента при моделировании распределения дохода в Чешской Республике ", Австрийский журнал статистики , 41 (2), 125–132. Медиана - это значение (выборка) тантиля, …

1
То же самое, другое отклонение
Предположим, у вас есть восемь бегунов, которые проводят гонку; распределение их индивидуальных времен выполнения является нормальным, и каждый имеет среднее значение , скажем, секунд. Стандартное отклонение первого бегуна - самое маленькое, два - второе самое маленькое, третье - самое маленькое и т. Д., А восемь - самое большое. Меня смущают …

1
Есть ли какая-то разница между обучением сложному автоэнкодеру и двухслойной нейронной сети?
Допустим, я пишу алгоритм построения двухуровневого сложного автоэнкодера и двухслойной нейронной сети. Это одни и те же вещи или разница? Что я понимаю, так это то, что когда я строю сложенный автоэнкодер, я буду строить слой за слоем. Для нейронной сети я бы инициализировал все параметры в сетевой работе, а …

2
Дирихле Процессы кластеризации: как бороться с метками?
Вопрос: Каков стандартный способ кластеризации данных с использованием процесса Дирихле? При использовании выборочных кластеров Гиббса во время отбора проб появляются и исчезают. Кроме того, у нас есть проблема идентификации, так как апостериорное распределение инвариантно к кластерным связям. Таким образом, мы не можем сказать, кто является кластером пользователя, а скорее, что …

1
От exp (коэффициентов) к коэффициенту шансов и их интерпретации в логистической регрессии с факторами
Я запустил линейную регрессию приема в колледж против баллов SAT и семейного / этнического происхождения. Данные являются вымышленными. Это продолжение предыдущего вопроса, на который уже дан ответ. Вопрос сосредоточен на сборе и интерпретации отношений шансов, оставляя оценки SAT в стороне для простоты. Переменные Accepted(0 или 1) и Background(«красный» или «синий»). …
14 r  regression  logistic 

2
Лучшие учебники по повторной выборке Bootstrap?
Я просто хотел спросить, какие, по вашему мнению, лучшие из доступных книг по начальной загрузке. Я имею в виду не только то, что написано его разработчиками. Не могли бы вы указать, какой учебник, по вашему мнению, лучше всего подходит для начальной загрузки и отвечает следующим критериям? Философская / эпистемологическая основа …


2
Вопросы о Q-Learning с использованием нейронных сетей
Я внедрил Q-Learning, как описано в http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf Для того, чтобы ок. Q (S, A) Я использую структуру нейронной сети, как показано ниже, Активация сигмовидной кишки Входы, количество входов + 1 для нейронов действия (все входы масштабируются 0-1) Выходы, один выход. Значение Q- N количество M скрытых слоев. Метод исследования случайный …

1
Как «Фундаментальная теорема факторного анализа» применяется к PCA или как определяются нагрузки PCA?
В настоящее время я изучаю набор слайдов для «факторного анализа» (насколько я могу судить по PCA). В ней выводится «фундаментальная теорема факторного анализа», которая утверждает, что корреляционная матрица данных, поступающих в анализ ( ), может быть восстановлена ​​с использованием матрицы факторных нагрузок ( ):RR\bf RAA\bf A R=AA⊤R=AA⊤\bf R = AA^\top …

2
Отчетность степеней свободы для t-теста Уэлча
T-критерий Уэлча для неравных отклонений (также известный как Уэлч-Саттерсвэйт или Уэлч-Аспин) обычно имеет нецелые степени свободы . Как следует указывать эти степени свободы при сообщении результатов теста? «Традиционно округлять до ближайшего целого числа, прежде чем обращаться к стандартным t-таблицам» в соответствии с различными источниками * - что имеет смысл, поскольку …

3
Каковы различия между AUC и F1-счетом?
F1-оценка является гармоническим средним значением точности и отзыва. Ось у отзыва - это истинно положительный показатель (который также вызывается). Итак, иногда классификаторы могут иметь низкий уровень отзыва, но очень высокий AUC, что это значит? Каковы различия между AUC и F1-счетом?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.