Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Может ли AIC сравнивать разные модели?
Я использую AIC (информационный критерий Акаике) для сравнения нелинейных моделей в R. Допустимо ли сравнивать AIC разных типов моделей? В частности, я сравниваю модель, подобранную с помощью glm, с моделью со случайным термином эффекта, подобранной с помощью glmer (lme4). Если нет, то есть ли способ сделать такое сравнение? Или идея …

4
Как измерить / оценить «важность переменной» при использовании CART? (особенно используя {rpart} из R)
При построении модели CART (в частности, дерева классификации) с использованием rpart (в R) часто бывает интересно узнать, какова важность различных переменных, введенных в модель. Таким образом, мой вопрос: какие общие меры существуют для ранжирования / измерения важности переменных участвующих переменных в модели CART? И как это можно вычислить с помощью …

3
Имеют ли отрицательные вероятности / амплитуды вероятности применения вне квантовой механики?
Квантовая механика обобщает теорию вероятностей на отрицательные / мнимые числа, в основном для объяснения интерференционных моделей, двойственности волн / частиц и вообще странных вещей, подобных этому. Однако это можно рассматривать более абстрактно как некоммутативное обобщение байесовской вероятности (цитата из Терренса Тао). Мне любопытно об этих вещах, хотя ни в коем …

3
Неконтролируемое, контролируемое и полуконтролируемое обучение
В контексте машинного обучения, в чем разница между неконтролируемое обучение контролируемое обучение и полу-контролируемое обучение? И каковы некоторые из основных алгоритмических подходов?

9
Программное обеспечение для статистики и интеллектуального анализа данных для работы с большими наборами данных
В настоящее время мне нужно проанализировать около 20 миллионов записей и построить модели прогнозирования. До сих пор я опробовал Statistica, SPSS, RapidMiner и R. Среди них Statistica кажется наиболее подходящим для работы с интеллектуальным анализом данных, а пользовательский интерфейс RapidMiner также очень удобен, но кажется, что Statistica, RapidMiner и SPSS …

5
С точки зрения статистики, можно ли сделать вывод о причинно-следственной связи, используя оценки склонности в обсервационном исследовании?
Вопрос: С точки зрения статистики (или специалиста), можно ли сделать вывод о причинно-следственной связи, используя оценки предрасположенности в наблюдательном исследовании (а не в эксперименте )? Пожалуйста, не хотите начинать пламенную войну или фанатичные дебаты. История вопроса: в рамках нашей программы PhD по статистике мы затрагивали причинно-следственные связи только через рабочие …

6
Связь между биномиальными и бета-распределениями
Я больше программист, чем статистик, поэтому я надеюсь, что этот вопрос не слишком наивен. Это происходит при выполнении программ сэмплирования в случайное время. Если я возьму N = 10 случайных выборок состояния программы, я смогу увидеть выполнение функции Foo, например, на I = 3 из этих выборок. Меня интересует, что …

4
Вероятность не нарисовать слово из пакета букв в скрэббл
Предположим, у вас была сумка с плитками, на каждой из которых была буква. Есть тайлы с буквой 'A', с 'B' и т. Д., И плитки с «подстановочными знаками» (у нас есть ). Предположим, у вас был словарь с конечным числом слов. Вы выбираете плиток из сумки без замены. Как бы …

2
Почему штраф Лассо эквивалентен двойному экспоненциальному (Лапласу) ранее?
В ряде ссылок я читал, что оценка Лассо для вектора параметра регрессии эквивалентна апостериорной моде в которой предыдущее распределение для каждого является двойным экспоненциальным распределением (также известным как распределение Лапласа).BBBBBBBiBiB_i Я пытался доказать это, кто-то может конкретизировать детали?

2
Площадь под кривой точного восстановления (AUC PR-кривой) и средняя точность (AP)
Является ли средняя точность (AP) областью под кривой точного восстановления (AUC PR-кривой)? РЕДАКТИРОВАТЬ: Вот некоторые комментарии о разнице в PR AUC и AP. AUC получается путем трапецеидальной интерполяции точности. Альтернативным и обычно почти эквивалентным показателем является Средняя точность (AP), возвращаемая как info.ap. Это среднее значение точности, получаемой каждый раз, когда …

6
Зачем изучать выпуклую оптимизацию для теоретического машинного обучения?
Я работаю над теоретическим машинным обучением - по переводному обучению, если быть точным - для моего доктора философии. Из любопытства, почему я должен пройти курс по выпуклой оптимизации? Какие выводы из выпуклой оптимизации я могу использовать в своих исследованиях теоретического машинного обучения?

6
Почему меньшие веса приводят к упрощению моделей в регуляризации?
Я закончил курс по машинному обучению Эндрю Нг около года назад, и сейчас я пишу свои исследования по математике в старших классах по методам логистической регрессии и методам оптимизации производительности. Одним из таких методов является, конечно, регуляризация. Целью регуляризации является предотвращение переоснащения путем расширения функции стоимости, чтобы включить цель простоты …

1
функция предиката () для моделей со смешанными эффектами
Проблема: Я читал в других сообщениях, которые predictнедоступны для lmerмоделей со смешанными эффектами {lme4} в [R]. Я пытался исследовать эту тему с набором игрушечных данных ... Задний план: Набор данных адаптирован из этого источника и доступен как ... require(gsheet) data <- read.csv(text = gsheet2text('https://docs.google.com/spreadsheets/d/1QgtDcGJebyfW7TJsB8n6rAmsyAnlz1xkT3RuPFICTdk/edit?usp=sharing', format ='csv')) Это первые строки и …

2
Как использовать двоичные и непрерывные переменные вместе в кластеризации?
Мне нужно использовать двоичные переменные (значения 0 и 1) в k-средних. Но k-means работает только с непрерывными переменными. Я знаю, что некоторые люди все еще используют эти двоичные переменные в k-средних, игнорируя тот факт, что k-средние предназначены только для непрерывных переменных. Это для меня неприемлемо. Вопросов: Так каков статистически / …

4
Ансамбль различных видов регрессоров, использующий scikit-learn (или любую другую среду Python)
Я пытаюсь решить регрессионную задачу. Я обнаружил, что 3 модели прекрасно работают для разных подмножеств данных: LassoLARS, SVR и Gradient Tree Boosting. Я заметил, что когда я делаю прогнозы, используя все эти 3 модели, а затем составляю таблицу «истинного результата» и выходных данных моих 3 моделей, я вижу, что каждый …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.