Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Какие надежные методы корреляции действительно используются?
Я планирую провести симуляционное исследование, в котором сравниваю эффективность нескольких надежных методов корреляции с различными распределениями (искаженное, с выбросами и т. Д.). Под устойчивым я имею в виду идеальный случай быть устойчивым к: а) перекосам, б) выбросам и в) тяжелым хвостам. Наряду с корреляцией Пирсона в качестве базовой линии, я …


2
Переменная важность от GLMNET
Я смотрю на использование лассо в качестве метода выбора признаков и подбора прогнозирующей модели с бинарной целью. Ниже приведен код, с которым я играл, чтобы опробовать метод с регуляризованной логистической регрессией. Мой вопрос заключается в том, что я получил группу «значимых» переменных, но могу ли я упорядочить их, чтобы оценить …

2
Глубокое обучение против деревьев решений и методов повышения
Я ищу статьи или тексты, которые сравнивают и обсуждают (эмпирически или теоретически): Алгоритмы деревьев повышения и принятия решений , такие как Random Forests или AdaBoost , и GentleBoost, применяются к деревьям решений. с Методы глубокого обучения, такие как ограниченные машины Больцмана , иерархическая временная память , сверточные нейронные сети и …

5
Масштабная классификация текста
Я хочу сделать классификацию на мои текстовые данные. У меня есть 300 classes200 учебных документов на класс (так 60000 documents in total), и это, вероятно, приведет к очень большим размерам данных (возможно, мы просматриваем более 1 миллиона измерений ). Я хотел бы выполнить следующие шаги в конвейере (просто чтобы дать …

1
Как рассчитывать стандартные ошибки для оценок модели смешанных эффектов?
В частности, как следует рассчитывать стандартные ошибки фиксированных эффектов в линейной модели смешанных эффектов (в частом смысле)? Я был ведущим полагать , что типичные оценки ( ), такие как те , которые представлены в Laird и Ware [1982 года] даст системотехники, которые занижены в размерах , так как Компоненты оценочной …


3
Есть ли способ максимизировать / минимизировать пользовательскую функцию в R?
Я пытаюсь свести к минимуму пользовательские функции. Он должен принимать пять параметров и набор данных и выполнять все виды вычислений, выдавая в качестве выходных данных одно число. Я хочу найти комбинацию из пяти входных параметров, которая дает наименьший выход моей функции.
18 r  optimization 

4
Как байесовская система лучше интерпретируется, когда мы обычно используем неинформативные или субъективные априорные значения?
Часто утверждают, что байесовский каркас имеет большое преимущество в интерпретации (по сравнению с частыми), потому что он вычисляет вероятность параметра с учетом данных - вместо как в Частые рамки. Все идет нормально.p ( x | θ )p(θ|x)p(θ|x)p(\theta|x)p(x|θ)p(x|θ)p(x|\theta) Но все уравнение основано на: p(θ|x)=p(x|θ).p(θ)p(x)p(θ|x)=p(x|θ).p(θ)p(x)p(\theta|x) = {p(x|\theta) . p(\theta) \over p(x)} выглядит …

3
Вычисление процентиля ранга в R [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 3 года назад . Как я могу добавить новую переменную во фрейм данных, которая будет иметь процентильный ранг одной из переменных? Я могу сделать …
18 r  quantiles 


2
Изучение статистических концепций с помощью анализа данных
Я считаю, что простые упражнения по анализу данных часто могут помочь проиллюстрировать и уточнить статистические концепции. Какие упражнения по анализу данных вы используете для обучения статистическим понятиям?
18 teaching 

5
R пакет для моделирования многоуровневых структурных уравнений?
Я хочу протестировать многоступенчатую модель пути (например, A прогнозирует B, B прогнозирует C, C прогнозирует D), где все мои переменные представляют собой отдельные наблюдения, вложенные в группы. До сих пор я делал это с помощью множественного уникального многоуровневого анализа в R. Я бы предпочел использовать методику, такую ​​как SEM, которая …

1
Построение спарклайнов в R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я хотел бы использовать R, чтобы построить что-то вроде этого: Казалось бы, возможно, но очень сложно отслеживать координаты, ширину, высоту и т. …

4
Определение функции подбора кривой наилучшего соответствия из линейных, экспоненциальных и логарифмических функций
Контекст: Из вопроса об обмене стеками по математике (могу ли я построить программу) кто-то имеет набор точек и хочет подогнать к нему кривую, линейную, экспоненциальную или логарифмическую. Обычный метод состоит в том, чтобы начать с выбора одного из них (который определяет модель), а затем выполнить статистические вычисления.х - уИкс-Yx-y Но …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.