Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Что будет означать доверительный интервал вокруг прогнозируемого значения из модели смешанных эффектов?
Я смотрел на эту страницуи заметил методы для доверительных интервалов для lme и lmer в R. Для тех, кто не знает R, это функции для генерации смешанных эффектов или многоуровневых моделей. Если бы у меня были фиксированные эффекты в чем-то вроде схемы повторных измерений, что бы означал доверительный интервал вокруг …

12
Статистика конференций?
Каковы наиболее значимые ежегодные конференции по статистике? Правила: Одна конференция за ответ Включить ссылку на конференцию

4
Последующие действия: На смешанном графике ANOVA предполагаемые SE или фактические SE?
В настоящее время я заканчиваю работу и со вчерашнего дня наткнулся на этот вопрос, который заставил меня задать тот же вопрос самому себе. Лучше ли предоставить моему графику фактическую стандартную ошибку из данных или оценку, рассчитанную по моей ANOVA? Поскольку вчерашний вопрос был довольно неопределенным, а мой - довольно конкретным, …

9
Программное обеспечение для визуализации для кластеризации
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я хочу кластеризовать ~ 22000 баллов. Многие алгоритмы кластеризации работают лучше при более высоком качестве начальных догадок. Какие существуют инструменты, которые могут …

4
Вопросы о расхождении KL?
Я сравниваю два распределения с дивергенцией KL, которая возвращает мне нестандартизированное число, которое, согласно тому, что я читал об этой мере, представляет собой объем информации, необходимый для преобразования одной гипотезы в другую. У меня есть два вопроса: а) Есть ли способ количественно оценить дивергенцию KL, чтобы она имела более осмысленную …


4
Какие графические методы используются в моделировании структурных уравнений?
Мне любопытно, есть ли графические методы, специфичные или более применимые для моделирования структурных уравнений. Я предполагаю, что это может попасть в категории для исследовательских инструментов для ковариационного анализа или графической диагностики для оценки модели SEM. (Я действительно не думаю о диаграммах пути / графика здесь.)

2
Связь между диапазоном и стандартным отклонением
В статье я нашел формулу для стандартного отклонения размера выборки NNN σ= R¯¯¯¯2,534σ=R¯2.534\sigma=\frac{\overline{R}}{2.534} где представляет собой среднее диапазон подвыборок (размер 6 ) из основного образца. Как рассчитывается число 2.534 ? Это правильный номер?р¯¯¯¯R¯\overline{R}6662,5342.5342.534

3
Что Фишер подразумевает под этой цитатой?
Я продолжаю видеть эту знаменитую цитату повсюду, но не могу понять подчеркнутую часть каждый раз. Человек, который «отвергает» гипотезу временно, в порядке обычной практики, когда значение находится на уровне 1% или выше, наверняка будет ошибаться не более чем в 1% таких решений. Поскольку, когда гипотеза верна, он будет ошибаться только …

1
Какова «серьезность» Деборы Майо?
Может ли кто-нибудь дать подробное (и четкое) объяснение того, что означает ее «серьезность» (разве это не просто степенная функция, оцениваемая при различных несоответствиях, принимаемых за нулевую гипотезу?) И как она вписывается в литературу по статистическому тестированию в целом?

3
Каково максимальное значение дивергенции Кульбака-Лейблера (КЛ)
Я собираюсь использовать дивергенцию KL в своем коде Python, и я получил это руководство . На этом уроке реализовать дивергенцию KL довольно просто. kl = (model * np.log(model/actual)).sum() Как я понимаю, распределение вероятностей modelи actualдолжно быть <= 1. Мой вопрос: какова максимальная граница / максимально возможное значение k ?. Мне …

1
Зачем использовать нормализованный счет Джини вместо AUC в качестве оценки?
Конкурс Kaggle в прогнозировании безопасного водителя Порто Сегуро использует нормализованную оценку Джини в качестве метрики оценки, и мне стало любопытно узнать причины такого выбора. Каковы преимущества использования нормализованной оценки Джини вместо наиболее обычных показателей, таких как AUC, для оценки?

5
Модель смешанных эффектов: сравнить компонент случайной дисперсии по уровням группирующей переменной
Предположим, у меня есть участников, каждый из которых дает ответ 20 раз, 10 в одном состоянии и 10 в другом. Я подхожу к линейной модели смешанных эффектов, сравнивая в каждом условии. Вот воспроизводимый пример, моделирующий эту ситуацию с использованием пакета в :NNNYYYYYYlme4R library(lme4) fml <- "~ condition + (condition | …

3
Настройка гиперпараметров: случайный поиск и байесовская оптимизация
Итак, мы знаем, что случайный поиск работает лучше, чем поиск по сетке, но более поздним подходом является байесовская оптимизация (с использованием гауссовских процессов). Я посмотрел сравнение между ними и ничего не нашел. Я знаю, что в cs231n Стэнфорда они упоминают только случайный поиск, но, возможно, они хотели, чтобы все было …

1
Карет глмнет против cv.glmnet
Кажется, существует большая путаница при сравнении использования glmnetвнутри caretдля поиска оптимальной лямбды и использования cv.glmnetдля выполнения той же задачи. Было задано много вопросов, например: Модель классификации train.glmnet против cv.glmnet? Как правильно использовать glmnet с кареткой? Перекрестная проверка `glmnet` с использованием` caret` но ответа не дано, что может быть связано с …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.