Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Стоит ли публиковать на рецензируемой вики StatProb.com? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 7 месяцев назад . Фон Я прочитал о StatProb.com из комментария к блогу Эндрю Гельмана . По …

2
Есть ли способ объяснить прогноз из модели случайного леса?
Скажем, у меня есть модель прогнозирующей классификации, основанная на случайном лесу (используя пакет randomForest в R). Я хотел бы настроить его так, чтобы конечные пользователи могли указать элемент, для которого создается прогноз, и он выведет вероятность классификации. Пока проблем нет. Но было бы полезно / круто иметь возможность выводить что-то …

3
Измерение нелинейной зависимости
Ковариация между двумя случайными переменными определяет меру того, насколько тесно они линейно связаны друг с другом. Но что, если совместное распределение является циркулярным? Конечно, есть структура в распределении. Как эта структура извлекается?

2
Как нарисовать график взаимодействия с доверительными интервалами?
Мои попытки: Я не мог получить доверительные интервалы в interaction.plot() с другой стороны, plotmeans()из пакета 'gplot' не будет отображаться два графика. Кроме того, я не мог наложить два plotmeans()графика один поверх другого, потому что по умолчанию оси разные. У меня был некоторый успех с использованием plotCI()пакета «gplot» и наложением двух …

4
Как создать матрицу случайной корреляции, которая имеет приблизительно нормально распределенные недиагональные записи с заданным стандартным отклонением?
Я хотел бы создать матрицу случайной корреляции так, чтобы распределение ее недиагональных элементов выглядело примерно как нормальное. Как я могу это сделать? Мотивация такая. Для набора данных из временных рядов распределение корреляции часто выглядит достаточно близким к нормальному. Я хотел бы создать много «нормальных» матриц корреляции для представления общей ситуации …

2
Как выбрать количество компонентов для анализа независимых компонентов?
В отсутствие хороших априорных предположений о количестве компонентов, запрашиваемых в независимом анализе компонентов, я стремлюсь автоматизировать процесс выбора. Я думаю, что разумным критерием может быть число, которое минимизирует глобальные доказательства корреляции между вычисленными компонентами. Вот псевдокод этого подхода: for each candidate number of components, n: run ICA specifying n as …
11 ica 

4
Что означает, что исследование перегружено?
Что означает, что исследование перегружено? У меня сложилось впечатление, что это означает, что ваши размеры выборки настолько велики, что вы можете обнаружить мельчайшие размеры эффекта. Эти величины эффекта, возможно, настолько малы, что они более вероятны в результате незначительных отклонений в процессе выборки, чем (не обязательно прямой) причинной связи между переменными. …

1
Вероятности охвата базовой начальной загрузки Интервал
У меня есть следующий вопрос для курса, над которым я работаю: Проведите исследование методом Монте-Карло, чтобы оценить вероятности охвата стандартного нормального доверительного интервала начальной загрузки и базового доверительного интервала начальной загрузки. Выборка из нормальной популяции и проверка эмпирических показателей охвата для выборки среднего. Вероятности покрытия для стандартного нормального загрузочного CI …


4
Сравнение коэффициентов логистической регрессии по моделям?
Я разработал модель logit для применения к шести различным наборам данных поперечного сечения. Я пытаюсь выяснить, есть ли изменения в существенном влиянии данной независимой переменной (IV) на зависимую переменную (DV), контролирующую другие объяснения в разное время и во времени. Мои вопросы: Как мне оценить увеличение / уменьшение размера в ассоциации …
11 logistic  spss 

4
Примеры исследований с использованием p <0,001, p <0,0001 или даже более низких значений p?
Я родом из общественных наук, где p &lt;0,05 в значительной степени является нормой, причем p &lt;0,1 и p &lt;0,01 также обнаруживаются, но мне было интересно: в каких областях обучения, если таковые имеются, используют более низкие значения p в качестве общего стандарт?

3
В чем разница между Z-показателями и p-значениями?
В алгоритмах сетевых мотивов довольно часто возвращают как значение p, так и Z-показатель для статистики: «Входная сеть содержит X копий подграфа G». Подграф считается мотивом, если он удовлетворяет р-значение &lt;А, Z-оценка&gt; B и X&gt; C, для некоторых пользовательских (или определенных сообществом) A, B и C. Это мотивирует вопрос: Вопрос : …

1
Размер выборки, необходимый для определения, какой из набора рекламных объявлений имеет самый высокий рейтинг кликов.
По профессии я дизайнер программного обеспечения и работаю над проектом для клиента, и я хотел бы убедиться, что мой анализ является статистически обоснованным. Подумайте над следующим: у нас есть n рекламных объявлений (n &lt;10), и мы просто хотим знать, какое объявление работает лучше всего. Наш рекламный сервер будет случайным образом …

2
Как рассчитать параметр регуляризации в регрессии гребня с учетом степеней свободы и входной матрицы?
Пусть A будет матрицей независимых переменных n × pN×пn \times p а B будет соответствующей матрицей зависимых значений . В конька регрессии, определим параметр так , что: . Теперь давайте [usv] = svd (A) и диагональная запись 's'. мы определяем степени свободы (df) = . Ридж-регрессия сжимает коэффициенты компонентов низкой …

4
Маркировка коробок в R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Мне нужно построить блокпост без каких-либо осей и добавить его к текущему графику (кривая ROC), но мне нужно добавить больше текстовой информации …
11 r  boxplot 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.