Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Можно ли использовать Колмогорова-Смирнова для сравнения двух эмпирических распределений?
Можно ли использовать критерий пригодности по Колмогорову-Смирнову для сравнения двух эмпирических распределений с целью определения того, что они, по-видимому, получены из одного и того же базового распределения, а не для сравнения одного эмпирического распределения с предварительно заданным эталонным распределением? Позвольте мне попробовать спросить это по-другому. Я собираю N образцов из …

2
Когда мы объединяем уменьшение размерности с кластеризацией?
Я пытаюсь выполнить кластеризацию на уровне документов. Я построил матрицу частот термина-документа, и я пытаюсь кластеризовать эти высокоразмерные векторы с помощью k-средних. Вместо непосредственной кластеризации я сначала применил разложение сингулярных векторов LSA (скрытый семантический анализ) для получения матриц U, S, Vt, выбрал подходящий порог с использованием графика осей и применил …

2
Что именно означает «объединение данных»?
Я думал, что «объединение данных» просто означает объединение данных, которые ранее были разбиты на категории… по сути, игнорирование категорий и создание набора данных в один гигантский «пул» данных. Я думаю, что это вопрос больше о терминологии, чем о применении статистики. Например: я хочу сравнить 2 сайта, и на каждом сайте …

1
Генерация случайных выборок из собственного дистрибутива
Я пытаюсь сгенерировать случайные выборки из пользовательского PDF-файла, используя R. Мой PDF-файл: fX(x)=32(1−x2),0≤x≤1fX(x)=32(1−x2),0≤x≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 Я сгенерировал единообразные образцы, а затем попытался преобразовать их в свой собственный дистрибутив. Я сделал это, найдя cdf моего дистрибутива ( FX(x)FX(x)F_{X}(x) ) и установив его в единую выборку …
16 r  sampling  uniform 

2
Можно ли создать график «параллельных множеств», используя R?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Благодаря вопросу Тормода (размещен здесь ) я наткнулся на сюжет « Параллельные множества» . Вот пример того, как это выглядит: (Это визуализация …


2
Оценка надежности вопросника: размерность, проблемные элементы, а также следует ли использовать альфа, лямбда6 или какой-то другой индекс?
Я анализирую оценки участников эксперимента. Я хочу оценить надежность моей анкеты, которая состоит из 6 пунктов, направленных на оценку отношения участников к продукту. Я вычислил альфу Кронбаха, рассматривая все элементы как одну шкалу (альфа был около 0,6) и удаляя один элемент за раз (максимальная альфа была около 0,72). Я знаю, …

6
Как удалить все кроме одной конкретной дублирующейся записи во фрейме данных R? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 4 года назад . У меня есть фрейм данных, который содержит несколько идентификаторов. Я хочу удалить записи с двойными идентификаторами, оставив только строку с …
16 r 

2
Является ли хорошей практикой стандартизировать ваши данные в регрессии с панельными / продольными данными?
В общем, я стандартизирую свои независимые переменные в регрессиях, чтобы правильно сравнить коэффициенты (таким образом, они имеют одинаковые единицы: стандартные отклонения). Однако с панельными / продольными данными я не уверен, как мне следует стандартизировать мои данные, особенно если я оцениваю иерархическую модель. Чтобы понять, почему это может быть потенциальной проблемой, …

2
Начало работы с нейронными сетями для прогнозирования
Мне нужны ресурсы, чтобы начать использовать нейронные сети для прогнозирования временных рядов. Я настороженно отношусь к реализации некоторых документов, а затем выясняю, что они значительно переоценили потенциал своих методов. Так что если у вас есть опыт работы с методами, которые вы предлагаете, это будет еще более круто.

2
Как вы рассчитываете доверительные интервалы для Коэна д?
Я вычислил d Коэна для коэффициентов регрессии (из статистики t), отношений шансов и средних различий, надеясь объединить результаты в мета-анализе и посмотреть, как это работает. Однако в Stata кажется, что вы не можете объединить эти результаты без доверительных интервалов для коэна d, поэтому мой вопрос: как мне обойти это? Есть …
16 cohens-d 

3
Когда было бы целесообразно сообщить об отклонении вместо стандартного отклонения?
Я провел анализ, в котором смоделировал различные компоненты дисперсии. При представлении результатов в виде таблицы гораздо проще указывать стандартные отклонения, а не отклонения. Итак, это подводит меня к вопросу - есть ли причина сообщать об отклонениях вместо стандартного отклонения? Уместнее ли сообщать одно над другим?

1
Интуитивное объяснение вклада в сумму двух нормально распределенных случайных величин
Если у меня есть две нормально распределенные независимые случайные величины XXX и YYY со средними значениями μXμX\mu_X и μYμY\mu_Y и стандартными отклонениями σXσX\sigma_X и σYσY\sigma_Y и я обнаружил, что X+Y=cX+Y=cX+Y=c , то (при условии, что я не допустил никаких ошибок) условное распределение для XXX и YYY заданные ccc , также …

4
Что такое связанные данные в контексте рангового коэффициента корреляции?
Я не в области статистики. Я видел слово «связанные данные», когда читал о коэффициентах корреляции рангов. Что такое привязанные данные? Что является примером связанных данных?

4
Допущения кластерного анализа
Извиняюсь за рудиментарный вопрос, я новичок в этой форме анализа и до сих пор очень ограниченно понимаю принципы. Мне просто интересно, применяются ли многие параметрические допущения для многомерных / одномерных тестов для кластерного анализа? Многие источники информации, которые я читал относительно кластерного анализа, не содержат каких-либо предположений. Я особенно заинтересован …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.