Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Какие предположения нормальности требуются для непарного t-теста? И когда они встретились?
Если мы хотим провести парный t-тест, необходимо (если я правильно понимаю), что средняя разница между согласованными единицами измерения будет распределена нормально. В парном t-тесте это сформулировано (AFAIK) в требовании, чтобы разница между подобранными единицами измерения была распределена нормально (даже если распределение каждой из двух сравниваемых групп не является нормальным). Однако …

2
Что делать, если некоторые моменты времени имеют сильно искаженные отклики, а некоторые нет при повторном измерении?
Как правило, когда встречаются непрерывные, но искаженные показатели результата в продольном дизайне (скажем, с одним эффектом между субъектами), общий подход заключается в преобразовании результата в нормальность. Если ситуация экстремальная, например, с усеченными наблюдениями, можно подумать и использовать модель кривой роста Тобита или что-то подобное. Но я в недоумении, когда вижу …

1
Одностороннее чебышевское неравенство для более высокого момента
Есть ли аналог чебышевского неравенства с более высоким моментом в одностороннем случае? Неравенство Чебышева-Кантелли, похоже, работает только для дисперсии, в то время как неравенство Чебышева может быть легко получено для всех показателей. Кто-нибудь знает одностороннее неравенство, использующее высшие моменты?

1
Hosmer-Lemeshow против AIC за логистическую регрессию
Если Hosmer-Lemeshow указывает на отсутствие соответствия, но AIC является самым низким среди всех моделей .... следует ли вам использовать модель? Если я удаляю переменную, статистика Хосмера-Лемешоу не будет значимой (это означает, что нет полного отсутствия соответствия). Но АПК увеличивается. Изменить : Я думаю, в общем, если AIC разных моделей близки …

9
Как я могу создавать красивые графики автоматически?
Например. такие как те на этой странице http://store.steampowered.com/hwsurvey Есть ли готовое программное обеспечение, которое может сделать это? В качестве альтернативы, какие-либо рекомендации для другого программного обеспечения, которое делает что-то подобное? Я знаю, что это на самом деле не вопрос статистики, но я твердо убежден, что данные должны быть представлены аккуратно …

2
Модификация Лассо для LARS
Я пытаюсь понять, как алгоритм Ларса может быть изменен для генерации лассо. Хотя я понимаю LARS, я не могу видеть модификацию Лассо из статьи Tibshirani et al. В частности, я не понимаю, почему условие знака в том, что знак ненулевой координаты должен совпадать со знаком текущей корреляции. Может кто-нибудь, пожалуйста, …
12 lasso 

1
Разница в реализации бинарных разбиений в деревьях решений
Мне интересно узнать о практической реализации бинарного разбиения в дереве решений - поскольку оно относится к уровням категориального предиктора .XjXjX{j} В частности, я часто буду использовать какую-то схему выборки (например, пакетирование, передискретизация и т. Д.) При построении прогнозной модели с использованием дерева решений - чтобы улучшить ее прогнозную точность и …

3
Варианты хостинга общедоступных данных
Итак, вы решили поддержать идею воспроизводимых исследований и хотите, чтобы ваши данные были доступны в Интернете для просмотра и использования людьми. Вопрос в том, где вы его размещаете? Моим первым стремлением, конечно, является частное веб-пространство, которое у меня есть на университетском сервере, но на самом деле эти вещи не так …

2
SVM с неравными размерами групп в данных обучения
Я пытаюсь построить SVM из данных обучения, где одна группа представлена ​​больше, чем другая. Тем не менее, группы будут в равной степени представлены в возможных данных испытаний. Поэтому я хотел бы использовать class.weightsпараметр e1071интерфейса пакета R, libsvmчтобы сбалансировать влияние двух групп в данных обучения. Поскольку я не был уверен, как …

2
Аппроксимирующие интегралы с использованием моделирования Монте-Карло в R
Как мне аппроксимировать следующий интеграл с помощью симуляции MC? ∫1−1∫1−1|x−y|dxdy∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y Благодарность! Редактировать (в некотором контексте): я пытаюсь научиться использовать симуляцию для аппроксимации интегралов, и я получаю некоторую практику, когда сталкиваюсь с некоторыми трудностями. Правка 2 + 3 : Каким-то образом я запутался и подумал, что …

2
Параметрическое моделирование дисперсии данных счета
Я хочу смоделировать некоторые данные, но я не уверен, какой тип модели я могу использовать. У меня есть данные подсчета, и я хочу модель, которая даст параметрические оценки как среднего значения, так и дисперсии данных. То есть у меня есть различные прогностические факторы, и я хочу определить, влияет ли какой-либо …

4
Рекомендации для статистиков-консультантов, чтобы предложить их клиентам
Этот вопрос иллюстрирует сложность того, что человек самостоятельно осваивает статистику и вероятность, перед лицом слабо развитых ресурсов, таких как Википедия. Мне пришло в голову, что консалтинговые статистики, а их здесь несколько, могут постоянно сталкиваться с проблемой объяснения определенных концепций и методов клиенту. Это обратная сторона педагогической монеты. Когда кто-то освоил …

4
Примеры дорогостоящих последствий неправильного использования статистических инструментов
Я подозреваю, что большинство пользователей статистических инструментов являются вспомогательными пользователями (люди, которые практически не имели формального обучения статистике). Для исследователей и других специалистов очень заманчиво применять статистические методы к своим данным просто потому, что они видели, как они «делали это раньше» в рецензируемых статьях, серой литературе, в Интернете или на …

5
Могу ли я использовать PCA для выбора переменных для кластерного анализа?
Я должен уменьшить количество переменных, чтобы провести кластерный анализ. Мои переменные сильно коррелированы, поэтому я подумал о проведении анализа факторов риска PCA (анализ основных компонентов). Однако, если я использую полученные результаты, мои кластеры не совсем корректны (по сравнению с предыдущими классификациями в литературе). Вопрос: Могу ли я использовать матрицу вращения …

3
Чтение только двух столбцов из трех с помощью read.csv
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. У меня есть набор данных ascii, который состоит из трех столбцов, но только последние два являются фактическими данными. Теперь я хочу создать …
12 r 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.