Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Анализ данных ветра с помощью R
Привет, я анализирую данные о ветре для оценки энергии от ветряной турбины. Я взял данные о ветре за 10 лет и составил гистограмму; моя вторая стадия состояла в том, чтобы приспособить распределение Вейбулла к данным. Я использовал R с пакетом, lmomчтобы вычислить форму Вейбула и масштабировать этот код, который я …
12 r  distributions 

5
Лучшее расстояние для использования
контекст У меня есть два набора данных, которые я хочу сравнить. Каждый элемент данных в обоих наборах представляет собой вектор, содержащий 22 угла (все между −π−π-\pi и ππ\pi ). Углы относятся к данной конфигурации позы человека, поэтому поза определяется 22 углами соединения. В конечном итоге я пытаюсь определить «близость» двух …

4
Настройка Sweave, R, Latex, Eclipse StatET [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 3 года назад . Несколько дней назад я увидел сообщение о том, как настроить SweaveR, который позволил бы пользователю напрямую экспортировать такие вещи, …
12 r 

2
Split-Plot ANOVA: сравнение моделей с тестами в R
Как я могу протестировать эффекты в ANOVA с разделенным графиком, используя подходящие сравнения моделей для использования с аргументами Xи в R? Я знаком с Далгаардом и (2007) [1]. К сожалению, это только чистит дизайн Split-Plot. Делать это в полностью рандомизированной схеме с двумя факторами внутри субъекта:Manova.mlm()?anova.mlm N <- 20 # …

2
Как узнать, какой метод оценки параметров выбрать?
Существует довольно много способов оценки параметров. MLE, UMVUE, MoM, теоретико-решение и другие - все они кажутся вполне логичными для того, почему они полезны для оценки параметров. Является ли какой-либо один метод лучше, чем другие, или это просто вопрос того, как мы определяем, что такое оценка «наилучшего соответствия» (аналогично тому, как …

2
80% пропущенных данных в одной переменной
Есть одна переменная в моих данных, 80% из которых отсутствуют. Данные отсутствуют из-за отсутствия (то есть, сколько банковского кредита компания должна). Я наткнулся на статью, в которой говорится, что метод корректировки фиктивной переменной является решением этой проблемы. То есть мне нужно преобразовать эту непрерывную переменную в категориальную? Это единственное решение? …

3
Могу ли я использовать множественную регрессию, когда у меня смешаны категориальные и непрерывные предикторы?
Похоже, вы можете использовать кодирование для одной категориальной переменной, но у меня есть две категориальные и одна непрерывная переменная предиктора. Могу ли я использовать множественную регрессию для этого в SPSS и если да, то как? Благодарность!

1
Фильтрация данных
Все еще изучая основные функции в R, Кажется, что функция подмножества фильтрует только условие на основе одного столбца с несколькими условиями или без них? Как я могу легко отфильтровать данные из кадра данных? когда вам предоставляются несколько условий Когда условие должно быть применено ко всем доступным столбцам. Пример: дан кадр …
12 r 

2
Статистический тест для положительной и отрицательной прогностической ценности
Я читал газету и увидел таблицу со сравнением между PPV (положительная прогностическая ценность) и NPV (отрицательная прогностическая ценность). Они сделали какой-то статистический тест для них, это эскиз таблицы: PPV NPV p-value 65.9 100 < 0.00001 ... Каждая строка относится к конкретной таблице непредвиденных обстоятельств. Какой тип проверки гипотезы они сделали? …

2
Akinator.com и Наивный байесовский классификатор
Контекст: я программист с некоторым (наполовину забытым) опытом в области статистики из университетских курсов. Недавно я наткнулся на http://akinator.com и провел некоторое время, пытаясь заставить его потерпеть неудачу. А кто не был? :) Я решил выяснить, как это может работать. После поиска в Google и прочтения соответствующих сообщений в блоге …

3
Понимание регрессии SVM: целевая функция и «плоскостность»
SVM для классификации имеют для меня интуитивный смысл: я понимаю, как минимизация дает максимальный запас. Однако я не понимаю эту цель в контексте регрессии. Различные тексты ( здесь и здесь ) описывают это как максимизацию «плоскостности». Зачем нам это делать? Что в регрессии эквивалентно понятию «маржа»?||θ||2||θ||2||\theta||^2 Вот несколько попыток ответов, …
12 regression  svm 

2
Как можно проверить гипотезу MCMC на регрессионной модели со смешанным эффектом со случайными наклонами?
Библиотека languageR предоставляет метод (pvals.fnc) для проверки значимости MCMC фиксированных эффектов в модели регрессии смешанного эффекта, подходящей с использованием lmer. Однако pvals.fnc выдает ошибку, когда модель lmer включает случайные наклоны. Есть ли способ сделать проверку гипотезы MCMC таких моделей? Если так, то как? (Чтобы быть принятым, ответ должен иметь проработанный …

3
Как сравнить медианную выживаемость между группами?
Я смотрю на среднюю выживаемость, используя Каплан-Мейер в разных штатах для типа рака. Между штатами довольно большие различия. Как я могу сравнить медианное выживание между всеми штатами и определить, какие из них значительно отличаются от среднего медианного выживания по всей стране?

3
Факторные оценки от дискретных, порядковых ответов
Существует ли принципиальный способ оценки показателей факторов при наличии порядковых дискретных переменных. У меня есть порядковые, дискретные, переменные. Если я сделаю предположение, что в основе каждого ответа лежит непрерывная нормально распределенная переменная, тогда я могу вычислить полихорическую корреляционную матрицу n × n . Затем я могу запустить факторный анализ этой …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.