Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Нормализация до перекрестной проверки
Имеют ли нормализующие данные (чтобы иметь нулевое среднее значение и единичное стандартное отклонение) до выполнения повторной перекрестной проверки в k-кратном порядке какие-либо негативные последствия, такие как переоснащение? Примечание: это для ситуации, когда #cases> total #features Я преобразовываю некоторые из моих данных с помощью преобразования журнала, а затем нормализую все данные, …

3
Как бы вы объяснили обобщенные линейные модели людям без статистического фона?
Мне всегда трудно объяснить статистические методы аудитории без статистического фона. Если бы я хотел объяснить, что такое GLM для такой аудитории (не выбрасывая статистический жаргон), что было бы лучшим или наиболее эффективным способом? Я обычно объясняю GLM тремя частями - (1) случайный компонент, который является переменной отклика, (2) систематический компонент, …

2
Какой дистрибутив чаще всего используется для моделирования времени отклика сервера?
У меня есть приложение на основе сервлета, в котором я измеряю время, необходимое для выполнения каждого запроса к сервлету. Я уже вычисляю простую статистику, такую ​​как среднее и максимальное; Однако я хотел бы провести более сложный анализ, и я считаю, что мне нужно правильно смоделировать это время отклика. Конечно, я …

6
Как найти локальные пики / долины в серии данных?
Вот мой эксперимент: Я использую findPeaksфункцию в пакете quantmod : Я хочу обнаружить «локальные» пики в пределах допуска 5, то есть первые местоположения после временного ряда падают с локальных пиков на 5: aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p Выход [1] 3 22 41 Это кажется неправильным, …
16 r  time-series 

4
Что такое хорошие наборы данных для иллюстрации отдельных аспектов статистического анализа?
Я понимаю, что это субъективно, но я подумал, что было бы неплохо поговорить о наших любимых наборах данных и о том, что, по нашему мнению, делает их интересными. Существует огромное количество данных, и что со всеми API (например, Datamob ) вместе с классическими наборами данных (например, данные R ), я …
16 dataset 

2
Пуассон или квази пуассон в регрессии с данными подсчета и избыточной дисперсией?
У меня есть данные подсчета (анализ спроса / предложения с подсчетом количества клиентов, в зависимости от - возможно - многих факторов). Я пробовал линейную регрессию с нормальными ошибками, но мой QQ-график не очень хорош. Я попробовал лог-преобразование ответа: еще раз плохой QQ-сюжет. Итак, сейчас я пытаюсь регрессии с пуассоновскими ошибками. …

1
Необходимость центрирования и стандартизации данных в регрессии
Рассмотрим линейную регрессию с некоторой регуляризацией: например, найдите который минимизируетxИксx||Ax−b||2+λ||x||1||Ax−b||2+λ||x||1||Ax - b||^2+\lambda||x||_1 Обычно столбцы A стандартизированы, чтобы иметь нулевое среднее и единичную норму, тогда как центрируется, чтобы иметь нулевое среднее. Я хочу убедиться в правильности моего понимания причины стандартизации и центрирования.bbb Обнуляя значения столбцов и , мы больше не нуждаемся …

6
Скорость вычислений в R?
Мне было поручено перевести одну из наших текущих больших стохастических моделей из SAS на новый язык. Лично я предпочитаю традиционный скомпилированный язык, но PI хочет, чтобы я проверил R, который я никогда не использовал. Наша мотивация для выведения модели из SAS заключается в том, что (1) многие люди не имеют …
16 r  computing 

2
Почему проекционная матрица ортогональной проекции симметрична?
Я новичок в этом, поэтому я надеюсь, что вы простите меня, если вопрос наивный. (Контекст: я изучаю эконометрику из книги Дэвидсона и Маккиннона "Эконометрическая теория и методы" , и они, кажется, не объясняют этого; я также посмотрел книгу по оптимизации Люенбергера, которая рассматривает проекции на более продвинутом уровне, но без …

4
Классическая линейная модель - выбор модели
У меня классическая линейная модель, с 5 возможными регрессорами. Они не связаны друг с другом и имеют довольно низкую корреляцию с ответом. Я пришел к модели, в которой 3 регрессора имеют значимые коэффициенты для своей t-статистики (р <0,05). Добавление одной или обеих оставшихся 2 переменных дает значения p> 0,05 для …

1
Как вычислить полосы предсказания для нелинейной регрессии?
Страница справки для Prism дает следующее объяснение того, как она вычисляет полосы предсказания для нелинейной регрессии. Пожалуйста, извините за длинную цитату, но я не следую второму абзацу (который объясняет, как определяется и вычисляется d Y / d P ). Любая помощь будет принята с благодарностью.G | Иксграмм|ИксG|xdY/ дпdY/dпdY/dP Расчет доверительных …

4
Интерпретация exp (B) в полиномиальной логистической регрессии
Это вопрос новичка, но как интерпретировать результат exp (B), равный 6.012, в модели полиномиальной логистической регрессии? 1) 6,012-1,0 = 5,012 = 5012% увеличения риска? или 2) 6.012 / (1 + 6.012) = 0,857 = 85,7% увеличение риска? В случае, если обе альтернативы неверны, кто-то может указать правильный путь? Я искал …

1
Когда использовать взвешенное евклидово расстояние и как определить вес для использования?
У меня есть набор данных, где каждый данные состоят из NNn различных мер. Для каждого показателя у меня есть эталонное значение. Я хотел бы знать, насколько близки все данные к эталонному значению. Я подумал об использовании взвешенного евклидова расстояния следующим образом: dх , б= ( ∑Nя = 1веся( хя- бя)2) …

3
Как лучше всего отображать графически ошибку типа II (бета), мощность и размер выборки?
Меня просят написать введение в статистику, и я изо всех сил пытаюсь графически показать, как p-значение и мощность связаны между собой. Я придумал этот график: Мой вопрос: есть ли лучший способ показать это? Вот мой код R x <- seq(-4, 4, length=1000) hx <- dnorm(x, mean=0, sd=1) plot(x, hx, type="n", …
16 r  teaching  power 

2
Анализ точек изменения с помощью R's nls ()
Я пытаюсь реализовать анализ "точки изменения" или многофазную регрессию с использованием nls()R. Вот некоторые фальшивые данные, которые я сделал . Формула, которую я хочу использовать, чтобы соответствовать данным: Y= β0+ β1х + β2Максимум ( 0 , x - δ)Yзнак равноβ0+β1Икс+β2Максимум(0,Икс-δ)y = \beta_0 + \beta_1x + \beta_2\max(0,x-\delta) Предполагается, что это должно …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.