Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Как оценить верхнюю границу для логистической регрессии только от 5 до 7 точек данных?
У меня есть данные в форме . Для оценки от до я использую формулы этой статьи: Джон Фокс - Нелинейная регрессия и нелинейные наименьшие квадраты В этой статье оценивается путем просмотра данных. Если я это сделаю, это будет работать нормально, даже если у меня всего три очка. Из этого я …

2
В чем преимущество уменьшения размерности предикторов для целей регрессии?
Каковы применения или преимущества методов регрессии с уменьшением размерности (DRR) или контролируемого уменьшения размерности (SDR) по сравнению с традиционными методами регрессии (без уменьшения размерности)? Этот класс методов находит низкоразмерное представление набора функций для задачи регрессии. Примеры таких методов включают в себя секвированную обратную регрессию, главные гессианские направления, оценку средней дисперсии …

5
Хорошие книги по добыче текста?
Привет, я хотел узнать, есть ли хорошие книги по интеллектуальному анализу и классификации текста с некоторыми примерами? Если бы не некоторые документы / журналы, доступные для общественности, подойдут. Если они иллюстрируют свои примеры с R еще лучше. Я не ищу пошаговое руководство, но что-то, что иллюстрирует плюсы и минусы различных …

1
Как зафиксировать коэффициент в порядковой логистической регрессии без предположения пропорциональных шансов в R?
Я хочу сделать порядковую логистическую регрессию в R без предположения о вероятности пропорциональности. Я знаю, что это можно сделать напрямую, используя vglm()функцию в Rнастройках parallel=FALSE. Но моя проблема в том, как исправить определенный набор коэффициентов в этой настройке регрессии? Например, допустим, что зависимая переменная является дискретной и порядковой и может …
11 r  regression  logistic 

4
Пытаетесь вычислить индекс Джини при распределении репутации StackOverflow?
Я пытаюсь вычислить индекс Джини для распределения репутации SO с помощью SO Data Explorer. Уравнение, которое я пытаюсь реализовать, таково: Где: = количество пользователей на сайте; = серийный идентификатор пользователя (1 - 1 225 000); = репутация пользователя .niyiiG(S)=1n−1(n+1−2(∑ni=1( n + 1 - i ) yяΣNя = 1Yя) )грамм(S)знак равно1N-1(N+1-2(Σязнак …
11 gini 

1
Могу ли я принять (лог) нормальность для этого образца?
Вот график QQ для моего образца (обратите внимание на логарифмическую ось Y); :n = 1000Nзнак равно1000n = 1000 Как указывает whuber, это указывает на то, что базовое распределение перекошено влево (правый хвост короче). Используя shapiro.test(на лог-преобразованных данных) в R, я получаю тестовую статистику и p-значение , что означает, что мы …

3
Симуляционное исследование: как выбрать количество итераций?
Я хотел бы сгенерировать данные с помощью «Модели 1» и сопоставить их с «Моделью 2». Основная идея состоит в том, чтобы исследовать свойства устойчивости модели 2. Меня особенно интересует коэффициент покрытия 95% доверительного интервала (на основе нормального приближения). Как установить количество итераций? Правда ли, что репликация больше, чем необходимо, может …

1
Остатки Шенфельда
В модели пропорциональных рисков Кокса со многими переменными, если остатки Шенфельда не являются плоскими для одной из переменных, делает ли это недействительной всю модель или можно игнорировать только неэффективную переменную? То есть интерпретировать коэффициенты для других переменных, но не интерпретировать результирующие коэффициенты для неэффективной переменной. Есть несколько стандартных способов работы …

1
Риджу и ЛАССО дана ковариационная структура?
Прочитав главу 3 «Элементы статистического обучения» (Hastie, Tibshrani & Friedman), я подумал, возможно ли реализовать известные методы сжатия, указанные в названии этого вопроса, с учетом ковариационной структуры, т. Е. Минимизировать (возможно, более общее). ) количество ( у⃗ - Хβ⃗ )TВ- 1(у⃗ -Хβ⃗ ) + λ f( β) , ( 1 …

2
Параметр дисперсии в выходных данных GLM
Я запустил glm в R, и в нижней части summary()вывода, он заявляет (Dispersion parameter for gaussian family taken to be 28.35031) Я покопался в Google и узнал, что параметр дисперсии используется для соответствия стандартным ошибкам. Я надеюсь, что кто-то может предоставить более подробную информацию о том, что такое параметр дисперсии …

2
Введение в прикладную вероятность для чистых математиков?
У меня есть диплом специалиста по чистой математике (теория мер, функциональный анализ, алгебра операторов и т. Д.). У меня также есть работа, требующая некоторых знаний теории вероятностей (от базовых принципов до методов машинного обучения). Мой вопрос: может ли кто-нибудь предоставить канонические материалы для чтения и справочные материалы, которые: Автономное введение …

3
Насколько оправданно выбирать
Когда я определяю свою лямбду через перекрестную проверку, все коэффициенты становятся равными нулю. Но у меня есть некоторые намеки из литературы, что некоторые из предикторов должны определенно повлиять на результат. Является ли ерундой произвольно выбирать лямбду, чтобы не было столько разреженности, сколько хочется? Я хочу выбрать 10 или около того …
11 lasso 

1
Байесовская, MDL или ML интерпретация перекрестной проверки?
Есть ли известная байесовская, ML или MDL интерпретация перекрестной проверки? Могу ли я интерпретировать перекрестную проверку как выполнение правильного обновления специально созданного ранее?

5
Доверительный интервал и вероятность - где ошибка в этом утверждении?
Если кто-то делает заявление, как показано ниже: «В целом, некурящие, подвергшиеся воздействию окружающего дыма, имели относительный риск развития ишемической болезни сердца 1,25 (95-процентный доверительный интервал, 1,17-1,32) по сравнению с некурящими, не подвергавшимися воздействию дыма». Каков относительный риск для населения в целом? Сколько вещей связано с ишемической болезнью сердца? Из огромного …

2
Как преобразовать стандартизированные коэффициенты в нестандартные коэффициенты?
Моя цель состоит в том, чтобы использовать коэффициенты, полученные в ходе предыдущих исследований по этому вопросу, для прогнозирования фактических результатов с учетом набора независимых переменных. Тем не менее, в исследовательской работе перечислены только бета-коэффициенты и t-значение. Я хотел бы знать, возможно ли преобразовать стандартизированные коэффициенты в нестандартные. Было бы полезно …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.