Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

8
Что делает статистика?
Когда я говорю своим нестатистическим друзьям, что я аспирант, преследующий докторскую степень в области статистики, они, естественно, говорят: «О, так вы хотите стать профессором?». Я говорю им, нет, я на самом деле планирую работать в промышленности. Затем они отвечают «и что делать?». Я не нашел хорошего ответа на этот вопрос. …
12 careers 

3
Как рассчитать ожидание ?
Если экспоненциально распределен (i = 1, ..., n) с параметром \ lambda, а X_i взаимно независимы, каково ожидание ( я = 1 , . . . , П ) λ Х яXiXiX_i(i=1,...,n)(i=1,...,n)(i=1,...,n)λλ\lambdaXiXiX_i (∑i=1nXi)2(∑i=1nXi)2 \left(\sum_{i=1}^n {X_i} \right)^2 с точки зрения nnn и λλ\lambda и, возможно, других констант? Примечание. Этот вопрос получил …

3
Как использовать статистику CDF и PDF для анализа
Это может быть слишком много общего вопроса, но я надеюсь, что я могу найти помощь здесь. Я начинаю работу в RA в моем университете, и моя тема будет связана с анализом интернет-трафика. Я довольно новичок в мире анализа, но я предполагаю, что в мире исследований это то, что я должен …


5
Лучшая классификация дефолта в логистической регрессии
Полное раскрытие: это домашнее задание. Я включил ссылку на набор данных ( http://www.bertelsen.ca/R/logistic-regression.sav ) Моя цель - максимально повысить прогноз неплательщиков кредитов в этом наборе данных. Каждая модель, которую я придумала до сих пор, предсказывает> 90% неплательщиков, но <40% неплательщиков, в целом эффективность классификации составляет ~ 80%. Итак, мне интересно, …
12 r  logistic  spss  self-study 

1
Обновление лассо соответствует новым наблюдениям
Я подгоняю L1-регуляризованную линейную регрессию к очень большому набору данных (с n >> p.). Переменные известны заранее, но наблюдения приходят небольшими порциями. Я хотел бы поддерживать форму лассо после каждого куска. Я, очевидно, могу заново подогнать всю модель после просмотра каждого нового набора наблюдений. Это, однако, было бы довольно неэффективно, …
12 regression  lasso 

3
Проверка анкет
Я разрабатываю анкету для своей диссертации. Я нахожусь в процессе проверки анкеты. Я применил альфа-тест Кронбаха к исходной выборочной группе. Ответы на вопросник в масштабе Лайкерта; Может ли кто-нибудь предложить какие-либо дополнительные тесты, чтобы применить, чтобы помочь проверить его действительность. Я не специалист по статистике, поэтому любая помощь будет оценена. …

2
Анализ предметов для новичка R
Я пытаюсь оценить 20-элементный тест на выбор нескольких множителей. Я хочу выполнить анализ элемента, который можно найти в этом примере . Поэтому для каждого вопроса я хочу получить P-значение и корреляцию с итогом, а также распределение выбранных опций. Я ничего не знаю о различных статистических программных пакетах, но я бы …

2
Как параметризовать отношение двух нормально распределенных переменных или обратное к одной?
Проблема: я параметризирую распределения для использования в качестве априоров и данных в байесовском метаанализе. Данные представлены в литературе как сводная статистика, почти исключительно предполагаемая нормально распределенной (хотя ни одна из переменных не может быть <0, некоторые являются отношениями, некоторые являются массовыми и т. Д.). Я столкнулся с двумя случаями, для …

3
Адаптивные оценки плотности ядра?
Кто-нибудь может сообщить о своем опыте с адаптивной оценкой плотности ядра? (Существует много синонимов: адаптивный | переменная | переменная-ширина, KDE | гистограмма | интерполятор ...) Переменная оценка плотности ядра говорит: «мы меняем ширину ядра в разных областях выборочного пространства. Есть два метода ...» на самом деле, больше: соседи в пределах …

4
Как применить метод итеративно переоцененных наименьших квадратов (IRLS) к модели LASSO?
Я запрограммировал логистическую регрессию, используя алгоритм IRLS . Я хотел бы применить штраф LASSO для автоматического выбора правильных функций. На каждой итерации решается следующее: (XTWX)δβ^=XT(y−p)(XTWX)δβ^=XT(y−p)\mathbf{\left(X^TWX\right) \delta\hat\beta=X^T\left(y-p\right)} Пусть λλ\lambda - неотрицательное действительное число. Я не наказываю перехват как предложено в Элементах. Статистическое обучение . То же самое для уже нулевых коэффициентов. …

2
Параметрический расчет размера выборки и непараметрический анализ
Мне любопытно узнать, есть ли у кого-нибудь конкретная ссылка (текстовая или журнальная статья), чтобы поддержать общепринятую в медицинской литературе практику расчета размера выборки с использованием параметрических методов (т. Е. Предполагающих нормальное распределение и определенную дисперсию измерений) когда анализ результатов первичного испытания будет сделан с использованием непараметрических методов. Пример: первичным результатом …

5
Стандартный справочник по классической математической статистике?
Кто-нибудь может порекомендовать некоторые книги, которые считаются стандартными справочниками для классической (частой) статистики? IE, довольно всеобъемлющий, а также, был некоторое время, чтобы опечатки и ошибки в формулах имели возможность быть проверены и исправлены


3
Можете ли вы объяснить, почему статистическая связь не отклоняется наивно, когда
Мне нужна помощь в объяснении и цитировании базовых статистических текстов, статей или других ссылок, почему, как правило, неправильно использовать статистику предела ошибки (MOE), сообщаемую при опросе, для наивного объявления статистической связи. Пример: Кандидат А возглавляет Кандидат B в опросе, %, 4,5 % с погрешностью для 500 опрошенных избирателей.39 - 3139−3139 …
12 polling 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.