Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Два года данных, описывающих возникновение ассоциации тестирования насилия с количеством пациентов в палате
У меня есть данные за два года, которые выглядят примерно так: Дата _ __ Насилие Y / N? _ Количество пациентов 01.01.2008 _ ___ 0 __ _ __ _ ____ 11 01.02.2008 _ __ _ 0 _ __ _ __ _ __ 11 01.03.2008 _ ____ 1 __ _ __ …

3
Аппроксимация для дискретного распределения
Каков наилучший способ аппроксимировать для двух заданных целых чисел когда вы знаете среднее , дисперсию , асимметрию и избыточный эксцесс дискретного распределения и из (ненулевых) мер формы и что нормальное приближение не подходит?Pr[n≤X≤m]Pr[n≤X≤m]Pr[n \leq X \leq m]m,nm,nm,nμμ\muσ2σ2\sigma^2γ1γ1\gamma_1γ2γ2\gamma_2XXXγ1γ1\gamma_1γ2γ2\gamma_2 Обычно я использовал бы нормальное приближение с целочисленной коррекцией ... Pr[(n−½)≤X≤(m+½)]=Pr[(n−½)−μσ≤Z≤(m+½)−μσ]=Φ((m+½)−μσ)−Φ((n−½)−μσ)Pr[(n−½)≤X≤(m+½)]=Pr[(n−½)−μσ≤Z≤(m+½)−μσ]=Φ((m+½)−μσ)−Φ((n−½)−μσ)Pr[(n - \text{½})\leq …

3
Нахождение средней точки GPS
Мне нужно написать программу, чтобы найти среднюю точку GPS из совокупности точек. На практике происходит следующее: Каждый месяц человек записывает точку GPS одного и того же статического актива. Из-за особенностей GPS эти точки немного отличаются каждый месяц. Иногда человек делает ошибку, записывая неправильную сборку в совершенно другом месте. Каждая точка …
11 outliers  spatial 

6
Библиотека статистики с ограничением ранца
Предположим, у вас было 200 долларов на создание (очень) небольшой библиотеки статистических книг. Каким будет ваш выбор? Вы можете принять на себя бесплатную доставку от Amazon, и любые свободно доступные тексты из Интернета являются честной игрой, но при этом для печати требуется плата в 5 центов за страницу. (Я был …

3
Как заказать или оценить набор экспертов?
У меня есть база данных, содержащая большое количество экспертов в этой области. Для каждого из этих экспертов у меня есть множество атрибутов / точек данных, таких как: количество лет опыта. лицензии количество отзывов текстовое содержание этих обзоров 5-звездочный рейтинг в каждом из этих обзоров по ряду факторов, таких как скорость, …
11 rating  valuation 

6
Какая ваша любимая проблема для введения в вероятность?
Мне нравится представлять вероятность, обсуждая парадокс « Мальчик или девочка» или « Бертран» . Какая другая (короткая) проблема / игра обеспечивает мотивирующее введение в вероятность? ( Один ответ за ответ, пожалуйста ) PS Это о мягком введении в вероятность, но, на мой взгляд, это актуально для преподавания статистики, так как …
11 teaching 

3
Как определить, какое исследование лучше, если они дают противоречивые результаты?
Вы так часто сталкиваетесь в прессе с различными исследованиями, которые дают направленно противоположные результаты. Они могут быть связаны с тестированием нового отпускаемого по рецепту лекарства или заслугой конкретного питательного вещества или чего-либо еще в этом отношении. Когда два таких исследования приводят к противоречивым результатам, как вы можете определить, какое из …

4
Расчет размера выборки для одномерной логистической регрессии
Как рассчитать размер выборки, необходимый для исследования, в котором когорта субъектов будет иметь одну непрерывную переменную, измеренную во время операции, а затем через два года они будут классифицированы как функциональный результат или результат с нарушением. Мы хотели бы посмотреть, могло ли это измерение предсказать плохой результат. В какой-то момент мы …

1
В чем разница между summary () и loadings () для объекта princomp () в R?
Пример кода: (pc.cr <- princomp(USArrests)) summary(pc.cr) loadings(pc.cr) ## note that blank entries are small but not zero Я получаю разные результаты от каждого, и я не уверен, что понимаю, в чем разница. Вот вывод: > summary(pc.cr) Importance of components: Comp.1 Comp.2 Comp.3 Comp.4 Standard deviation 82.8908472 14.06956001 6.424204055 2.4578367034 Proportion …
11 r  pca 

4
Хороший текст о клинических испытаниях?
Я студентка, изучающая статистику, в поисках хорошего метода анализа клинических испытаний. Текст должен охватывать основы экспериментального проектирования, блокирования, анализа мощности, дизайна латинских квадратов и дизайна рандомизации кластеров, среди других тем. У меня есть базовые знания математической статистики и реального анализа, но если есть фантастический текст, требующий немного более высокого уровня …

3
Что такое проверка согласованности?
Мне был задан такой вопрос, как «Проводили ли вы проверку согласованности в своей повседневной работе?» во время телефонного интервью на должность биостатиста. Я не знаю что ответить. Любая информация приветствуется.
11 validation 

3
Являются ли эти формулы для преобразования P, LSD, MSD, HSD, CI в SE точной или завышенной / консервативной оценкой ?
Фон Я провожу метаанализ, который включает ранее опубликованные данные. Часто о различиях между обработками сообщают с помощью значений Р, наименее значимых различий (ЛСД) и других статистических данных, но они не дают прямой оценки дисперсии. В контексте модели, которую я использую, переоценка дисперсии в порядке. проблема Вот список преобразований в где …

3
Преобразование, чтобы изменить перекос, не влияя на эксцесс?
Мне любопытно, есть ли преобразование, которое изменяет перекос случайной величины, не влияя на эксцесс. Это было бы аналогично тому, как аффинное преобразование RV влияет на среднее значение и дисперсию, но не на перекос и эксцесс (отчасти потому, что перекос и эксцесс определяется как инвариантный к изменениям масштаба). Это известная проблема?

2
Быстро оценить (визуально) корреляции между упорядоченными категориальными данными в R?
Я ищу корреляции между ответами на разные вопросы в опросе («хмм, давайте посмотрим, соотносятся ли ответы на вопрос 11 с ответами на вопрос 78»). Все ответы являются категоричными (большинство из них варьируются от «очень несчастных» до «очень счастливых»), но у некоторых есть другой набор ответов. Большинство из них можно считать …

3
Оценка среднего и st dev усеченной гауссовой кривой без пика
Предположим, у меня есть черный ящик, который генерирует данные после нормального распределения со средним m и стандартным отклонением s. Предположим, однако, что всякий раз, когда он выводит значение <0, он ничего не записывает (даже не может сказать, что он вывел такое значение). У нас есть усеченное гауссовское распределение без скачка. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.