Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Ограниченные машины Больцмана против многослойных нейронных сетей
Я давно хотел поэкспериментировать с нейронной сетью для решения проблемы классификации, с которой я столкнулся. Я столкнулся с бумагами, которые говорят о УКР. Но из того, что я могу понять, они ничем не отличаются от наличия многослойной нейронной сети. Это точно? Более того, я работаю с R и не вижу …

2
Регрессия для модели формы
У меня есть набор данных, который является статистикой с форума веб-обсуждения. Я смотрю на распределение количества ответов, которые должна иметь тема. В частности, я создал набор данных, в котором есть список ответов на темы, а затем - количество тем с таким количеством ответов. "num_replies","count" 0,627568 1,156371 2,151670 3,79094 4,59473 5,39895 …

2
Коррекция смещения во взвешенной дисперсии
Для невзвешенной дисперсии существует дисперсия выборки с поправкой на смещение, когда среднее значение было оценено по тем же данным: Var(X):=1Вар ( Х) : = 1NΣя( хя- μ )2Var(Икс)знак равно1NΣя(Икся-μ)2\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2Вар ( Х) : = 1n - 1Σя( хя- E[ X] )2Var(Икс)знак равно1N-1Σя(Икся-Е[Икс])2\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Я смотрю на средневзвешенную и …

3
Контролируемая кластеризация или классификация?
Второй вопрос заключается в том, что я обнаружил, что где-то в сети обсуждалась «контролируемая кластеризация», насколько я знаю, кластеризация не контролируется, так что именно означает «контролируемая кластеризация»? В чем разница с «классификацией»? Об этом много ссылок: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervised_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf http://www.cs.cornell.edu/~tomf/publications/supervised_kmeans-08.pdf http://jmlr.csail.mit.edu/papers/volume6/daume05a/daume05a.pdf так далее ...

4
Ожидаемое значение натурального логарифма
Я знаю, что с константами , поэтому, учитывая , это легко решить. Я также знаю, что вы не можете применить это, когда это нелинейная функция, как в этом случае , и чтобы решить это, я должен сделать приближение с Тейлором. Так что мой вопрос, как мне решить ?? мне тоже …

3
Безопасное определение размера образца для A / B-тестирования
Я - инженер-программист, желающий создать инструмент A / B-тестирования . У меня нет основательной статистики, но за последние несколько дней я немного читал. Я следую методологии, описанной здесь, и суммирую соответствующие пункты ниже. Этот инструмент позволит дизайнерам и экспертам по доменам настраивать веб-сайт для разделения трафика, получаемого по определенному URL-адресу, …

5
Когда квантильная регрессия хуже, чем OLS?
Помимо некоторых уникальных обстоятельств, когда мы абсолютно должны понимать условные средние отношения, в каких ситуациях исследователь должен выбрать OLS вместо квантильной регрессии? Я не хочу, чтобы ответ был «если нет смысла в понимании отношений хвоста», так как мы могли бы просто использовать медианную регрессию в качестве замены OLS.

3
Регрессионное моделирование с неравной дисперсией
Я хотел бы соответствовать линейной модели (лм), где дисперсия остатков явно зависит от объясняющей переменной. Я знаю, как это сделать, используя glm с семейством Gamma для моделирования дисперсии, а затем поместив ее обратно в веса в функции lm (пример: http://nitro.biosci.arizona.edu/r/chapter31 .pdf ) Я размышлял: Это единственная техника? Какие еще подходы …

1
Являются ли противоречивые оценки когда-либо предпочтительными?
Согласованность, безусловно, является естественной и важной оценкой свойств, но существуют ли ситуации, когда может быть лучше использовать противоречивую оценку, а не последовательную? Более конкретно, есть ли примеры противоречивой оценки, которая превосходит разумную непротиворечивую оценку для всех конечных (относительно некоторой подходящей функции потерь)?nnn

4
Что сказать клиенту, который считает, что доверительные интервалы слишком широки, чтобы быть полезными?
Предположим, я консультант и хочу объяснить своему клиенту полезность доверительного интервала. Клиент говорит мне, что мои интервалы слишком широки, чтобы быть полезными, и он предпочел бы использовать их вдвое меньше. Как мне ответить?

4
Как написать формулу линейной модели со 100 переменными в R
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Есть ли простой способ в R создать линейную регрессию по модели с 100 параметрами в R? Допустим, у нас есть вектор Y …
22 r 

3
Стабильность модели при решении большой проблемы , small
Вступление: У меня есть набор данных с классической «большой p, маленький n проблема». Количество доступных выборок n = 150, а количество возможных предикторов p = 400. Результат - непрерывная переменная. Я хочу найти самые «важные» дескрипторы, то есть те, которые являются лучшими кандидатами для объяснения результата и помощи в построении …

1
Как вычислить доверительные интервалы параметров в R с учетом матрицы гессена в R с учетом вывода Optim.
Учитывая вывод от optim с гессианской матрицей, как рассчитать доверительные интервалы параметров, используя гессенскую матрицу? fit<-optim(..., hessian=T) hessian<-fit$hessian Я в основном заинтересован в контексте анализа максимального правдоподобия, но мне любопытно узнать, можно ли расширить этот метод за пределы.


2
Как мне разместить набор данных для распределения Парето в R?
Имеем, скажем, следующие данные: 8232302 684531 116857 89724 82267 75988 63871 23718 1696 436 439 248 235 Хотите простой способ приспособить этот (и несколько других наборов данных) к распределению Парето. В идеале это будет выводить совпадающие теоретические значения, а в идеале - параметры.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.