Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Работает ли модульность сети Ньюмана для взвешенных графов со знаком?
Модульность графа определяется на его странице в Википедии . В другом посте кто-то объяснил, что модульность можно легко вычислить (и максимизировать) для взвешенных сетей, поскольку матрица смежности может содержать оцененные связи. Тем не менее, я хотел бы знать, будет ли это работать со знаковыми, значимыми ребрами, например, от -10 до …

1
Разъяснение максимизации ожидания
Я нашел очень полезное руководство по алгоритму EM . Пример и картинка из урока просто великолепны. Связанный вопрос о вычислении вероятностей, как работает максимизация ожидания? У меня есть еще один вопрос относительно того, как связать теорию, описанную в руководстве, с примером. На этапе E EM выбирает функцию которая нижние границы …

1
Что мне делать, если значения AIC низкие и приблизительно равны?
Крис Чатфилд, чьи многочисленные качественные книги и газеты мне нравилось читать, в (1) дает следующий совет: Например, вероятно, следует сделать выбор между моделями временных рядов ARIMA с низкими и приблизительно равными значениями AIC, причем не в тех случаях, когда получается минимальный AIC, а в отношении тех, которые дают наилучшие прогнозы …

4
Как исправить один коэффициент и подогнать другие, используя регрессию
Я хотел бы вручную зафиксировать определенный коэффициент, скажем, , затем подогнать коэффициенты ко всем остальным предикторам, сохраняя при этом β 1 = 1,0 в модели.β1=1.0β1=1.0\beta_1=1.0β1=1.0β1=1.0\beta_1=1.0 Как я могу добиться этого с помощью R? Я бы особенно хотел поработать с LASSO ( glmnet), если это возможно. В качестве альтернативы, как я …

2
Объяснение обобщенного метода моментов не статистику
Как мне объяснить обобщенные методы моментов и как это используется для не статистики? Пока что я пойду с этим: это то, что мы используем для оценки таких условий, как средние значения и вариации на основе собранных нами выборок. Как объяснить ту часть, где вы оцениваете вектор параметров, путем минимизации дисперсии?

2
Что это означает, когда все ребра в реальной сети / графике статистически так же вероятны случайно?
Я использовал метод извлечения магистральной сети, описанный в этой статье: http://www.pnas.org/content/106/16/6483.abstract По сути, авторы предлагают метод, основанный на статистике, который дает вероятность для каждого ребра в графе, что ребро могло произойти случайно. Я использую типичное статистическое значение отсечения 0,05. Я применял этот метод к нескольким реальным сетям, и, что интересно, …

1
Как рассчитать среднее и стандартное отклонение для логнормального распределения, используя 2 процентили
Я пытаюсь вычислить среднее и стандартное отклонение от 2 процентилей для логнормального распределения. Я был успешным в выполнении расчета для нормального распределения с использованием X = mean + sd * Zи решения для среднего и сд. Я думаю, что мне не хватает уравнения, когда я пытаюсь сделать то же самое …
11 r  lognormal 

2
Почему использование данных поперечного сечения для вывода / прогнозирования продольных изменений - это плохо?
Я ищу бумагу, которая, я надеюсь, существует, но не знаю, есть ли она. Это может быть набор тематических исследований и / или аргумент из теории вероятностей о том, почему использование данных поперечного сечения для выведения / прогнозирования продольных изменений может быть плохой вещью (т.е. это не обязательно так, но может …

7
Как бы вы объяснили статистическую значимость людям без статистического фона?
Справочная информация: мне пришлось провести анализ данных для клиента (своего рода юриста), который был абсолютным новичком в статистике. Он спросил меня, что означает термин «статистическая значимость», и я действительно попытался объяснить это… но так как я не очень хорош в объяснении вещей, я потерпел неудачу;)

2
Распределение суммы квадратов Т-распределенных случайных величин
Я смотрю на распределение суммы квадратов Т-распределенных случайных величин с показателем хвоста . Где X - это rv, преобразование Фурье для , дает мне решение для квадрата до свертки . αα\alphaX2X2X^2F(t)F(t)\mathscr{F}(t)F(t)nF(t)n\mathscr{F}(t)^nF(t)=∫∞0exp(itx2)⎛⎝⎜⎜⎜(αα+x2)α+12α−−√ B(α2,12)⎞⎠⎟⎟⎟dxF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha }{\alpha +x^2}\right)^{\frac{\alpha +1}{2}} }{\sqrt{\alpha }\ B\left(\frac{\alpha }{2},\frac{1}{2}\right)}\right) \, \mathrm{d}x При решение возможно, …

4
Логистическая регрессия и точка перегиба
У нас есть данные с двоичным результатом и некоторыми ковариатами. Я использовал логистическую регрессию для моделирования данных. Просто простой анализ, ничего необычного. Предполагается, что конечным результатом будет кривая доза-эффект, где мы показываем, как изменяется вероятность для конкретного ковариата. Что-то вроде этого: Мы получили некоторую критику от внутреннего рецензента (не чисто …

1
Какова интуиция в изменении метрики информации (VI) для проверки кластера?
Для таких статистиков, как я, очень трудно уловить идею VIметрики (вариации информации) даже после прочтения соответствующей статьи Марины Мелиа « Сравнение кластеризаций - расстояние, основанное на информации » (Journal of Multivariate Analysis, 2007). На самом деле, я не знаком со многими терминами кластеризации. Ниже приведен MWE, и я хотел бы …

2
Оценка дисперсии центрально-цензурированных нормальных образцов
Я нормально распределенные процессы , из которых я получаю небольшие образцы ( п , как правило , 10-30) , что я хочу использовать для оценки дисперсии. Но часто образцы находятся настолько близко друг к другу, что мы не можем измерить отдельные точки вблизи центра. У меня есть смутное понимание того, …

1
Почему диагностика основана на остатках?
В простой линейной регрессии часто требуется проверить, выполнены ли определенные допущения, чтобы можно было сделать вывод (например, остатки обычно распределяются). Целесообразно ли проверять допущения, проверяя, нормально ли распределены установленные значения?

2
Обобщенные линейные смешанные модели: диагностика
У меня случайная перехват логистической регрессии (из-за многократных измерений), и я хотел бы провести некоторую диагностику, особенно в отношении выбросов и влиятельных наблюдений. Я посмотрел на остатки, чтобы увидеть, есть ли наблюдения, которые выделяются. Но я также хотел бы взглянуть на что-то вроде расстояния Кука или DFFITS. Хосмер и Лемешоу …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.