Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

5
Среднее значение выбранного штампа из бесконечной серии бросков
Если я кидаю пару кубиков бесконечное количество раз и всегда выбираю более высокое значение из двух, будет ли ожидаемое среднее из самых высоких значений превышать 3,5? Казалось бы, так и должно быть, потому что если бы я бросил миллион костей и выбрал самое высокое значение каждый раз, шансы были бы …
13 dice 

1
Объясните, как `eigen` помогает инвертировать матрицу
Мой вопрос относится к вычислительной технике, используемой в geoR:::.negloglik.GRFили geoR:::solve.geoR. В линейной смешанной модели: Y=Xβ+Zb+eY=Xβ+Zb+e Y=X\beta+Zb+e где ββ\beta и bbb - фиксированные и случайные эффекты соответственно. Также Σ=cov(Y)Σ=cov(Y)\Sigma=\text{cov}(Y) При оценке последствий, необходимо , чтобы вычислить , которые обычно можно сделать , используя что - то вроде , но иногда ( …

3
Линейная регрессия: есть ли ненормальное распределение, дающее идентичность OLS и MLE?
Этот вопрос вдохновлен долгим обсуждением в комментариях здесь: Как линейная регрессия использует нормальное распределение? В обычной модели линейной регрессии для простоты здесь написано только с одним предиктором: Yi=β0+β1xi+ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i где xixix_i - известные константы, а ϵiϵi\epsilon_i - члены с независимой ошибкой с нулевым …

3
Определение и разграничение регрессионной модели
Смущающий простой вопрос - но, кажется, его не задавали на Cross Validated раньше: Каково определение модели регрессии? Также вопрос поддержки, Чем не модель регрессии? Что касается последнего, меня интересуют хитрые примеры, где ответ не сразу очевиден, например, ARIMA или GARCH.

7
Правильно ли называть результаты «почти» или «несколько» значительными?
Общий консенсус по аналогичному вопросу. Неправильно ли называть результаты «очень значимыми»? заключается в том, что «очень значительный» является допустимым, хотя и неспецифическим, способом описания силы ассоциации, у которой значение p намного ниже предварительно установленного порога значимости. Однако как насчет описания p-значений, которые немного выше вашего порога? Я видел, что в …

1
Что это за диаграмма?
Извините за неопределенный вопрос, но эта диаграмма появляется в Biddle et al. 2009 и я не сталкивался с чем-либо подобным. Это гистограмма со скошенными краями, иногда «рогами». Что это значит? У этого типа диаграммы есть имя? По /meta/244083/site-for-asking-about-charts я думал, что Academia - лучшее место, чтобы спросить.

3
центрирование и масштабирование фиктивных переменных
У меня есть набор данных, который содержит как категориальные переменные, так и непрерывные переменные. Мне посоветовали преобразовать категориальные переменные как двоичные переменные для каждого уровня (т. Е. A_level1: {0,1}, A_level2: {0,1}) - я думаю, некоторые назвали это «фиктивными переменными». С учетом вышесказанного, будет ли вводить в заблуждение центрирование и масштабирование …

1
Контролируемое уменьшение размерности
У меня есть набор данных, состоящий из 15K помеченных образцов (из 10 групп). Я хочу применить уменьшение размерности к двум измерениям, которые бы учитывали знание меток. Когда я использую «стандартные» неконтролируемые методы уменьшения размерности, такие как PCA, график рассеяния, кажется, не имеет ничего общего с известными метками. У того, что …

1
Что такое «повернутые» и «не повернутые» главные компоненты, учитывая, что PCA всегда вращает оси координат?
Насколько я понимаю, главные компоненты получаются вращением осей координат, чтобы выровнять их по направлениям максимальной дисперсии. Тем не менее, я продолжаю читать о «непроверенных главных компонентах», и мое программное обеспечение для статистики (SAS) дает мне не только повернутые, но и основные компоненты, повернутые с помощью варимакса. Здесь я запутался: когда …

3
Как именно сверточные нейронные сети используют свертку вместо умножения матриц?
Я читал Книгу Йошуа Бенжио по глубокому обучению, и на странице 224 написано: Сверточные сети - это просто нейронные сети, которые используют свертку вместо общего умножения матриц, по крайней мере, на одном из их уровней. однако я не был уверен на 100% в том, как «заменить умножение матриц сверткой» в …

1
Как тренировать LSTM слой глубокой сети
Я использую lstm и сеть прямой связи для классификации текста. Я преобразую текст в горячие векторы и подаю каждый в lstm, чтобы суммировать его как единое представление. Затем я передаю его в другую сеть. Но как мне тренировать LSTM? Я просто хочу последовательно классифицировать текст - я должен кормить его …

5
Как я могу преобразовать расстояние (евклидово) в показатель сходства
Я использую kkk означает кластеризацию для кластеризации голосов ораторов. Когда я сравниваю высказывание с данными кластерного динамика, я получаю (евклидово основанное на расстоянии) среднее искажение. Это расстояние может быть в диапазоне [0,∞][0,∞][0,\infty] . Я хочу преобразовать это расстояние в [0,1][0,1][0,1] сходство. Пожалуйста, объясните мне, как я могу этого достичь.

1
Что такое частичная F-статистика?
Что такое частичная F-статистика? Это то же самое, что частичный F-тест? Когда бы вы рассчитали частичную F-статистику? Я предполагаю, что это как-то связано со сравнением регрессионных моделей, но я не следую чему-то (?)

1
Отличается ли подгонка модели Кокса со стратами и стратово-ковариатным взаимодействием от подгонки двух моделей Кокса?
В « Стратегиях регрессионного моделирования » Харрелла (второе издание) есть раздел (S. 20.1.7), в котором обсуждаются модели Кокса, включая взаимодействие между ковариатой, основное влияние которой на выживаемость мы также хотим оценить (возраст в примере ниже) и ковариация, основной эффект которой мы не хотим оценивать (пол в примере ниже). Конкретно: предположим, …

1
Что такое долгосрочная дисперсия?
Как определяется долгосрочная дисперсия в области анализа временных рядов? Я понимаю, что это используется в том случае, если в данных есть корреляционная структура. Таким образом, наш стохастический процесс не будет семейством случайными переменными, а будет только идентично распределенным?X1,X2…X1,X2…X_1, X_2 \dots Могу ли я иметь стандартную ссылку в качестве введения в …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.