Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Использование срединного лака для выбора характеристик
В статье, которую я недавно читал, я обнаружил в своем разделе анализа данных следующее: Затем таблица данных была разбита на ткани и клеточные линии, и две подтаблицы были отдельно отшлифованы по медиане (строки и столбцы были итеративно скорректированы, чтобы иметь медиану 0), прежде чем они были объединены в одну таблицу. …

1
Измерение корреляции обученных нейронных сетей
Я тренирую искусственную нейронную сеть (обратное распространение, прямая связь) с ненормальными распределенными данными. Наряду с среднеквадратичной ошибкой в ​​литературе часто предлагается коэффициент корреляции Пирсона для оценки качества обученной сети. Но разумен ли коэффициент корреляции Пирсона, если данные обучения обычно не распространяются? Разве не разумнее использовать меру корреляции на основе рангов, …

1
R реализация коэффициента частичного определения
У кого-нибудь есть предложения или пакеты, которые рассчитают коэффициент частичного определения? Коэффициент частичного определения может быть определен как процент вариации, который не может быть объяснен в сокращенной модели, но может быть объяснен предикторами, указанными в полной (эр) модели. Этот коэффициент используется для того, чтобы понять, могут ли один или несколько …
9 r  regression  anova 

1
Могу ли я оценить частоту события на основе случайных выборок его возникновения?
Некоторые изменения сделаны ... Этот вопрос просто для развлечения, поэтому, если он не веселый, пожалуйста, не стесняйтесь его игнорировать. Я уже получаю большую помощь от этого сайта, поэтому я не хочу кусать руку, которая меня кормит. Это основано на примере из реальной жизни, и это то, о чем я много …

1
Эффект границы в вейвлет-анализе с множественным разрешением
Каковы методы минимизации влияния границ при вейвлет-разложении? Я использую R и пакет waveslim . Я нашел, например, функцию ?brick.wall но Я не слишком использую, как использовать это. Я не уверен, что лучшим решением будет удалить какой-то коэффициент. Я где-то читал, что существуют некоторые вейвлеты, которые не везде одинаковы, и их …

4
Как искать статистическую процедуру в R?
Есть ли пакет R, веб-сайт или команда, которая позволит искать конкретную статистическую процедуру, которую они хотят? Например, если я хочу найти пакет с преобразованием Бокса-Кокса, веб-сайт / пакет / команда может вернуть «MASS» и отослать меня к boxcox()функции. Это довольно просто с чем-то вроде Box-Cox, но я надеялся, что это …
9 r 

2
Правильно ли я указываю свою модель lmer?
Я искал Google и этот сайт, и я все еще не понимаю функцию lmer в библиотеке lme4. У меня есть некоторые данные, собранные в разных психиатрических отделениях, которые имеют многоуровневую структуру. Для упрощения я выберу две переменные уровня 2 и две переменные уровня 1, хотя на самом деле у меня …

2
Начало работы с бикластером
Я проводил некоторые случайные интернет-исследования бикластеров. (Я читал статью в вики несколько раз.) Пока что кажется, что существует несколько определений или стандартной терминологии. Мне было интересно, есть ли какие-нибудь стандартные документы или книги, которые должен прочитать любой, кто интересуется алгоритмами поиска бикластеров. Можно ли сказать, каков уровень техники в этой …

1
Использование разложения по сингулярным значениям для вычисления ковариационной матрицы дисперсии из модели линейной регрессии
У меня есть матрица расчета p-регрессоров, n наблюдений, и я пытаюсь вычислить выборочную матрицу дисперсии-ковариации параметров. Я пытаюсь напрямую рассчитать его с помощью SVD. Я использую R, когда я беру svd матрицы проектирования, я получаю три компонента: матрицу которая является n × p , матрицу D, которая составляет 1 × …
9 r  regression 

7
Как рассчитать показатели центральности в 4-миллионной пограничной сети, используя R?
У меня есть файл CSV с 4 миллионами ребер направленной сети, представляющих людей, общающихся друг с другом (например, Джон отправляет сообщение Мэри, Мэри отправляет сообщение Энн, Джон отправляет другое сообщение Мэри и т. Д.). Я хотел бы сделать две вещи: Найти степень, между и (возможно) центральность собственных векторов для каждого …


1
Какое временное разрешение для теста значимости временных рядов?
Мне нужно некоторое руководство по соответствующему уровню объединения для использования при тестировании различий средних по данным временных рядов. Я обеспокоен временной и жертвенной псевдорепликацией, которая, кажется, находится в напряжении в этом приложении. Это относится к изучению менструального, а не к манипулятивному эксперименту. Рассмотрим задачу мониторинга : система датчиков измеряет содержание …

1
Как тест Tukey HSD может быть более значимым, чем нескорректированное значение P t.test?
Я пришел к сообщению « Последующие парные сравнения двухстороннего ANOVA » (отвечая на этот пост ), где показано следующее: dataTwoWayComparisons <- read.csv("http://www.dailyi.org/blogFiles/RTutorialSeries/dataset_ANOVA_TwoWayComparisons.csv") model1 <- aov(StressReduction~Treatment+Age, data =dataTwoWayComparisons) summary(model1) # Treatment is signif pairwise.t.test(dataTwoWayComparisons$StressReduction, dataTwoWayComparisons$Treatment, p.adj = "none") # no signif pair TukeyHSD(model1, "Treatment") # mental-medical is the signif pair. (Выход …

1
Переменная кода в функции nlm ()
В R есть функция nlm (), которая выполняет минимизацию функции f с помощью алгоритма Ньютона-Рафсона. В частности, эта функция выводит значение кода переменной, определенного следующим образом: закодируйте целое число, указывающее, почему процесс оптимизации завершился. 1: относительный градиент близок к нулю, текущая итерация, вероятно, является решением. 2: последовательные итерации в пределах …
9 r  minimum 

3
Как я могу ускорить расчет фиксированных эффектов в GLMM?
Я занимаюсь имитационным исследованием, которое требует начальной загрузки оценок, полученных из обобщенной линейной смешанной модели (на самом деле, это произведение двух оценок для фиксированных эффектов, одна из GLMM и одна из LMM). Чтобы хорошо провести исследование, потребовалось бы около 1000 симуляций с 1000 или 1500 повторений бутстрапа каждый раз. Это …
9 r  mixed-model 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.