Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Имеет ли значение порядок объясняющих переменных при расчете их коэффициентов регрессии?
Сначала я думал, что порядок не имеет значения, но потом я прочитал о процессе ортогонализации Грамма-Шмидта для вычисления множественных коэффициентов регрессии, и теперь у меня возникли вторые мысли. Согласно процессу Грамма-Шмидта, чем позже объясняющая переменная индексируется среди других переменных, тем меньше ее остаточный вектор, потому что из него вычитаются остаточные …

3
Уравнения в новостях: перевод многоуровневой модели для широкой аудитории
В «Нью-Йорк Таймс» содержится длинный комментарий о «добавленной стоимости» системы оценки учителей, используемой для обратной связи с педагогами Нью-Йорка. Леде - это уравнение, используемое для расчета баллов - представленное без контекста. Риторическая стратегия выглядит запугиванием с помощью математики: Полный текст статьи доступен по адресу: http://www.nytimes.com/2011/03/07/education/07winerip.html. Автор, Майкл Винерип, утверждает, что …

7
Алгоритм динамического мониторинга квантилей
Я хочу оценить квантиль некоторых данных. Данные настолько огромны, что их невозможно разместить в памяти. И данные не являются статичными, новые данные продолжают поступать. Кто-нибудь знает какой-либо алгоритм для мониторинга квантилей данных, наблюдаемых до сих пор с очень ограниченными памятью и вычислениями? Я считаю, что алгоритм P2 полезен, но он …

13
Эконометрика учебники?
Какие хорошие учебники по эконометрике вы бы порекомендовали? Изменить: есть довольно много книг, с различными уровнями математической сложности. Было бы хорошо получить представление о том, насколько технически книга, которую вы рекомендуете.

4
Исправление значений p для нескольких тестов, где тесты коррелированы (генетика)
У меня есть p значений из многих тестов, и я хотел бы знать, есть ли на самом деле что-то существенное после исправления для множественного тестирования. Сложность: мои тесты не являются независимыми. Метод, о котором я думаю (вариант метода продукта Фишера, Зайкин и др., Genet Epidemiol , 2002), нуждается в корреляции …

3
Является ли час дня категориальной переменной?
Является ли «час дня», где значение может быть 0, 1, 2, ..., 23, категориальной переменной? Я хотел бы сказать нет, так как 5, например, «ближе» к 4 или 6, чем к 3 или 7. С другой стороны, существует разрыв между 23 и 0. Так это вообще считается категоричным или нет? …

2
Почему исправление непрерывности (скажем, нормальное приближение к биномиальному распределению) работает?
Я хотел бы лучше понять, как была получена поправка непрерывности к биномиальному распределению для нормального приближения. Какой метод использовался, чтобы решить, что мы должны добавить 1/2 (почему не другое число?). Любое объяснение (или ссылка на предлагаемое чтение, кроме этого , будет оценено).

1
Как рассчитать интервал прогнозирования для множественной регрессии МНК?
Что такое алгебраическая запись для вычисления интервала прогнозирования множественной регрессии? Это звучит глупо, но у меня возникают проблемы с нахождением четкой алгебраической записи этого.

2
Как понимать «нелинейный» как «нелинейное уменьшение размерности»?
Я пытаюсь понять различия между методами уменьшения линейной размерности (например, PCA) и нелинейными (например, Isomap). Я не совсем понимаю, что подразумевает (не) линейность в этом контексте. Я прочитал из Википедии, что Для сравнения, если PCA (алгоритм линейного уменьшения размерности) используется для сокращения этого же набора данных в два измерения, результирующие …

2
Как '12 CNN Крижевского получает 253,440 нейронов в первом слое?
В Alex Krizhevsky et al. При классификации Imagenet с глубокими сверточными нейронными сетями они перечисляют количество нейронов в каждом слое (см. Диаграмму ниже). Сетевой вход имеет размер 150 528, а число нейронов в остальных слоях сети составляет 253 440–186 624–64 896–64 896–43 264– 4096–4096–1000. 3D вид Количество нейронов для всех …

4
Имитация равномерного распределения на диске
Я пытался смоделировать введение случайных точек в круг, чтобы любая часть круга имела одинаковую вероятность наличия дефекта. Я ожидал, что число на площадь полученного распределения будет соответствовать распределению Пуассона, если я разделю круг на прямоугольники равной площади. Поскольку это требует только размещения точек в круглой области, я ввел два равномерных …

7
Как изобразить географию или почтовый индекс в модели машинного обучения или в системе рекомендаций?
Я строю модель, и я думаю, что географическое местоположение, вероятно, будет очень хорошим для предсказания моей целевой переменной. У меня есть почтовый индекс каждого из моих пользователей. Я не совсем уверен в том, как лучше всего включить в мою модель почтовый индекс в качестве предиктора. Хотя почтовый индекс является числом, …

3
Как я могу интерпретировать матрицу путаницы Склеарн
Я использую матрицу путаницы, чтобы проверить производительность моего классификатора. Я использую Scikit-Learn, я немного запутался. Как я могу интерпретировать результат от from sklearn.metrics import confusion_matrix >>> y_true = [2, 0, 2, 2, 0, 1] >>> y_pred = [0, 0, 2, 2, 0, 2] >>> confusion_matrix(y_true, y_pred) array([[2, 0, 0], [0, …

3
Как именно разреженный PCA лучше, чем PCA?
Я узнал о PCA несколько лекций назад в классе, и, узнав больше об этой увлекательной концепции, я узнал о редких PCA. Я хотел спросить, если я не ошибаюсь, это то, что является редким PCA: В PCA, если у вас есть точек данных с переменными, вы можете представить каждую точку данных …

3
Какова подходящая модель для данных недостаточного рассеяния?
Я пытаюсь смоделировать данные подсчета в R, которые, по-видимому, недостаточно распределены (параметр дисперсии ~ .40). Вероятно, поэтому модель glmс family = poissonили отрицательной биномиальной ( glm.nb) не имеет значения. Когда я смотрю на описания моих данных, у меня нет типичной асимметрии данных подсчета, и остатки в моих двух экспериментальных условиях …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.