Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
В чем смысл собственных векторов взаимной информационной матрицы?
При взгляде на собственные векторы ковариационной матрицы мы получаем направления максимальной дисперсии (первый собственный вектор - это направление, в котором данные наиболее сильно варьируются и т. Д.); это называется анализ главных компонентов (PCA). Мне было интересно, что это будет означать, чтобы посмотреть на собственные векторы / значения матрицы взаимной информации, …

1
Разница между средним и предельным эффектом лечения
Я читал некоторые статьи, и мне неясно, каковы конкретные определения среднего эффекта лечения (ATE) и предельного эффекта лечения (MTE). Они одинаковы? По словам Остина ... Условный эффект - это средний эффект перемещения объекта от необработанного к леченному на уровне субъекта. Коэффициент регрессии для переменной индикатора назначения лечения из модели многомерной …

3
Глубокие нейронные сети - только для классификации изображений?
Все примеры, которые я нашел, используя глубокие убеждения или сверточные нейронные сети, используют их для классификации изображений, распознавания разговоров или распознавания речи. Полезны ли глубокие нейронные сети для классических задач регрессии, где функции не структурированы (например, не расположены в последовательности или сетке)? Если да, можете ли вы привести пример?

3
Как сделать увеличение данных и разделить проверку достоверности?
Я делаю классификацию изображений с использованием машинного обучения. Предположим, у меня есть некоторые тренировочные данные (изображения), и я разделю эти данные на обучающие и проверочные наборы. И я также хочу дополнить данные (создать новые изображения из оригинальных) путем случайных поворотов и введения шума. Увеличение сделано в автономном режиме. Какой правильный …

4
Учебники / чтения о том, что делать, если вы не можете создать идеальный эксперимент?
Моя статистическая подготовка основана на математической статистике, и посещение этих методов в моем MS в настоящий момент немного шокирует; в настоящее время мне трудно понять некоторые из этих «прикладных» методов, поскольку у меня нет опыта в этой отрасли. Одной из тем, о которых мы говорили на моих занятиях по методам, …

1
Понимание регрессии гауссовского процесса через бесконечномерное представление базисной функции
Часто говорят, что регрессия Гауссова процесса соответствует (GPR) байесовской линейной регрессии с (возможно) бесконечным количеством базисных функций. В настоящее время я пытаюсь понять это в деталях, чтобы понять, какие модели я могу выразить, используя GPR. Как вы думаете, это хороший подход, чтобы попытаться понять GPR? В книге « Гауссовские процессы …

5
Путь к математической статистике без анализа фона: идеальный учебник для самостоятельной работы
Я довольно склонен к математике - у меня было 6 семестров по математике в моем старшекурснике, - хотя я немного не практичен и не очень хорошо говорю, скажем, уравнения в частных производных и интегралы по путям, мои концепции возвращаются с небольшой практикой. У меня не было курса по математическим доказательствам …

3
Какие быстрые алгоритмы существуют для вычисления усеченного SVD?
Возможно, здесь не по теме, но уже существует несколько ( один , два ) связанных вопросов. Поиски в литературе (или поиск в Google по усеченным алгоритмам SVD) обнаруживают множество статей, которые используют усеченные SVD по-разному, и утверждают (разочаровывающе, часто без цитирования), что существуют быстрые алгоритмы для его вычисления, но никто …

2
Выборка из дистрибутива фон Мизеса-Фишера в Python?
Я ищу простой способ выбрать из многомерного дистрибутива фон Мизеса-Фишера в Python. Я просмотрел модуль stats в scipy и numpy module, но нашел только одномерное распределение фон Мизеса. Есть ли код? Я еще не нашел. Очевидно, Вуд (1994) разработал алгоритм для выборки из распределения vMF по этой ссылке , но …

2
Преобразование данных: все переменные или только ненормальные?
В «Обнаружении статистики Энди Филда с использованием SPSS» он утверждает, что все переменные должны быть преобразованы. Однако в публикации: «Изучение пространственно меняющихся взаимосвязей между землепользованием и качеством воды с использованием географически взвешенной регрессии I: проектирование и оценка модели», в частности, они утверждают, что были преобразованы только ненормальные переменные. Этот анализ …

3
Как программно определить сегменты ряда данных, чтобы они соответствовали различным кривым?
Существуют ли какие-либо документированные алгоритмы для разделения разделов данного набора данных на различные кривые наилучшего соответствия? Например, большинство людей, смотрящих на эту таблицу данных, с готовностью разделят ее на 3 части: синусоидальный сегмент, линейный сегмент и обратный экспоненциальный сегмент. Фактически, я сделал этот конкретный с синусоидой, линией и простой экспоненциальной …

3
Предположения для получения оценки МНК
Может кто-нибудь кратко объяснить мне, почему каждое из шести предположений необходимо для вычисления оценки OLS? Я обнаружил только мультиколлинеарность: если она существует, мы не можем инвертировать (X'X) матрицу и, в свою очередь, оценить общую оценку. А как насчет других (например, линейность, средние ошибки и т. Д.)?

3
потеря шарнира против логистических потерь преимущества и недостатки / ограничения
Потери шарнира можно определить с помощью а потерю журнала можно определить как log ( 1 + exp ( - y i w T x i ) )max ( 0 , 1 - уявесTИкся)Максимум(0,1-YявесTИкся)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)журнал ( 1 + опыт( - уявесTИкся) )журнал(1+ехр⁡(-YявесTИкся))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) У меня есть следующие вопросы: Есть ли …

4
Доверительные интервалы, когда размер выборки очень большой
Мой вопрос можно перефразировать как «как оценить ошибку выборки с использованием больших данных», особенно для публикации в журнале. Вот пример, чтобы проиллюстрировать проблему. Из очень большого набора данных (> 100 000 уникальных пациентов и их назначенных препаратов из 100 больниц) я заинтересовался оценкой доли пациентов, принимающих конкретное лекарство. Получить эту …

1
Почему модели со смешанными эффектами разрешают зависимость?
Скажем, нас интересует, как на экзаменационные оценки учеников влияет количество часов, которые они изучают. Чтобы исследовать это соотношение, мы могли бы запустить следующую линейную регрессию: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Но если мы выбираем учеников из нескольких разных школ, мы можем ожидать, что ученики в …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.