Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Может ли опорная векторная машина использоваться в больших данных?
Имея ограниченные знания о SVM, он подходит для короткой и полной матрицы данных (много функций и не слишком много экземпляров), но не для больших данных.ИксXX Я понимаю, что одной из причин является то, что матрица ядра - это матрица n × n, где n - количество экземпляров в данных. Если …

3
Как запустить линейную регрессию в параллельном / распределенном режиме для настройки больших данных?
Я работаю над очень большой проблемой линейной регрессии, когда размер данных настолько велик, что их нужно хранить на кластере машин. Он будет слишком большим, чтобы объединить все образцы в память одного компьютера (даже диска). Чтобы выполнить регрессию этих данных, я думаю о параллельном подходе, т.е. запустить регрессию для каждого отдельного …

2
Почему неправильно останавливать тестирование A / B до достижения оптимального размера выборки?
Я отвечаю за представление результатов A / B-тестов (на разных сайтах) в моей компании. Мы запускаем тест в течение месяца, а затем регулярно проверяем p-значения до тех пор, пока не достигнем значимости (или откажемся, если значимость не будет достигнута после длительного выполнения теста), что я сейчас выясняю, что это ошибочная …

2
В чем разница между случайной величиной и случайной выборкой?
Эти два выражения сильно смутили меня, когда я изучал статистику. Мне кажется, что это совершенно разные вещи. Случайная выборка является случайным образом взять пробу из популяции, в то время как случайная величина , как функция , которая отображает множество всех возможных результатов эксперимента с реальным числом. Однако, скажем, если я …

1
В целом, делать вывод более сложно, чем делать прогноз?
Мой вопрос исходит из следующего факта. Я читал посты, блоги, лекции, а также книги по машинному обучению. У меня сложилось впечатление, что специалисты по машинному обучению кажутся безразличными ко многим вещам, которые волнуют статистиков / эконометрики. В частности, практики машинного обучения подчеркивают точность прогноза, а не умозаключения. Один такой пример …

5
Имеет ли смысл перекрестная энтропия смысл в контексте регрессии?
Имеет ли смысл перекрестная энтропия в контексте регрессии (в отличие от классификации)? Если да, не могли бы вы привести пример с игрушкой через TensorFlow? Если нет, то почему нет? Я читал о кросс-энтропии в Neural Networks и Deep Learning Майкла Нильсена, и кажется, что это то, что естественно можно использовать …

2
Почему логистическая регрессия дает хорошо откалиброванные модели?
Я понимаю, что одной из причин, по которым логистическая регрессия часто используется для прогнозирования рейтинга кликов в Интернете, является то, что она производит хорошо откалиброванные модели. Есть ли хорошее математическое объяснение этому?

4
Почему сопоставление оценки склонности работает для причинного вывода?
Сопоставление баллов склонности используется для определения причинно-следственных связей в наблюдательных исследованиях (см. Статью Розенбаума / Рубина ). Что за простая интуиция, почему она работает? Другими словами, почему, если мы удостоверимся, что вероятность участия в лечении одинакова для двух групп, смешанные эффекты исчезнут, и мы можем использовать результат, чтобы сделать причинные …

1
Как исправить несходимость в LogisticRegressionCV
Я использую scikit-learn для выполнения логистической регрессии с перекрестной проверкой на наборе данных (около 14 параметров с> 7000 нормализованных наблюдений). У меня также есть целевой классификатор, который имеет значение 1 или 0. У меня проблема в том, что независимо от используемого решателя я получаю предупреждения о сходимости ... model1 = …

2
Как рассчитать ожидаемое значение стандартного нормального распределения?
Я хотел бы узнать, как рассчитать ожидаемое значение непрерывной случайной величины. Представляется , что ожидаемое значение , где является функция плотности вероятности .е ( х ) ХE[X]=∫∞−∞xf(x)dxE[X]=∫−∞∞xf(x)dxE[X] = \int_{-\infty}^{\infty} xf(x)\mathrm{d}xf(x)f(x)f(x)XXX Предположим, что функция плотности вероятности имеет вид который является плотностью стандартное нормальное распределение.f ( x ) = 1XXXf(x)=12π−−√e−x22f(x)=12πe−x22f(x) = \frac{1}{\sqrt{2\pi}}e^{\frac{-x^{2}}{2}} …


4
Какова цель нормализации строк
Я понимаю причину нормализации столбцов, поскольку она приводит к одинаковому взвешиванию объектов, даже если они не измеряются в одном и том же масштабе - однако часто в литературе ближайшего соседа столбцы и строки нормализуются. Что такое нормализация строк для / почему нормализация строк? В частности, как результат нормализации строк влияет …

4
Как мне проверить предположение о линейности логита для непрерывных независимых переменных в логистическом регрессионном анализе?
Меня смущает предположение о линейности логита для переменных непрерывного предиктора в логистическом регрессионном анализе. Нужно ли проверять линейные отношения при проверке потенциальных предикторов с использованием анализа неизменяемой логистической регрессии? В моем случае я использую множественный логистический регрессионный анализ для выявления факторов, связанных с состоянием питания (дихотомический результат) среди участников. Непрерывные …

1
Настройка гиперпараметра в регрессии Гаусса
Я пытаюсь настроить гиперпараметры алгоритма гауссовой регрессии, который я реализовал. Я просто хочу максимизировать предельное правдоподобие, определяемое формулой где K - ковариационная матрица с элементы K_ {ij} = k (x_i, x_j) = b ^ {- 1} \ exp (- \ frac {1} {2} (x_i-x_j) ^ TM (x_i-x_j)) + a ^ …

1
Как обратное распространение работает в сиамской нейронной сети?
Я изучал архитектуру сиамской нейронной сети, представленной Янном ЛеКуном и его коллегами в 1994 году для распознавания подписей ( «Проверка подписи с использованием сиамской нейронной сети с временной задержкой». Pdf, NIPS 1994) Я понял общую идею этой архитектуры, но я действительно не могу понять, как работает обратное распространение в этом …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.