Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Преимущества стратифицированной и случайной выборки для получения обучающих данных в классификации
Я хотел бы знать, есть ли какие-либо / некоторые преимущества использования стратифицированной выборки вместо случайной выборки при разделении исходного набора данных на обучающий и тестовый набор для классификации. Кроме того, дает ли стратифицированная выборка больше смещения в классификаторе, чем случайная выборка? Приложение, для которого я хотел бы использовать стратифицированную выборку …

1
Обсуждение об оверфите в xgboost
Моя установка следующая: Я следую указаниям в разделе «Прикладное прогнозное моделирование». Таким образом, я отфильтровал взаимосвязанные функции и в итоге получил следующее: 4900 точек данных в тренировочном наборе и 1600 точек данных в тестовом наборе. У меня есть 26 функций, и цель является непрерывной переменной. Я применяю 5-кратную перекрестную проверку …

2
Доказательство сходимости k-средних
Для задания меня попросили предоставить доказательство того, что k-means сходится за конечное число шагов. Вот что я написал: CCCE(C)=∑xmini=1k∥x−ci∥2E(C)=∑xmini=1k‖x−ci‖2E(C)=\sum_{\mathbf{x}}\min_{i=1}^{k}\left\Vert \mathbf{x}-\mathbf{c}_{i}\right\Vert ^{2}E(C)E(C)E(C) Шаг 2 относится к шагу, который помечает каждую точку данных ее ближайшим центром кластера, а шаг 3 - это шаг, на котором центры обновляются путем взятия среднего значения. Этого …

6
Ожидаемое значение времени ожидания для первого из двух автобусов, курсирующих каждые 10 и 15 минут
Я наткнулся на вопрос интервью: Существует красный поезд, который идет каждые 10 минут. Каждые 15 минут идет синий поезд. Оба они начинаются со случайного времени, поэтому у вас нет расписания. Если вы прибываете на станцию ​​в произвольное время и садитесь на любой поезд, который прибывает первым, каково ожидаемое время ожидания?

2
Преимущества экспоненциальной семьи: почему мы должны ее изучать и использовать?
Так что здесь я изучаю вывод. Мне бы хотелось, чтобы кто-то мог перечислить преимущества экспоненциальной семьи. Под экспоненциальным семейством я подразумеваю распределения, которые задаются как f(x|θ)=h(x)exp{η(θ)T(x)−B(θ)}f(x|θ)=h(x)exp⁡{η(θ)T(x)−B(θ)}\begin{align*} f(x|\theta) = h(x)\exp\left\{\eta(\theta)T(x) - B(\theta)\right\} \end{align*} чья поддержка не зависит от параметра . Вот некоторые преимущества, которые я узнал:θθ\theta (а) Включает в себя широкий …

3
Как называется этот график, в котором есть строки с двумя связанными точками?
Я читал отчет об ОВОС, и этот сюжет привлек мое внимание. Теперь я хочу иметь возможность создавать сюжеты того же типа. Он показывает эволюцию энергоэффективности между двумя годами (1990-2015) и добавляет значение изменения между этими двумя периодами. Как называется этот тип сюжета? Как я могу создать один и тот же …

1
Какова история коробочных сюжетов и как развивался дизайн «коробочек и усов»?
Многие источники датируют классический дизайн «коробочного сюжета» Джоном Тьюки и его «схематическим сюжетом» 1970 года. С тех пор дизайн, кажется, оставался относительно статичным, так как урезанная версия Эдварда Туфте с сюжетной коробкой оказалась не в состоянии завоевать популярность, в то время как сюжеты для скрипки - хотя и более информативный …

4
Почему увеличение размера образца бросков монеты не улучшает приближение нормальной кривой?
Я читаю книгу Статистика (Freeman, Pisani, Purves) и пытаюсь воспроизвести пример, когда монету подбрасывают, скажем, 50 раз, подсчитывают количество голов, и это повторяется, скажем, 1000 раз. Во-первых, я сохранил количество бросков (размер выборки) на 1000 и увеличил количество повторений. Чем больше повторений, тем лучше данные соответствуют нормальной кривой. Итак, затем …

3
Как определить, может ли подруга сказать будущее (то есть предсказать запасы)?
Моя подруга недавно получила работу, занимаясь продажами и торговлей в крупном банке. Опираясь на свою новую работу, она полагает, что может предсказать, будут ли акции в конце месяца больше или меньше, чем шанс (она полагает, что может даже сделать это с точностью 80%!) Я очень скептически Мы договорились провести эксперимент, …

4
Отношения между корреляцией и причинностью
На странице Википедии под названием корреляция не подразумевается причинно-следственная связь , Для любых двух коррелированных событий A и B различные возможные отношения включают в себя: А вызывает Б (прямая причинность); B вызывает A (обратная причина); А и В являются следствиями общего дела, но не вызывают друг друга; A и B …

5
Избегайте перенастройки в регрессии: альтернативы регуляризации
Регуляризация в регрессии (линейная, логистическая ...) является наиболее популярным способом уменьшения избыточного соответствия. Когда целью является точность прогноза (не объяснение), есть ли хорошие альтернативы регуляризации, особенно подходящие для больших наборов данных (ми / миллиарды наблюдений и миллионы функций)?

1
Непараметрический тест, если два образца взяты из одного распределения
Я хотел бы проверить гипотезу о том, что две выборки взяты из одной и той же совокупности, не делая никаких предположений о распределении выборок или совокупности. Как мне это сделать? Из Википедии у меня сложилось впечатление, что U-критерий Манна-Уитни должен быть подходящим, но на практике он мне не подходит. Для …

3
Как мы можем судить о точности предсказаний Нейта Сильвера?
Во-первых, он дает вероятность результатов. Так, например, его прогнозы на выборах в США в настоящее время составляют 82% Клинтона против 18% Трампа. Теперь, даже если Трамп выиграет, как я узнаю, что выиграть должен был не только 18% времени? Другая проблема заключается в том, что его вероятности меняются со временем. Итак, …

1
Как работает отрицательная выборка в word2vec?
Я изо всех сил пытался понять концепцию отрицательной выборки в контексте word2vec. Я не могу переварить идею [отрицательной] выборки. Например, в работах Миколова отрицательное ожидание выборки формулируется как журналσ( ⟨ Ш , с ⟩ ) + K ⋅ EсN∼ PD[ журналσ( - ⟨ ш , грN⟩ ) ] .журнал⁡σ(⟨вес,с⟩)+К⋅ЕсN~пD[журнал⁡σ(-⟨вес,сN⟩)],\log \sigma(\langle …

2
Метки многопрофильной классификации по скикиту
Я пытаюсь создать классификатор с несколькими метками, чтобы назначать темы для существующих документов с помощью scikit. Я обрабатываю свои документы, пропускаю их через TfidfVectorizerярлыки MultiLabelBinarizerи создаю в OneVsRestClassifierкачестве SGDClassifierоценщика. Однако при тестировании моего классификатора я получаю баллы только до .29, что, как я прочитал, довольно мало для подобных проблем. Я …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.