Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Проверка гипотез и научный метод
Читая ответы на эту тему , я начал задумываться о том, как проверка гипотез относится к научному методу . Хотя у меня есть хорошее понимание того и другого, мне трудно понять точную связь между ними. На высоком уровне научный метод сводится к: Сделать гипотезы и гипотезы (теория) Делайте прогнозы из …

1
Когда использовать примеси Джини, а когда использовать получение информации?
Может кто-нибудь объяснить мне, когда использовать примеси Джини и информацию для деревьев решений? Можете ли вы дать мне ситуации / примеры того, когда лучше всего использовать какие?

2
Что это за хитрость с добавлением 1 здесь?
Я смотрел на эту страницу о реализации Монте-Карло теста Лиллефорса. Я не понимаю это предложение: В этом расчете из моделирования есть случайная ошибка. Однако из-за хитрости добавления 1 к числителю и знаменателю при вычислении значения P его можно использовать прямо, без учета случайности. Что они подразумевают под хитростью добавления 1 …

3
Есть ли какое-либо значение в уменьшении размерности набора данных, где все переменные приблизительно ортогональны?
Предположим, у меня есть мерный набор данных, где измерений примерно ортогональны (имеют нулевую корреляцию).NNNNNNN Есть ли какая-либо полезность с точки зрения: Визуализация Представление (для эффективности классификатора) Или другие критерии выполнить уменьшение размерности данных?

3
Пояснение формулы для медианы, ближайшей к началу N образцов из единичного шара
В Элементах Статистического Изучения введена проблема, чтобы выделить проблемы с k-nn в многомерных пространствах. Есть точек данных, которые равномерно распределены в мерном единичном шаре.NNNpпp Среднее расстояние от начала координат до ближайшей точки данных определяется выражением: d(p,N)=(1−(12)1N)1pd(п,N)знак равно(1-(12)1N)1пd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} Когда , формула разбивается на половину радиуса шара, и я могу …

1
Как получить выборку Гиббса?
Я на самом деле стесняюсь спросить об этом, потому что боюсь, что меня будут перенаправлять на другие вопросы или на Википедию о выборке Гиббса, но у меня нет ощущения, что они описывают то, что под рукой. При заданной условной вероятности : p(x|y)p(x|y)p(x|y)p(x|y)x=x0x=x1y=y01434y=y12646p(x|y)y=y0y=y1x=x01426x=x13446 \begin{array}{c|c|c} p(x|y) & y = y_0 & y …
11 sampling  mcmc  gibbs 

3
Есть ли в США известная предвзятость по поводу телефонных опросов?
Я смотрел опрос WashingtonTimes / ABC, и разбивка результатов, особенно по возрасту, показалась мне неожиданной. Поэтому я пошел искать предвзятость. В нем говорится: «Опрос проводился по телефону 11-14 декабря 2014 года среди случайной выборки из 1000 взрослых. Интервью проводились на английском и испанском языках по стационарным и мобильным телефонам». Опрос …
11 polling  politics 

2
Тонкость р-значения: больше-равно против больше
Когда я читаю книгу Вассермана «Вся статистика», я замечаю тонкую тонкость в определении p-значений, которую я не могу понять. Неформально Вассерманн определяет значение p как [..] вероятность (ниже H0H0H_0 ) наблюдения значения тестовой статистики такая же или более экстремальная, чем на самом деле наблюдалось. Акцент добавлен. То же самое более …

2
Если моя гистограмма показывает колоколообразную кривую, могу ли я сказать, что мои данные нормально распределены?
Я создал гистограмму для возраста респондента и сумел получить очень хороший колоколообразный изгиб, из которого я пришел к выводу, что распределение нормальное. Затем я выполнил тест нормальности в SPSS, с n = 169. Значение p (Sig.) Теста Колмогорова-Смирнова меньше 0,05, и поэтому данные нарушили предположение о нормальности. Почему тест показывает, …

1
Что мой график ACF говорит мне о моих данных?
У меня есть два набора данных: Мой первый набор данных - это стоимость инвестиций (в миллиардах долларов) в зависимости от времени, каждая единица времени составляет один квартал с первого квартала 1947 года. Время распространяется на третий квартал 2002 года. Мой второй набор данных является «результатом преобразования значений инвестиций в [первый …

2
Эконометрика байесовского подхода к методологии исследования событий
Исследования событий широко распространены в экономике и финансах для определения влияния события на цену акций, но они почти всегда основаны на частых рассуждениях. Регрессия OLS - в течение отчетного периода, отличного от окна событий, - обычно используется для определения параметров, необходимых для моделирования нормальной доходности актива. Затем определяется статистическая значимость …

1
Симуляция Монте-Карло в R
Я пытаюсь выполнить следующее упражнение, но на самом деле понятия не имею, как начать это делать. Я нашел код в своей книге, который выглядит так, но это совершенно другое упражнение, и я не знаю, как связать их друг с другом. Как я могу начать имитировать прибытие и как узнать, когда …

1
В чем разница между контролем переменной в регрессионной модели и контролем переменной в проекте исследования?
Я полагаю, что контроль переменной в вашем проекте исследования более эффективен для уменьшения ошибки, чем контроль за ней в вашей регрессионной модели. Не возражает ли кто-нибудь формально объяснить, как эти два случая «контроля» различаются? Насколько они сравнительно эффективны для уменьшения ошибок и получения более точных прогнозов?

4
Обнаружение выбросов во временных рядах: как уменьшить количество ложных срабатываний?
Я пытаюсь автоматизировать обнаружение выбросов во временных рядах, и я использовал модификацию решения, предложенного здесь Робом Хиндманом . Скажем, я измеряю ежедневные посещения сайта из разных стран. В некоторых странах, где ежедневные посещения составляют несколько сотен или тысяч, мой метод, кажется, работает разумно. Однако в тех случаях, когда страна ведет …

1
Использование стандартных инструментов машинного обучения для данных с левой цензурой
Я разрабатываю приложение для прогнозирования, цель которого - позволить импортеру прогнозировать спрос на свою продукцию от своей сети дистрибьюторов. Данные о продажах являются довольно хорошим показателем спроса, если имеется достаточный запас для удовлетворения спроса. Однако, когда инвентарь сокращается до нуля (ситуация, которую мы ищем, чтобы помочь нашим покупателям избежать), мы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.