Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Что значит иметь хорошие частые свойства?
Я часто слышал эту фразу, но никогда полностью не понимал, что это значит. Фраза "хорошие свойства для частых пользователей" имеет в настоящее время ~ 2750 просмотров на Google, 536 на scholar.google.com и 4 на stats.stackexchange.com . Самое близкое, что я нашел к четкому определению, прибывает из заключительного слайда в этой …

2
Является ли каждый нестационарный ряд преобразованным в стационарный ряд посредством дифференцирования
Можно ли преобразовать каждый нестационарный временной ряд в стационарный временной ряд, применяя разность? Кроме того, как вы решаете порядок применения дифференцирования? Разница только с интервалами 1,2 ... n, и вы каждый раз выполняете проверку единичного корня для определения стационарности полученного ряда?

1
Статистическая значимость разницы между расстояниями
У меня есть более 3000 векторов на двумерной сетке с приблизительно равномерным дискретным распределением. Некоторые пары векторов удовлетворяют определенному условию. Примечание: условие применимо только к парам векторов, а не к отдельным векторам. У меня есть список из примерно 1500 таких пар, назовем его группой 1. Группа 2 содержит все остальные …

1
Использование
Предположим, что у меня есть iid и я хочу сделать проверку гипотезы, что равно 0. Предположим, у меня большое n и я могу использовать центральную предельную теорему. Я также мог бы проверить, что равно 0, что должно быть эквивалентно проверке, что равно 0. Кроме того, сходится к хи-квадрату, где сходится …

3
Что значит численное интегрирование слишком дорого?
Я читаю о байесовском умозаключении и натолкнулся на фразу «численная интеграция предельной вероятности слишком дорога» У меня нет опыта в математике, и мне было интересно, что именно здесь означает дорогой ? Это просто с точки зрения вычислительной мощности или есть что-то большее.

1
В чем разница между «пропорциями счета» и «непрерывными пропорциями»?
В комментарии к другому вопросу было уточнено, была ли обсуждаемая тема «пропорции подсчета» или «непрерывные пропорции», и в последующем указывалось, что различие было критической информацией (к теме логистической / биномиальной и бета-регрессии). В чем различие между ними и где это различие имеет значение? Что важно иметь в виду при работе …

1
Bootstrap filter / Алгоритм фильтра частиц (Понимание)
У меня действительно нет понимания того, как работает фильтр начальной загрузки. Я примерно знаю концепции, но не могу понять некоторые детали. Этот вопрос для меня, чтобы прояснить беспорядок. Здесь я буду использовать этот популярный алгоритм фильтрации из ссылки Душе (пока я думаю, что это самая простая ссылка). Позвольте мне сначала …

3
Нейронные архитектуры: автоматическое проектирование на основе данных
Недавний прогресс в нейронных сетях суммируется последовательностью новых архитектур, характеризующихся главным образом ее растущей сложностью проектирования. От LeNet5 (1994) до AlexNet (2012), Overfeat (2013) и GoogleLeNet / Inception (2014) и так далее ... Есть ли попытка позволить машине решить / спроектировать, какую архитектуру использовать в зависимости от данных?

1
MCMC; Можем ли мы быть уверены, что у нас есть «чистый» и «достаточно большой» образец сзади? Как это может работать, если мы не?
Обращаясь к этой теме: Как бы вы объяснили Маркову цепь Монте-Карло (MCMC) непрофессионалу? , Я могу видеть, что это комбинация цепей Маркова и Монте-Карло: цепь Маркова создается с апостериорным в качестве инвариантного предельного распределения, а затем рисуются монте-карло (зависимые) из предельного распределения (= нашего апостериорного). Допустим (я знаю, что я …
12 mcmc 

6
Существует ли какой-либо одномерный дистрибутив, из которого мы не можем сэмплировать?
У нас есть большое разнообразие методов для случайной генерации из одномерных распределений (обратное преобразование, принятие-отклонение, Метрополис-Гастингс и т. Д.), И кажется, что мы можем выбрать буквально из любого действительного распределения - это правда? Не могли бы вы привести какой-нибудь пример одномерного распределения, из которого невозможно произвести случайную генерацию? Я полагаю, …

5
Пытаются ли статистики частного сектора определить причинно-следственную связь?
Академические эконометрики часто заинтересованы в определении причинности. Похоже, что все работы в частном секторе, связанные со статистикой / наукой о данных, о которых я слышал, - это поиск только прогнозных моделей. Есть ли какие-либо рабочие места в частном секторе (или правительственные рабочие места), которые исследуют причинно-следственную связь?

1
Доверительные интервалы прогнозов для нелинейной смешанной модели (nlme)
Я хотел бы получить 95% доверительные интервалы на предсказаниях нелинейной смешанной nlmeмодели. Поскольку для этого не предусмотрено ничего стандартного nlme, мне хотелось бы знать, правильно ли использовать метод «интервалов прогнозирования населения», как описано в главе книги Бена Болкера в контексте моделей, подходящих с максимальной вероятностью , основанных на идее пересобрать …

1
Как учесть влияние праздников в прогнозе
У меня довольно предсказуемые ежедневные временные ряды с еженедельной сезонностью. Я могу придумать прогнозы, которые кажутся довольно точными (подтвержденными перекрестной проверкой), когда нет выходных. Однако, когда есть праздники, у меня возникают следующие проблемы: В моем прогнозе я получаю ненулевые числа для праздников, хотя все исторические праздники равны 0. Это действительно …

3
Модерируемая регрессия: почему мы вычисляем термин * product * между предикторами?
Модерируемый регрессионный анализ часто используется в социальных науках для оценки взаимодействия между двумя или более предикторами / ковариатами. Как правило, с двумя переменными предикторами применяется следующая модель: Y=β0+β1∗X+β2∗M+β3∗XM+eY=β0+β1∗X+β2∗M+β3∗XM+eY = β_0 + β_1*X + β_2*M + β_3*XM + e Обратите внимание, что проверка модерации выполняется термином продукта XMXMXM (умножение между независимой …

2
Использование lm для 2-пробы
Некоторое время я использовал линейные модели для проведения тестов пропорции 2 образцов, но понял, что это может быть не совсем правильно. Похоже, что использование обобщенной линейной модели с биномиальной связью семейство + тождественность дает в точности результаты пула для 2-выборочной пропорции. Однако использование линейной модели (или glm с семейством гауссов) …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.