Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Как генерировать случайные категориальные данные?
Допустим, у меня есть категориальная переменная, которая может принимать значения A, B, C и D. Как я могу сгенерировать 10000 случайных точек данных и контролировать частоту каждого из них? Например: A = 10% B = 20% C = 65% D = 5% Есть идеи, как я могу это сделать?

2
Влияние функций и МНК
Я пытаюсь понять, как работают функции влияния. Может ли кто-то объяснить в контексте простой регрессии OLS yi=α+β⋅xi+εiyi=α+β⋅xi+εi\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} где я хочу функцию влияния для .ββ\beta

1
Какова «мощность» модели машинного обучения?
Я изучаю этот урок по вариационным автоэнкодерам Карла Доерша . На второй странице говорится: Одним из наиболее популярных таких фреймворков является Variational Autoencoder [1, 3], предмет данного руководства. Предположения этой модели являются слабыми, и обучение происходит быстро с помощью обратного распространения. VAE действительно делают приближение, но ошибка, вносимая этим приближением, …

2
Максимальное среднее расхождение (распределение по расстоянию)
У меня есть два набора данных (исходные и целевые данные), которые следуют за разным распределением. Я использую MMD - это непараметрическое распределение расстояний - для вычисления предельного распределения между исходными и целевыми данными. исходные данные, хз целевые данные, Xt Матрица адаптации А * Проецируемые данные, Zs = A '* Xs …

1
RNN: Когда применять BPTT и / или обновлять веса?
Я пытаюсь понять применение RNN высокого уровня для маркировки последовательностей с помощью (среди прочего) статьи Грейвса 2005 года о классификации фонем. Чтобы подвести итог проблемы: у нас есть большой обучающий набор, состоящий из (входных) аудиофайлов отдельных предложений и (выходных) отмеченных экспертом времени начала, времени окончания и меток для отдельных фонем …
15 lstm  rnn 


2
Можно ли записать уравнение переменной инструмента в виде ориентированного ациклического графа (DAG)?
Направленные ациклические графы (DAG) являются эффективными визуальными представлениями качественных причинных предположений в статистических моделях, но могут ли они использоваться для представления регулярного уравнения переменной инструмента (или других уравнений)? Если так, то как? Если нет, то почему?

4
Бесплатный хостинг данных общественного интереса? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 4 года назад . У меня есть почасовые и ежедневные отчеты о температуре для многих станций на http://data.barrycarter.info/ Я призываю людей загрузить его, …
14 dataset 

1
Почему они выбрали бы гамма-распределение здесь?
В одном из упражнений для моего курса мы используем медицинский набор данных Kaggle . Упражнение говорит: мы хотим смоделировать распределение индивидуальных сборов, и мы также действительно хотим уловить нашу неопределенность в отношении этого распределения, чтобы мы могли лучше охватить диапазон значений, которые мы можем увидеть. Загрузка данных и выполнение начального …

3
Как измерить статистическое «расстояние» между двумя частотными распределениями?
Я предпринимаю проект по анализу данных, который включает изучение времени использования веб-сайта в течение года. То, что я хотел бы сделать, это сравнить, насколько «согласованными» являются шаблоны использования, скажем, насколько они близки к шаблону, который предполагает использование его в течение 1 часа один раз в неделю, или к шаблону, который …

2
Делает ли Wolfram Mathworld ошибку, описывая дискретное распределение вероятностей с помощью функции плотности вероятности?
Обычно распределение вероятностей по дискретным переменным описывается с использованием функции вероятности (PMF): При работе с непрерывными случайными величинами мы описываем распределения вероятностей, используя функцию плотности вероятности (PDF), а не функцию массы вероятности. - Глубокое обучение от Гудфеллоу, Бенжио и Курвилля Однако Wolfram Mathworld использует PDF для описания распределения вероятностей по …

1
Как называется среднее из самых больших и самых маленьких значений в данном наборе данных?
Что вы называете статистическим средним, которое вычисляется из верхних и нижних крайних значений в любом данном наборе данных? Например, если у вас есть набор: { -2, 0 , 8, 9, 1, 50, -2, 6} Верхний предел этого набора равен 50нижнему пределу -2. Таким образом, среднее значение крайностей будет(-2 + 50 …

2
Всегда ли неправильно переходить от непрерывных данных к категориальным?
Когда я читал о том, как настроить ваши данные, я часто сталкивался с тем, что преобразование некоторых непрерывных данных в категориальные данные не является хорошей идеей, поскольку вы можете сделать неправильный вывод, если пороговые значения плохо определены. Тем не менее, в настоящее время у меня есть некоторые данные (значения PSA …

3
Когда доверительный интервал «имеет смысл», а соответствующий достоверный интервал - нет?
Часто бывает так, что доверительный интервал с охватом 95% очень похож на вероятный интервал, который содержит 95% апостериорной плотности. Это происходит, когда предшествующий является однородным или почти однородным в последнем случае. Таким образом, доверительный интервал часто можно использовать для аппроксимации вероятного интервала и наоборот. Важно отметить, что из этого можно …

5
Как обрабатывать многократные серии одновременно?
У меня есть набор данных, включающий спрос на несколько продуктов (1200 продуктов) за 25 периодов, и мне нужно спрогнозировать спрос каждого продукта на следующий период. Сначала я хотел использовать ARIMA и обучать модели для каждого продукта, но из-за количества продуктов и настройки параметров (p, d, q) это отнимает много времени …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.