Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Среднее и Медианное свойства
Может кто-нибудь объяснить мне ясную математическую логику, которая связывает два утверждения (а) и (б) вместе? Давайте иметь набор значений (некоторое распределение). Сейчас, а) Медиана не зависит от каждого значения [оно зависит только от одного или двух средних значений]; б) Медиана - это локус минимальной суммы абсолютных отклонений от нее. И …

1
Правильно ли я рассчитал эти вероятностные отношения?
Я являюсь автором пакета ez для R, и я работаю над обновлением для включения автоматического вычисления отношений правдоподобия (LR) в выходные данные ANOVA. Идея состоит в том, чтобы предоставить LR для каждого эффекта, аналогичного тесту того эффекта, которого достигает ANOVA. Например, LR для основного эффекта представляет сравнение нулевой модели с …

3
Оценить определенный интервал нормального распределения
Я знаю, что простая в обращении формула для CDF нормального распределения несколько отсутствует из-за сложной функции ошибок в ней. Однако мне интересно, есть ли хорошая формула для . Или каково «современное» приближение для этой проблемы.N(c−≤x&lt;c+|μ,σ2)N(c−≤x&lt;c+|μ,σ2)N(c_{-} \leq x < c_{+}| \mu, \sigma^2)

7
Как изучение «случайных процессов» поможет мне как статистику?
Я хочу решить, должен ли я пройти курс под названием «ВВЕДЕНИЕ В СТОХАСТИЧЕСКИЕ ПРОЦЕССЫ», который будет проходить в следующем семестре в моем университете. Я спросил лектора, как изучение такого курса поможет мне как статистику, он сказал, что, поскольку он исходит из вероятности, он очень мало знает статистику и не знает, …

2
Как сравнивается сила логистической регрессии и t-критерия?
Является ли сила логистической регрессии и критерий Стьюдента эквивалентной? Если это так, то они должны быть «эквивалентными плотности данных», под которыми я подразумеваю, что одно и то же количество базовых наблюдений дает одинаковую мощность при фиксированной альфа-коэффициенте 0,05. Рассмотрим два случая: [Параметрический t-критерий]: из биномиального наблюдения сделано 30 ничьих, и …

10
Стратегия редактирования файлов с разделением запятыми (CSV)
Когда я работаю над проектами по анализу данных, я часто храню данные в файлах данных с разделителями-запятыми (CSV, TSV). При этом данные часто принадлежат к выделенной системе управления базами данных. Для многих моих приложений это было бы слишком. Я могу редактировать файлы CSV и TSV в Excel (или, предположительно, в …

3
Как я могу оценить стандартные ошибки коэффициента при использовании регрессии гребня?
Я использую гребень регрессии на сильно мультиколлинеарных данных. Используя OLS, я получаю большие стандартные ошибки по коэффициентам из-за мультиколлинеарности. Я знаю, что регрессия гребня является способом решения этой проблемы, но во всех реализациях регрессии гребня, на которые я смотрел, нет стандартных ошибок, сообщаемых для коэффициентов. Я хотел бы получить некоторый …




2
Когда MCMC стал обычным явлением?
Кто-нибудь знает, в каком году MCMC стал обычным явлением (то есть популярным методом байесовского вывода)? Ссылка на количество опубликованных MCMC (журнальных) статей с течением времени будет особенно полезной.
18 bayesian  mcmc  history 

5
Почему мы не используем t-распределение для построения доверительного интервала для пропорции?
Чтобы рассчитать доверительный интервал (CI) для среднего значения с неизвестным стандартным отклонением популяции (sd), мы оцениваем стандартное отклонение популяции, используя t-распределение. Примечательно, что CI=X¯±Z95%σX¯CI=X¯±Z95%σX¯CI=\bar{X} \pm Z_{95\% }\sigma_{\bar X} где σX¯=σn√σX¯=σn\sigma_{\bar X} = \frac{\sigma}{\sqrt n} . Но поскольку у нас нет точечной оценки стандартного отклонения совокупности, мы оцениваем через приближениеCI=X¯±t95%(se)CI=X¯±t95%(se)CI=\bar{X} \pm …

4
Нарисуйте целые числа независимо и равномерно в случайном порядке от 1 до используя справедливое d6?
Я хотел бы нарисовать целые числа от 1 до некоторого определенного , бросая некоторое количество справедливых шестигранных кубика (d6). Хороший ответ объяснит, почему его метод производит однородные и независимые целые числа.NNN В качестве иллюстративного примера было бы полезно объяснить, как работает решение для случая .N = 150N=150N=150 Кроме того, я …

2
Используются ли методы линейного поиска в глубоком обучении? Почему нет?
Многие учебники онлайн рассказывают о градиентном спуске, и почти во всех из них используется фиксированный размер шага (скорость обучения ). Почему не используется поиск строк (например, поиск по линии с возвратом или точный поиск по строке)?αα\alpha

3
Как размер партии влияет на конвергенцию SGD и почему?
Я видел аналогичный вывод из многих дискуссий, что с увеличением размера мини-пакета конвергенция SGD становится все труднее / хуже, например, в этой статье и в этом ответе . Также я слышал о людях, использующих такие уловки, как небольшая скорость обучения или размеры партий на ранней стадии, для решения этой проблемы …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.