Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Как измерить / аргументировать правильность соответствия линии тренда степенному закону?
У меня есть некоторые данные, которым я пытаюсь соответствовать линию тренда. Я полагаю, что данные соответствуют степенному закону, и поэтому нанесли данные на оси логарифма в поисках прямой линии. Это привело к (почти) прямой линии, поэтому в Excel я добавил линию тренда для степенного закона. Поскольку я новичок в статистике, …


4
Слабо информативные априорные распределения для параметров шкалы
Я использовал логарифмические нормальные распределения в качестве предыдущих распределений для параметров масштаба (для нормальных распределений, t-распределений и т. Д.), Когда у меня есть приблизительное представление о том, каким должен быть масштаб, но я хочу ошибиться, говоря, что я не знаю много об этом. Я использую это, потому что это использование …

2
Измерение сходства документов
Для кластеризации (текстовых) документов вам нужен способ измерения сходства между парами документов. Две альтернативы: Сравните документы как векторы терминов, используя косинусное сходство - и TF / IDF в качестве весовых коэффициентов для терминов. Сравните распределение вероятностей каждого документа, используя f-расхождение, например, расхождение Кульбака-Лейблера Есть ли какая-либо интуитивная причина предпочесть один …

7
Как интерпретировать доверительный интервал разницы в средних значениях в одном выборочном Т-тесте?
SPSS обеспечивает вывод «доверительный интервал разности средних». Я читал в некоторых местах, что это означает, что «95 раз из 100, наша выборочная средняя разница будет между этими границами», я нахожу это неясным. Кто-нибудь может предложить более четкую формулировку для объяснения «доверительного интервала разницы в средствах»? Этот вывод появляется в контексте …

3
Коэффициент определения (
Я хочу полностью понять понятие описывающее количество вариаций между переменными. Каждое веб-объяснение немного механическое и тупое. Я хочу «получить» концепцию, а не просто механически использовать числа.р2р2r^2 Например: количество изученных часов и результаты теста ррr = 0,8 р2р2r^2 = .64 Итак, что это значит? 64% вариабельности результатов теста можно объяснить часами? …

5
Как мне улучшить мою нейронную сеть при прогнозировании синусоидальных волн?
Вот, посмотрите: вы можете точно увидеть, где заканчиваются тренировочные данные. Тренировочные данные идут от до 1 .- 1-1-1111 Я использовал Keras и плотную сеть 1-100-100-2 с активацией tanh. Я вычисляю результат по двум значениям, p и q как p / q. Таким образом, я могу получить любой размер числа, используя …

1
Генерация коррелированных биномиальных случайных величин
Мне было интересно, возможно ли генерировать коррелированные случайные биномиальные переменные, следуя подходу линейного преобразования? Ниже я попробовал что-то простое в R, и оно дает некоторую корреляцию. Но мне было интересно, есть ли принципиальный способ сделать это? X1 = rbinom(1e4, 6, .5) ; X2 = rbinom(1e4, 6, .5) ; X3 = …

3
Как интерпретировать среднеквадратичную ошибку (RMSE) в сравнении со стандартным отклонением?
Допустим, у меня есть модель, которая дает мне прогнозируемые значения. Я рассчитываю RMSE этих значений. А затем стандартное отклонение фактических значений. Имеет ли смысл сравнивать эти два значения (дисперсии)? Я думаю, что если среднеквадратичное отклонение и стандартное отклонение схожи / одинаковы, то ошибка / дисперсия моей модели совпадает с тем, …

3
Нужен ли нам набор тестов при использовании перекрестной проверки в k-кратном порядке?
Я читал о проверке K-Fold, и я хочу убедиться, что я понимаю, как это работает. Я знаю, что для метода удержания данные делятся на три набора, и набор тестов используется только в самом конце для оценки производительности модели, в то время как набор проверки используется для настройки гиперпараметров и т. …

2
Как суммировать достоверные интервалы для медицинской аудитории
С помощью пакетов Stan и frontend, rstanarmили brmsя могу легко анализировать данные байесовским способом, как я делал раньше со смешанными моделями, такими как lme. Хотя у меня на столе лежит большая часть книг и статей Крушке-Гельмана-Вагенмейкера и т. Д., Они не говорят мне, как суммировать результаты для медицинской аудитории, разрываясь …

5
Статистический подход для определения случайного отсутствия данных
У меня есть большой набор векторов признаков, которые я буду использовать для решения проблемы бинарной классификации (используя scikit learn в Python). Прежде чем я начну думать о вменении, мне интересно попытаться определить по оставшимся частям данных, пропущены ли данные «случайно» или «не случайно». Какой разумный способ подойти к этому вопросу? …

2
Почему «отрицательная биномиальная» случайная величина называется так?
Я не понимаю, почему «отрицательная биномиальная» случайная переменная имеет такое имя. Что в этом негативного? Что в этом биномиального? Что в этом отрицательно-биномиального?

2
Каковы предположения о регрессии гребня и как их проверить?
Рассмотрим стандартную модель множественной регрессии где , так что нормальность, гомоскедастичность и некоррелированность ошибок сохраняются.Y= Xβ+ εY=Xβ+εY=X\beta+\varepsilonε ∼ N( 0 , σ2яN)ε∼N(0,σ2In)\varepsilon \sim \mathcal N(0, \sigma^2I_n) Предположим, что мы выполняем регрессию гребня, добавляя одинаковое небольшое количество ко всем элементам диагонали :ИксXX βR i D G E= [ X'Икс+ к я]- …

2
Как работает метод обратного преобразования?
Как работает метод инверсии? Скажем , у меня случайную выборку X1,X2,...,XnX1,X2,...,XnX_1,X_2,...,X_n с плотностью f(x;θ)=1θx(1−θ)θf(x;θ)=1θx(1−θ)θf(x;\theta)={1\over \theta} x^{(1-\theta)\over \theta} более 0&lt;x&lt;10&lt;x&lt;10<x<1и, следовательно, cdfFX(x)=x1/θFX(x)=x1/θF_X(x)=x^{1/\theta}на(0,1)(0,1)(0,1). Тогда методом обращения я получаю распределениеXXXкакF−1X(u)=uθFX−1(u)=uθF_X^{-1}(u)=u^\theta. Так есть ли uθuθu^\theta распределение XXX ? Так работает метод инверсии? u&lt;-runif(n) x&lt;-u^(theta)

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.