Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Обращение преобразования Фурье для распределения Фишера
Характерная функция распределения Фишера : где является сливающейся гипергеометрической функцией . Я пытаюсь решить обратное преобразование Фурье из -свертки , чтобы восстановить плотность переменной , то есть: с целью получения распределения суммыC ( t ) = Γ ( α + 1F( 1 , α )F(1,α)\mathcal{F}(1,\alpha)UF-1т,xnxF-1т,x(C(t)n)nα=3n=2n=2С( t ) = Γ ( …

2
Последствия моделирования нестационарного процесса с использованием ARMA?
Я понимаю, что мы должны использовать ARIMA для моделирования нестационарных временных рядов. Кроме того, все, что я читаю, говорит, что ARMA следует использовать только для стационарных временных рядов. Я пытаюсь понять, что происходит на практике при неправильной классификации модели и предположении, что d = 0для временного ряда она нестационарна? Например: …

5
Теперь, когда я отверг нулевую гипотезу, что дальше?
Я снова и снова отказывался или не мог отклонить нулевую гипотезу. В случае отказа от отклонения дела вы заключаете, что нет достаточных доказательств для отклонения, и вы «продолжаете» (т. Е. Либо собираете больше данных, заканчиваете эксперимент и т. Д.) Но когда вы «делаете» отвергаете нулевую гипотезу, предоставляя некоторые доказательства альтернативной …

1
Является ли априорный анализ мощности по существу бесполезным?
На прошлой неделе я присутствовал на собрании Общества личностной и социальной психологии, где увидел выступление Ури Симонсона, в котором говорилось, что использование априорного анализа мощности для определения размера выборки по существу бесполезно, поскольку его результаты настолько чувствительны к предположениям. Конечно, это утверждение противоречит тому, чему меня учили на уроках методики, …

1
Перекрестная проверка (CV) и обобщенная статистика перекрестной проверки (GCV)
Я обнаружил, возможно, противоречивые определения для статистики перекрестной проверки (CV) и для статистики обобщенной перекрестной проверки (GCV), связанной с линейной моделью (с нормальным гомоскедастическим вектором ошибок ).εY=Xβ+εY=Xβ+εY = X\boldsymbol\beta + \boldsymbol\varepsilonεε\boldsymbol\varepsilon С одной стороны, Голуб, Хит и Вахба определяют оценку GCV как (стр. 216)λ^λ^\hat{\lambda} минимизатор заданный где A \ left …

2
CHAID против CRT (или CART)
Я выполняю классификацию дерева решений с использованием SPSS для набора данных, содержащего около 20 предикторов (категориальных с несколькими категориями). CHAID (автоматическое обнаружение взаимодействия по критерию хи-квадрат) и CRT / CART (деревья классификации и регрессии) дают мне разные деревья. Кто-нибудь может объяснить относительные преимущества CHAID против CRT? Каковы последствия использования одного …
23 spss  cart 

2
Стабильность темы в моделях темы
Я работаю над проектом, в котором я хочу извлечь некоторую информацию о содержании серии открытых эссе. В этом конкретном проекте 148 человек написали эссе о гипотетической организации студентов в рамках более крупного эксперимента. Хотя в моей области (социальная психология) типичным способом анализа этих данных было бы ручное кодирование эссе, я …


2
Байесовский средний уровень до
Я хотел задать вопрос, вдохновленный превосходным ответом на вопрос об интуиции для бета-дистрибутива. Я хотел лучше понять происхождение предыдущего распределения среднего значения. Похоже, что Дэвид отклоняет параметры от среднего значения и диапазона. В предположении, что среднее значение равно 0,270.270.27 а стандартное отклонение равно 0,180.180.18 , вы можете отказаться от αα\alpha …
23 bayesian  prior 

4
Что не так с (некоторыми) псевдослучайностью
Я наткнулся на исследование, в котором пациенты старше 50 лет были псевдослучайными по годам рождения. Если год рождения был четным числом, обычная помощь, если нечетное число, вмешательство. Его легче реализовать, его сложнее подорвать (легко проверить, какое лечение должен был получить пациент), его легко запомнить (задание продолжалось несколько лет). Но все …

3
Студент т как смесь гауссов
Используя t-распределение Стьюдента с k>0k>0k > 0 степенями свободы, параметр местоположения и параметр шкалы имеют плотностьсlllsss Γ(k+12)Γ(k2kπs2−−−−√){1+k−1(x−ls)}−(k+1)/2,Γ(k+12)Γ(k2kπs2){1+k−1(x−ls)}−(k+1)/2,\frac{\Gamma \left(\frac{k+1}{2}\right)}{\Gamma\left(\frac{k}{2}\sqrt{k \pi s^2}\right)} \left\{ 1 + k^{-1}\left( \frac{x-l}{s}\right)\right\}^{-(k+1)/2}, как показать, что распределение Стьюдента может быть записано как смесь гауссовских распределений, если , , и интегрирование плотности соединения чтобы получить предельную плотность ? Каковы …

2
Как справиться с разницей между распределением тестового набора и обучающего набора?
Я думаю, что одно из основных предположений о машинном обучении или оценке параметров заключается в том, что невидимые данные поступают из того же распределения, что и обучающий набор. Однако в некоторых практических случаях распределение тестового набора будет практически отличаться от учебного набора. Скажем, для крупномасштабной задачи мульти-классификации, которая пытается классифицировать …

4
Существует ли реализация Random Forest, которая хорошо работает с очень разреженными данными?
Существует ли реализация случайного леса R, которая хорошо работает с очень разреженными данными? У меня есть тысячи или миллионы логических входных переменных, но только сотни или около того будут ИСТИНА для любого данного примера. Я относительно новичок в R и заметил, что существует пакет Matrix для работы с разреженными данными, …

4
Как рассчитать совокупное распределение в R?
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Мне нужно рассчитать интегральную функцию распределения выборки данных. Есть ли что-то похожее на hist () в R, которое измеряет функцию кумулятивной плотности? …
23 r  distributions  cdf 

2
Scatterplot с контурным / тепловым наложением
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Я видел этот график в дополнении к недавней статье, и я хотел бы иметь возможность воспроизвести его, используя R. Это точечная диаграмма, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.