Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Достаточно ли р-значения 0,04993, чтобы отвергнуть нулевую гипотезу?
В тесте статистической значимости по Уилкоксона мы натолкнулись на некоторые данные, которые дают значение . С порогом этого результата достаточно, чтобы отвергнуть нулевую гипотезу, или безопаснее сказать, что тест был неубедительным, так как если мы округлим p-значение до 3 десятичных знаков, оно станет ?0,04993 р < 0,05 0,050ппp0,049930,049930.04993р < 0,05п<0,05p …

1
Сэндвич оценщик интуиции
Википедия и виньетка R-сэндвич-пакетов дают хорошую информацию о допущениях, подтверждающих стандартные ошибки коэффициента OLS, и математических основах сэндвич-оценок. Мне все еще неясно, как решается проблема гетероскедастичности остатков, возможно потому, что я не совсем понимаю стандартную оценку дисперсии коэффициентов OLS. Какова интуиция за сэндвич-оценщиком?

2
Коэффициенты подобия для двоичных данных: почему Жаккар предпочел Рассела и Рао?
Из энциклопедии статистических наук я понимаю, что, учитывая дихотомических (двоичных: 1 = присутствующих; 0 = отсутствующих) атрибутов (переменных), мы можем сформировать таблицу сопряженности для любых двух объектов i и j выборки:ппp j 1 0 ------- 1 | a | b | i ------- 0 | c | d | ------- …

2
EM алгоритм реализован вручную
Я хочу реализовать алгоритм EM вручную , а затем сравнить его с результатами normalmixEMиз mixtoolsпакета. Конечно, я был бы счастлив, если бы они оба привели к одинаковым результатам. Основное упоминание - Джеффри МакЛахлан (2000), Модели конечных смесей . У меня плотность смеси двух гауссианов, в общем виде, логарифмическая вероятность определяется …

3
Тест на линейную отделимость
Есть ли способ проверить линейную отделимость набора данных двух классов в больших измерениях? Мои векторные векторы 40-длинные. Я знаю, что всегда могу проводить эксперименты по логистической регрессии и определять скорость попадания в зависимости от частоты ложных тревог, чтобы определить, являются ли эти два класса линейно разделимыми или нет, но было …

3
Связь между метрикой Фишера и относительной энтропией
Может ли кто-то доказать следующую связь между информационной метрикой Фишера и относительной энтропией (или дивергенцией KL) чисто математически строгим образом? D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(∥da∥3)D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(‖da‖3)D( p(\cdot , a+da) \parallel p(\cdot,a) ) =\frac{1}{2} g_{i,j} \, da^i \, da^j + (O( \|da\|^3) где , g_ {i, j} = \ int \part_i (\ log p (x; a)) …

2
Можем ли мы увидеть форму нормальной кривой где-нибудь в природе?
Я не хочу знать, имеют ли некоторые явления в природе нормальное распределение, но можем ли мы где-нибудь увидеть форму нормальной кривой, как мы можем видеть это, например, в рамке Гальтона. Смотрите эту фигуру из Википедии. Обратите внимание, что многие математические формы или кривые непосредственно видны в природе, например, золотая середина …

1
Связаны ли случайные переменные тогда и только тогда, когда их ранги коррелированы?
Предположим, что - непрерывные случайные величины с конечными вторыми моментами. Популяционная версия рангового коэффициента корреляции Спирмена ρ_s может быть определена как коэффициент произведения-момента Пирсона ρ для интегралов вероятности F_X (X) и F_Y (Y) , где F_X, F_Y - это cdf для X и Y , т.е.Икс, YX,YX,YF X (X) F …

5
Алгоритм мотивации ожидания максимизации
В подходе EM-алгоритма мы используем неравенство Дженсена для получения logp(x|θ)≥∫logp(z,x|θ)p(z|x,θ(k))dz−∫logp(z|x,θ)p(z|x,θ(k))dzlog⁡p(x|θ)≥∫log⁡p(z,x|θ)p(z|x,θ(k))dz−∫log⁡p(z|x,θ)p(z|x,θ(k))dz\log p(x|\theta) \geq \int \log p(z,x|\theta) p(z|x,\theta^{(k)}) dz - \int \log p(z|x,\theta) p(z|x,\theta^{(k)})dz θ(k+1)θ(k+1)\theta^{(k+1)}θ(k+1)=argmaxθ∫logp(z,x|θ)p(z|x,θ(k))dzθ(k+1)=arg⁡maxθ∫log⁡p(z,x|θ)p(z|x,θ(k))dz\theta^{(k+1)}=\arg \max_{\theta}\int \log p(z,x|\theta) p(z|x,\theta^{(k)}) dz Все, что я читаю EM, просто сводит это на нет, но я всегда чувствовал себя неловко, не имея объяснения, почему алгоритм EM …

1
Предупреждение libsvm «достижение максимального числа итераций» и перекрестная проверка
Я использую libsvm в режиме C-SVC с полиномиальным ядром степени 2, и мне необходимо обучить несколько SVM. Каждый тренировочный набор имеет 10 функций и 5000 векторов. Во время обучения я получаю это предупреждение для большинства SVM, которые я тренирую: WARNING: reaching max number of iterations optimization finished, #iter = 10000000 …

4
Трансформация для увеличения эксцесса и асимметрии нормального течения
Я работаю над алгоритмом, который основан на том факте, что наблюдения s обычно распределяются, и я хотел бы проверить надежность алгоритма в этом предположении эмпирически.YYY Чтобы сделать это, я искал последовательность преобразований , которые постепенно разрушают нормальности . Например, если нормальны, они имеют асимметрию и kurtosis , и было бы …

4
Как работает распределение Пуассона при моделировании непрерывных данных и приводит ли это к потере информации?
Сотрудница анализирует некоторые биологические данные для своей диссертации с некоторой неприятной гетероскедастичностью (рисунок ниже). Она анализирует это по смешанной модели, но все еще имеет проблемы с остатками. Лог-преобразование переменных ответа проясняет ситуацию и на основе обратной связи по этому вопросу, похоже, является подходящим подходом. Первоначально, однако, мы думали, что существуют …

1
Почему обрезка не нужна для случайных лесных деревьев?
Брейман говорит, что деревья выращены без обрезки. Почему? Я хочу сказать, что должна быть веская причина, по которой деревья в случайном лесу не обрезаются. С другой стороны, считается очень важным обрезать единственное дерево решений, чтобы избежать перебора. Есть ли литература для чтения по этой причине? Конечно, деревья могут быть не …

5
Сопряженный и непарный t-тест
Предположим, у меня есть 20 мышей. Я так или иначе соединяю мышей, чтобы получить 10 пар. Для целей этого вопроса это может быть случайное спаривание, ИЛИ это может быть разумное спаривание, например, попытка спарить мышей одного и того же помета, одного пола, с одинаковым весом, ИЛИ это может быть намеренно …

3
Какие тесты я использую, чтобы подтвердить, что остатки нормально распределены?
У меня есть некоторые данные, которые выглядят из графика зависимости остатков от времени почти нормально, но я хочу быть уверен. Как я могу проверить нормальность ошибок?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.