Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как реализовать регуляризацию L2 к произвольной точке в пространстве?
Вот что я прочитал в книге Яна Гудфеллоу « Глубокое обучение» . В контексте нейронных сетей «штраф за норму параметра L2 обычно известен как затухание веса. Эта стратегия регуляризации приближает веса к началу координат [...]. В более общем смысле, мы могли бы упорядочить параметры, чтобы они были вблизи любой конкретной …

3
Почему в фильтре Калмана вероятность вычисляется с использованием результатов фильтра, а не сглаженных результатов?
Я использую фильтр Калмана очень стандартным способом. Система представлена ​​уравнением состояния xt+1=Fxt+vt+1xt+1=Fxt+vt+1x_{t+1}=Fx_{t}+v_{t+1} и уравнением наблюдения yt=Hxt+Azt+wtyt=Hxt+Azt+wty_{t}=Hx_{t}+Az_{t}+w_{t} . Учебники учат , что после применения фильтра Калмана и получать «прогнозы на один шаг x^t|t−1x^t|t−1\hat{x}_{t|t-1} (или «отфильтрованная оценка»), мы должны использовать их для вычисления функции правдоподобия: fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp⁡{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}f_{y_{t}|\mathcal{I}_{t-1},z_{t}}\left(y_{t}|\mathcal{I}_{t-1},z_{t}\right)=\det\left[2\pi\left(HP_{t|t-1}H^{\prime}+R\right)\right]^{-\frac{1}{2}}\exp\left\{ -\frac{1}{2}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)^{\prime}\left(HP_{t|t-1}H^{\prime}+R\right)^{-1}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)\right\} Мой вопрос: почему функция правдоподобия …

4
Искусственные нейронные сети, эквивалентные линейной регрессии с полиномиальными признаками?
Я хочу улучшить свое понимание нейронных сетей и их преимуществ по сравнению с другими алгоритмами машинного обучения. Мое понимание, как показано ниже, и мой вопрос: Можете ли вы исправить и дополнить мое понимание, пожалуйста? :) Мое понимание: (1) Искусственные нейронные сети = функция, которая предсказывает выходные значения из входных значений. …

2
Является ли коэффициент ошибок выпуклой функцией лямбда-параметра регуляризации?
При выборе параметра регуляризации лямбда в Ridge или Lasso рекомендуется использовать разные значения лямбды, измерить ошибку в наборе валидации и, наконец, выбрать то значение лямбды, которое возвращает наименьшую ошибку. Мне не понятно, если функция f (лямбда) = error является выпуклой. Может ли быть так? Т.е. эта кривая может иметь более …

4
Корреляция между X и XY
Если у меня есть две независимые случайные величины X и Y, какова корреляция между X и произведением XY? Если это неизвестно, мне было бы интересно узнать, по крайней мере, что происходит в конкретном случае, когда X и Y нормальны с нулевым средним, если это легче решить.

5
Почему мы отвергаем нулевую гипотезу на уровне 0,05, а не на уровне 0,5 (как мы делаем в классификации)
Проверка гипотез сродни проблеме классификации. Так, скажем, у нас есть 2 возможных ярлыка для наблюдения (субъекта) - Виновен против Не виновен. Пусть Non-Guilty будет нулевой гипотезой. Если бы мы рассматривали проблему с точки зрения классификации, мы бы обучали классификатор, который предсказывал бы вероятность принадлежности субъекта к каждому из 2 классов …

5
Показывает, что оценщик OLS является масштабно-эквивалентным?
У меня нет формального определения масштабной эквивалентности, но вот что говорит об этом « Введение в статистическое обучение» на стр. 217: Стандартные коэффициенты наименьших квадратов ... являются масштабно-эквивалентными : умножение XjXjX_j на константу ccc просто приводит к масштабированию оценок коэффициента наименьших квадратов с коэффициентом 1/c1/c1/c . Для простоты предположим, что …

5
Как создать последовательность
Я знаю, как создать последовательность со средним значением . Например, в Matlab, если я хочу сгенерировать последовательность длиной , это:0 ± 1 10000± 1±1\pm 1000± 1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 Тем не менее, как создать последовательность со средним значением , то есть с будучи слегка предпочтительным?0,05 1± 1±1\pm 10,050.050.05111

2
Является ли разделение данных на тестовые и обучающие наборы чисто статистическими данными?
Я студент-физик, изучающий машинное обучение / науку о данных, поэтому я не хочу, чтобы этот вопрос вызвал какие-либо конфликты :) Однако большая часть любой программы по физике для студентов-физиков - это проведение лабораторных работ / экспериментов, что означает много данных. обработка и статистический анализ. Тем не менее, я замечаю резкую …

2
Взаимная информация как вероятность
Может ли взаимная информация по совместной энтропии: 0 ≤ I( Х, Y)ЧАС( Х, Y)≤ 10≤я(Икс,Y)ЧАС(Икс,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 быть определено как: «вероятность передачи части информации от X до Y»? Прошу прощения за наивность, но я никогда не изучал теорию информации, и я просто пытаюсь понять некоторые концепции этого.

1
Байесовский шип и плита против наказанных методов
Я читаю слайды Стивена Скотта о пакете BSTS R (Вы можете найти их здесь: слайды ). В какой-то момент, говоря о включении многих регрессоров в модель структурных временных рядов, он вводит априорные и контрольные значения коэффициентов регрессии и говорит, что они лучше по сравнению с штрафными методами. Скотт говорит, ссылаясь …

1
Что вы будете делать, если ваши степени свободы пройдут конец ваших столов?
Степени свободы в моей F-таблице недостаточно высоки для моей большой выборки. Например, если у меня есть F с 5 и 6744 степенями свободы, как мне найти 5% критическое значение для ANOVA? Что если бы я делал тест хи-квадрат с большими степенями свободы? [Подобный вопрос был опубликован некоторое время назад, но …

1
RandomForest и веса классов
Вопрос в одном предложении: знает ли кто-нибудь, как определить вес хорошего класса для случайного леса? Пояснение: я играю с несбалансированными наборами данных. Я хочу использовать этот Rпакет randomForest, чтобы обучить модель очень искаженному набору данных, используя только небольшие положительные примеры и множество отрицательных примеров. Я знаю, что есть и другие …
11 r  random-forest 

1
Почему Netflix переключился бы со своей пятизвездочной рейтинговой системы на систему «нравится / не нравится»?
Netflix использовал свои предложения на основе предоставленных пользователем оценок других фильмов / шоу. Эта рейтинговая система имела пять звезд. Теперь Netflix позволяет пользователям нравится / не нравится (большие пальцы вверх / вниз) фильмы / шоу. Они утверждают, что фильмы легче оценивать. Разве эта двухсторонняя классификация не будет статистически менее предсказательной, …

2
Должен ли я сообщать о незначительных результатах?
Я провел тест Крускала Уоллиса, и для некоторых вопросов значение p не является значимым. Могу ли я сообщить об этом таким же образом, как если бы он был значительным, указав df, тестовую статистику и p-значение? Таким образом, было бы что-то вроде этого, был проведен тест Крускала Уоллиса, но было обнаружено, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.