Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Связь между лассо
Этот вопрос может быть глупым, но я заметил, что есть две различные формулировки регрессии Лассо . Мы знаем, что проблема Лассо состоит в том, чтобы минимизировать цель, состоящую из квадрата потерь и штрафного члена -1, выраженного следующим образом: LLLminβ∥y−Xβ∥22+λ∥β∥1minβ‖y−Xβ‖22+λ‖β‖1 \min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 \; Но часто …
9 lasso 

1
Выбор приоров на основе погрешности измерения
Как вы рассчитываете соответствующий априор, если у вас есть ошибка измерения прибора? Этот абзац взят из книги Кресси «Статистика пространственно-временных данных»: Часто бывает так, что имеется некоторая предварительная информация, касающаяся дисперсии ошибки измерения, что позволяет указать довольно информативную модель параметров. Например, если мы предполагаем условно независимые ошибки измерения, например, , …

1
Разве отрицательный бином не выражен, как в экспоненциальном семействе, если есть 2 неизвестных?
У меня было домашнее задание, чтобы выразить отрицательное биномиальное распределение как экспоненциальное семейство распределений, учитывая, что параметр дисперсии был известной константой. Это было довольно легко, но я удивлялся, почему они требуют, чтобы мы держали этот параметр фиксированным. Я обнаружил, что не могу придумать способ привести его в правильную форму с …

2
Как создается график «Соединенные Штаты Reddit»?
Ниже приведен график из р. 202 из Dataclysm Кристиана Руддера , хотя это было сделано Джеймсом Доуделлом. Он иллюстрирует отношения между различными 200 верхними подразделами, которые представляют интерес на reddit.com, где пользователи могут отправлять ссылки, комментарии и голоса. Это похоже на теги на этом сайте. Размер субреддитных регионов отражает их …

1
Наблюдаемая информация Фишера при преобразовании
θ↦g(θ)=ψθ↦g(θ)=ψ\theta\mapsto g(\theta)=\psiг L * ( ψ ) = L ( г - 1 ( ψ ) ) θ г Я * ( г ( θ ) ) = Я ( θ ) | ∂ г ( θ )L∗(ψ)=max{θ:g(θ)=ψ}L(θ)L∗(ψ)=max{θ:g(θ)=ψ}L(θ) L^*(\psi)=\max_{\{\theta:g(\theta)=\psi\}} L(\theta) gggL∗(ψ)=L(g−1(ψ))L∗(ψ)=L(g−1(ψ))L^*(\psi)=L(g^{-1}(\psi))θθ\thetagggI∗(g(θ^))=I(θ^)∣∣∣∣∂g(θ^)∂θ^∣∣∣∣−2,I∗(g(θ^))=I(θ^)|∂g(θ^)∂θ^|−2, I^*(g(\hat{\theta}))=I(\hat{\theta})\left|\frac{\partial g(\hat{\theta})}{\partial \hat{\theta}}\right|^{-2}, где - наблюдаемая информация Фишера, а …

1
Оценка количества шаров путем последовательного выбора шара и его маркировки
Допустим, у меня в сумке N шаров. На моем первом розыгрыше я отмечаю мяч и помещаю его в сумку. Во время второго розыгрыша, если я беру отмеченный мяч, я возвращаю его в сумку. Однако, если я беру безымянный шарик, я отмечаю его и возвращаю в сумку. Я продолжаю это для …

1
Тесты перестановки: критерии выбора статистики теста
Я регулярно использую тесты перестановок и люблю их простоту. Больше всего я узнал из книги Good о методах пересэмплирования, в которой автор, кажется, весьма креативен в выборе статистики тестов во всех примерах. Также этот пост создает впечатление, что существует большая свобода выбора статистики теста. Мне интересно , есть ли теоретические …

2
Как оценить качество пригодности для жизненных функций
Я новичок в анализе выживания, хотя у меня есть некоторые знания в области классификации и регрессии. Для регрессии мы имеем статистику MSE и R square. Но как мы можем сказать, что модель выживания A превосходит модель выживания B помимо каких-то графических графиков (кривая КМ)? Если возможно, объясните разницу с примером …

1
Регрессия с очень маленьким размером выборки
Я хочу провести регрессию с 4-5 пояснительными переменными, но у меня есть только 15 наблюдений. Не имея возможности предположить, что эти переменные нормально распределены, существует ли непараметрический или какой-либо другой действительный метод регрессии?

1
Метод опроса по личным вопросам
Мой друг-статистик рассказал мне об интересной методике, используемой для получения честных ответов на опросы, посвященные деликатным вопросам. Я вспоминаю общую суть метода, но мне интересно, знает ли кто-нибудь подробности и упоминается ли он где-нибудь. История состояла в том, что АМА во Флориде хотела оценить употребление наркотиков среди врачей. Они разослали …

3
Тест, чтобы отличить периодические от почти периодических данных
Предположим, у меня есть некоторая неизвестная функция fff с областью , которую я знаю для выполнения некоторых разумных условий, таких как непрерывность. Я знаю точные значения f (потому что данные получены в результате моделирования) в некоторых равноотстоящих точках выборки t_i = t_0 + iΔt с i∈ \ {1,…, n \} …

2
Как доказать правильность предположения о многообразии?
В машинном обучении часто предполагается, что набор данных лежит на гладком низкоразмерном многообразии (предположение о многообразии), но есть ли способ доказать, что при условии выполнения определенных условий набор данных действительно (приблизительно) генерируется из низкоразмерного гладкого многообразия? Например, учитывая последовательность данных где (скажем, последовательность изображений лиц с разными углами) и соответствующая …

2
Визуально суммируя беспорядок направленных отрезков
У меня есть набор данных миллионов направленных отрезков. Сегменты линии последовательны - это климатическая переменная (ощутимая жара) с наблюдаемыми и моделируемыми значениями с получасовыми интервалами. Я пытаюсь найти шаблоны в том, как выполняется симуляция. Я смотрю на график разброса значений obs против симуляции и связываю их с отрезками линии (стрелки …

4
Насколько полезен Minitab в реальном мире? [закрыто]
Закрыто . Этот вопрос основан на мнении . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы ответить на него фактами и цитатами, отредактировав этот пост . Закрыто 5 лет назад . В настоящее время я студент-статистик в рамках очень хорошей программы. Мы используем Minitab …
9 sas  minitab 

4
Расчет точности прогноза
Мы используем STL (R реализация) для прогнозирования данных временных рядов. Каждый день мы запускаем ежедневные прогнозы. Мы хотели бы сравнить прогнозные значения с реальными значениями и определить среднее отклонение. Например, мы запустили прогноз на завтра и получили прогнозные баллы, мы хотели бы сравнить эти прогнозные баллы с реальными данными, которые …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.