Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Максимальное значение коэффициента вариации для ограниченного набора данных
В ходе дискуссии после недавнего вопроса о том, может ли стандартное отклонение превышать среднее значение, один вопрос был поднят кратко, но так и не получил полного ответа. Поэтому я спрашиваю это здесь. Рассмотрим набор из неотрицательных чисел где для . Не требуется, чтобы x_i был отличным, то есть набор мог …


3
Зависящие от времени коэффициенты в R - как это сделать?
Обновление : Извините за другое обновление, но я нашел несколько возможных решений с дробными полиномами и конкурирующим пакетом риска, с которым мне нужна помощь. Проблема Я не могу найти простой способ сделать зависящий от времени анализ коэффициентов в R. Я хочу иметь возможность взять мой коэффициент переменных и превратить его …

5
Всегда ли среднее значение одномерной случайной величины равно интегралу ее квантильной функции?
Я только что заметил, что интеграция квантовой функции одномерной случайной величины (обратной cdf) от p = 0 до p = 1 дает среднее значение переменной. Я не слышал об этих отношениях до сих пор, поэтому мне интересно: это всегда так? Если так, широко ли известны эти отношения? Вот пример в …

2
В чем разница между «проверкой гипотезы» и «проверкой значимости»?
Есть ли разница между фразами «проверка гипотезы» и «проверка значимости» или они одинаковы? После подробного ответа от @Micheal Lew у меня возникла путаница, что в настоящее время гипотеза (например, t-критерий для проверки среднего) является примером «проверки значимости» или «проверки гипотез»? Или это комбинация обоих? Как бы вы их дифференцировали на …

2
Как вы пишете Тьюки post-hoc результаты?
Как правильно написать специальный результат Tukey? Есть несколько примеров с разными результатами? Скажем, у вас есть Север, Юг, Восток и Запад. North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 SD=3.6 std …

1
Свойства логистических регрессий
Мы работаем с некоторыми логистическими регрессиями, и мы поняли, что средняя оценочная вероятность всегда равна доле вероятностей в выборке; то есть среднее значение подгонянных значений равно среднему значению по выборке. Кто-нибудь может объяснить мне причину или дать ссылку, где я могу найти эту демонстрацию?

4
«Нормализующие» переменные для SVD / PCA
Предположим, у нас есть NNN измеримых переменных (a1,a2,…,aN)(a1,a2,...,aN)(a_1, a_2, \ldots, a_N) , мы выполняем ряд измерений M>NM>NM > N , а затем хотим выполнить разложение по сингулярным значениям результатов, чтобы найти оси наибольшей дисперсии для MMM точек в NNN мерном пространстве. ( Примечание: предположим , что средства я уже вычитали, …

2
Как я могу использовать логистическую регрессию бета-версии + необработанные данные, чтобы получить вероятности
У меня есть модель (из литературы). У меня также есть необработанные данные для прогнозирующих переменных. Какое уравнение я должен использовать, чтобы получить вероятности? Как мне объединить необработанные данные и коэффициенты, чтобы получить вероятности?

2
Модель выживания для прогнозирования оттока - изменяющиеся во времени предикторы?
Я рассчитываю построить прогностическую модель для прогнозирования оттока и использовать модель выживания с дискретным временем, адаптированную к набору данных за период человека (одна строка для каждого клиента и дискретный период, в котором они находились под угрозой, с показателем для события - равным 1 если отток произошел в тот период, иначе …

5
Может ли очистка данных ухудшить результаты статистического анализа?
Увеличение числа случаев и смертей происходит во время эпидемий (внезапное увеличение числа) из-за циркуляции вируса (например, вируса Западного Нила в США в 2002 г.) или из-за снижения устойчивости людей или загрязнения пищи или воды или увеличения числа комары. Эти эпидемии будут представлены как выбросы, которые могут происходить каждые 1-5 лет. …

1
Как создать цветные таблицы с помощью Sweave и Xtable? [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 2 года назад . Я использую Sweave и Xtable для создания отчета. Я хотел бы добавить немного раскраски на стол. Но мне не удалось …


3
Анализ основных компонентов «в обратном направлении»: насколько дисперсия данных объясняется заданной линейной комбинацией переменных?
Я провел анализ главных компонентов шести переменных , B , C , D , E и F . Если я правильно понимаю, необращенный ПК1 говорит мне, какая линейная комбинация этих переменных описывает / объясняет наибольшую дисперсию в данных, а ПК2 говорит мне, какая линейная комбинация этих переменных описывает следующую наибольшую …

2
Является ли «каждый синий футболка» систематическим образцом?
Я преподаю вводный класс статистики и изучал типы выборки, в том числе систематическую выборку, где вы выбираете каждую k-ю особь или объект. Студент спросил, будет ли выборка каждого человека с определенной характеристикой выполнять то же самое. Например, будет ли выборка каждого человека с синей футболкой достаточно случайной и достаточно ли …
17 sampling 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.