Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Как извлечь информацию из матрицы графика рассеяния, когда у вас большое N, дискретные данные и много переменных?
Я играю с набором данных о раке молочной железы и создал диаграмму рассеяния всех атрибутов, чтобы понять, какие из них оказывают наибольшее влияние на предсказание класса malignant(синий) benign(красный). Я понимаю, что строка представляет ось x, а столбец представляет ось y, но я не вижу, какие наблюдения я могу сделать относительно …

1
Байесглм (арм) против MCMCpack
Как bayesglm()(в пакете arm R), так и различные функции в пакете MCMCpack нацелены на байесовскую оценку обобщенных линейных моделей, но я не уверен, что они фактически вычисляют одно и то же. Функции MCMCpack используют цепочку Маркова Монте-Карло для получения (зависимой) выборки из задней точки соединения для параметров модели. bayesglm()с другой …

2
Выход Scikit SVM в мультиклассовой классификации всегда дает одинаковую метку
В настоящее время я использую Scikit Learn со следующим кодом: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') а затем подгонка и прогнозирование для набора данных с 7 различными метками. Я получил странный вывод. Независимо от того, какой метод перекрестной проверки я использую, предсказанная метка в наборе валидации всегда будет …

1
Согласованность 2SLS с двоичной эндогенной переменной
Я читал, что оценка 2SLS по-прежнему соответствует даже двоичной эндогенной переменной ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). На первом этапе вместо линейной модели будет запущена пробная модель лечения. Существуют ли какие-либо формальные доказательства, подтверждающие, что 2SLS по-прежнему непротиворечив, даже если 1-й этап представляет собой модель пробит или логит? И что делать, если результат …

2
Регрессия с обратной независимой переменной
Предположим, у меня есть вектор зависимых переменных и вектор независимой переменной. Когда отображается на графике , я вижу, что между ними существует линейная зависимость (восходящая тенденция). Теперь это также означает, что между и существует линейная тенденция к снижению .NNNYYYNNNXXXYYY1X1X\frac{1}{X}YYYXXX Теперь, если я запускаю регрессию: и получаю подходящее значениеY=β∗X+ϵY=β∗X+ϵY = \beta …

2
Как определить прогнозируемость временных рядов?
Один из важных вопросов, с которыми сталкиваются синоптики, заключается в том, можно ли прогнозировать данную серию или нет? Я наткнулся на статью Питера Кэтта « Энтропия как априорный показатель прогнозируемости », в которой в качестве относительной меры для определения заданного временного ряда используется приблизительная энтропия (ApEn) . В статье говорится, …

1
Оценка максимального правдоподобия для минимума экспоненциальных распределений
Я застрял на том, как решить эту проблему. Итак, у нас есть две последовательности случайных величин: и для . Теперь и являются независимыми экспоненциальными распределениями с параметрами и . Однако, вместо того, чтобы наблюдать и , мы видим вместо и .Y я я = 1 , . , , , …

1
Запутался в визуальном объяснении собственных векторов: как визуально разные наборы данных могут иметь одинаковые собственные векторы?
Многие учебники статистики предоставляют интуитивно понятную иллюстрацию того, каковы собственные векторы ковариационной матрицы: Векторы u и z образуют собственные векторы (ну, собственные оси). Это имеет смысл. Но меня смущает то, что мы извлекаем собственные векторы из корреляционной матрицы, а не необработанные данные. Кроме того, исходные наборы данных, которые весьма различны, …

2
Остаточная диагностика и однородность дисперсий в линейной смешанной модели
Прежде чем задать этот вопрос, я сделал поиск наш сайт и нашел много подобных вопросов, (например , здесь , здесь и здесь ). Но я чувствую, что эти смежные вопросы не получили должного ответа или обсуждения, поэтому я хотел бы снова поднять этот вопрос. Я чувствую, что должно быть большое …

3
K-среднее по косинусу сходства против евклидова расстояния (LSA)
Я использую скрытый семантический анализ для представления совокупности документов в пространстве меньшего размера. Я хочу сгруппировать эти документы в две группы с помощью k-средних. Несколько лет назад я сделал это с помощью gensim Python и написал свой собственный алгоритм k-средних. Я определил кластерные центроиды, используя евклидово расстояние, но затем сгруппировал …

2
Пример двух * коррелированных * нормальных переменных, сумма которых не является нормальной
Я знаю несколько хороших примеров пар коррелированных случайных величин, которые незначительно нормальны, но не в совокупности нормальны. Смотрите этот ответ на Дилип Sarwate , и этот по кардиналу . Мне также известен пример двух нормальных случайных величин, сумма которых не является нормальной. Смотрите этот ответ по Макро . Но в …

1
Можно ли статистически показать, что автомобили используются в качестве орудия убийства?
Недавно я услышал историю, в которой кто-то сказал, что если они хотят кого-то убить (и сойти с рук), они сделают это на своей машине. Они приводили различные статистические данные о количестве смертей, связанных с автомобилями (в том числе автомобилей на пешеходах), а также дополнительные статистические данные о количестве водителей, фактически …

1
Коэффициент внутриклассовой корреляции в смешанной модели со случайными наклонами
У меня есть следующие модели m_plotснабжены lme4::lmerсо скрещенными случайными эффектами для участников ( lfdn) и элементов ( content): Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 inference3 21.295 4.615 -0.03 0.22 0.86 …

2
Как выбрать размеры набора для обучения, перекрестной проверки и тестирования для данных небольшого размера?
Предположим, у меня небольшой размер выборки, например, N = 100, и два класса. Как выбрать размеры обучения, перекрестной проверки и тестового набора для машинного обучения? Я бы интуитивно выбрал Размер тренировочного набора 50 Размер набора для перекрестной проверки 25, и Размер теста как 25. Но, вероятно, это имеет более или …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.