Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Несколько вопросов о статистической случайности
Из статистической случайности Википедии : Глобальная случайность и локальная случайность различны. Большинство философских концепций случайности являются глобальными, потому что они основаны на идее, что «в долгосрочной перспективе» последовательность выглядит действительно случайной, даже если некоторые подпоследовательности не будут выглядеть случайными. Например, в «действительно» случайной последовательности чисел достаточной длины, вероятно, будут длинные …

1
Регрессия ошибок в переменных: допустимо ли объединение данных с трех сайтов?
Недавно ко мне пришел клиент, чтобы выполнить анализ начальной загрузки, потому что рецензент FDA сказал, что их регрессия ошибок в переменных была недействительной, потому что при объединении данных с сайтов анализ включал объединение данных с трех сайтов, где два сайта включали некоторые выборки, которые были то же самое. ФОН У …

5
Библиотека Java с открытым исходным кодом для статистики на уровне, предлагаемом курсом статистики выпускников
Я прохожу аспирантуру по прикладной статистике, в которой используется следующий учебник (чтобы дать вам представление об уровне освещаемого материала): Статистические концепции и методы , автор Г.К. Бхаттачарья и Р.А. Джонсон. Профессор требует от нас использовать SAS для домашних заданий. Мой вопрос заключается в следующем: есть ли библиотека (-ы) Java, которую …
15 r  sas  java 

11
Примеры процессов, которые не Пуассона?
Я ищу несколько хороших примеров ситуаций, которые не подходят для моделирования с распределением Пуассона, чтобы помочь мне объяснить распределение Пуассона студентам. В качестве примера, который можно смоделировать с помощью распределения Пуассона, обычно используют количество покупателей, приходящих в магазин за интервал времени. Я ищу контрпример в аналогичном ключе, то есть ситуацию, …

2
Среднее (баллы) против балла (конкатенации) в перекрестной проверке
TLDR: Мой набор данных довольно маленький (120) выборок. При выполнении 10-кратной перекрестной проверки я должен: Соберите выходные данные из каждого тестового сгиба, объедините их в вектор, а затем вычислите ошибку на этом полном векторе прогнозов (120 выборок)? Или я должен вместо этого вычислить ошибку на выходах, которые я получаю в …

3
Какие варианты в модели пропорциональной регрессии рисков, когда остатки Шенфельда не хороши?
Я делаю пропорциональную регрессию рисков Кокса в R, используя coxphмножество переменных. Остатки Мартингейла выглядят великолепно, а остатки Шенфельда отлично подходят для ПОЧТИ всех переменных. Есть три переменные, чьи остатки Шенфельда не плоские, и природа переменных такова, что имеет смысл, что они могут изменяться со временем. Это переменные, которые меня не …

3
Что такое смешивание данных?
Этот термин часто встречается в темах, связанных с методом . Является ли смешивание конкретным методом в интеллектуальном анализе данных и статистическом обучении? Я не могу получить соответствующий результат от Google. Кажется, смешивание смешивает результаты многих моделей и приводит к лучшему результату. Есть ли какой-нибудь ресурс, который поможет мне узнать больше …

2
Применим ли принцип безразличия к парадоксу Бореля-Колмогорова?
Рассмотрим решение Джейнса к парадоксу Бертрана с использованием принципа безразличия . Почему подобный аргумент не применим к парадоксу Бореля-Колмогорова ? Есть ли что-то не так с утверждением, что, поскольку проблема не определяет ориентацию сферы, вращение сферы не должно влиять на итоговое распределение, полученное выбранным ограничивающим процессом?
15 theory  paradox 

3
Либо квадратичный, либо член взаимодействия важен в изоляции, но ни один из них не вместе
В рамках задания мне нужно было дополнить модель двумя переменными предикторами. Затем мне пришлось нарисовать график остатков моделей по отношению к одному из включенных предикторов и внести изменения на основе этого. График показал криволинейную тенденцию, и поэтому я включил квадратный термин для этого предиктора. Новая модель показала значимость квадратичного члена. …

3
Автоматизированная процедура выбора подмножества точек данных с сильнейшей корреляцией?
Существует ли какая-либо стандартная процедура (такая, чтобы ее можно было назвать в качестве справочной) для выбора подмножества точек данных из большего пула с самой сильной корреляцией (только по двум измерениям)? Например, скажем, у вас есть 100 точек данных. Вам нужно подмножество из 40 точек с максимально возможной корреляцией по измерениям …

3
Определение и происхождение «перекрестной энтропии»
Не ссылаясь на источники, Википедия определяет кросс-энтропию дискретных распределений и Q какппPQQQ ЧАС×( P; Q )= - ∑Икср ( х )журналQ( Х ) .ЧАС×(п;Q)знак равно-ΣИксп(Икс)журнал⁡Q(Икс),\begin{align} \mathrm{H}^{\times}(P; Q) &= -\sum_x p(x)\, \log q(x). \end{align} Кто первым начал использовать это количество? И кто изобрел этот термин? Я посмотрел в: JE Shore и …

3
Путаница относительно того, когда использовать статистику против статистики
Я имел в виду эту видео-лекцию для расчета доверительного интервала . Однако у меня есть некоторая путаница. Этот парень использует -статистику для расчета. Тем не менее, я думаю, что это должна была быть статистика. Нам не дано истинное стандартное отклонение населения. Мы используем выборочное стандартное отклонение, чтобы оценить истинное.ZZzTTt Так …

2
Генерация трех коррелированных равномерно распределенных случайных величин
Предположим, у нас есть Икс1∼ униф ( n , 0 , 1 ) ,Икс1~UNIF(N,0,1),X_1 \sim \textrm{unif}(n,0,1), Икс2~ unif (n,0,1),Икс2~UNIF(N,0,1),X_2 \sim \textrm{unif}(n,0,1), где - равномерная случайная выборка размером n, иunif (n,0,1 )UNIF(N,0,1)\textrm{unif}(n,0,1) Y= Х1,Yзнак равноИкс1,Y=X_1, Z= 0,4 х1+ 1 - 0,4------√Икс2,Zзнак равно0,4Икс1+1-0,4Икс2,Z = 0.4 X_1 + \sqrt{1 - 0.4}X_2. Тогда корреляция …

1
Почему оценки коэффициента регрессии rlm () отличаются от lm () в R?
Я использую rlm в пакете R MASS для регрессии многомерной линейной модели. Это хорошо работает для ряда образцов, но я получаю квазинулевые коэффициенты для конкретной модели: Call: rlm(formula = Y ~ X1 + X2 + X3 + X4, data = mymodel, maxit = 50, na.action = na.omit) Residuals: Min 1Q …

4
Как узнать, честен ли онлайн покер-сайт?
На прошлой неделе у меня была интересная дискуссия с моим хорошим другом. Он играл в онлайн-покер и предположил, что есть какая-то связь между новой подпиской / дополнительным переводом денег и картами, которые вам сдаются, то есть вы получаете хорошие карты для зацепки. Сайты, вероятно, сильно рискуют, если это правда, но …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.