Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Взвешенный анализ основных компонентов
После некоторого поиска я обнаружил, что очень мало учитываю веса наблюдений / погрешности измерений в анализе основных компонентов. То, что я нахожу, имеет тенденцию полагаться на итеративные подходы для включения весов (например, здесь ). Мой вопрос: зачем нужен этот подход? Почему мы не можем использовать собственные векторы взвешенной ковариационной матрицы?

3
Ненулевая корреляция подразумевает зависимость?
Мы знаем о том факте, что нулевая корреляция не означает независимость. Меня интересует, подразумевает ли ненулевая корреляция зависимость - то есть, если для некоторых случайных величин и , можем ли мы вообще сказать, что ?X Y f X , Y ( x , y ) ≠ f X ( x …

3
Генерация случайных чисел после распределения в пределах интервала
Мне нужно генерировать случайные числа после нормального распределения в пределах интервала . (Я работаю в Р.)(a,b)(a,b)(a,b) Я знаю, что функция rnorm(n,mean,sd)будет генерировать случайные числа после нормального распределения, но как установить пределы интервала в этом? Для этого есть какие-то особые функции R?

3
Почему бы не использовать T-распределение для оценки среднего значения при большой выборке?
Курсы по базовой статистике часто предлагают использовать нормальное распределение для оценки среднего значения параметра совокупности, когда размер выборки n велик (обычно более 30 или 50). T-распределение Стьюдента используется для выборок меньшего размера, чтобы учесть неопределенность в стандартном отклонении выборки. Когда размер выборки велик, стандартное отклонение выборки дает хорошую информацию о …

3
Реальные примеры корреляции путают с причинностью
Я ищу конкретные, реальные случаи, в которых причинно-следственная связь была ненадлежащим образом выведена из доказательств корреляции. В частности, меня интересуют примеры, которые соответствуют следующим критериям: Существование причинно-следственной связи было воспринято как факт достаточно широко, чтобы иметь заметные последствия (для государственной политики, дискурса, индивидуальных решений и т. Д.). Связь была выведена …

3
Содержат ли pdf, pmf и cdf одну и ту же информацию?
Содержат ли pdf, pmf и cdf одну и ту же информацию? Для меня pdf дает всю вероятность до определенной точки (в основном это область под вероятностью). PMF дает вероятность определенного момента. Cdf дает вероятность под определенным пунктом. Так что для меня pdf и cdf имеют одинаковую информацию, а pmf - …

3
Является ли ядро ​​PCA с линейным ядром эквивалентным стандартному PCA?
Если в ядре PCA я выберу линейное ядро , будет ли результат отличаться от обычного линейного PCA ? Решения принципиально отличаются или существует какое-то четко определенное отношение?K(x,y)=x⊤yK(x,y)=x⊤yK(\mathbf{x},\mathbf{y}) = \mathbf x^\top \mathbf y
17 pca  kernel-trick 

1
Поиск корней для стохастической функции
Предположим, у нас есть функция которую мы можем наблюдать только через некоторый шум. Мы не можем вычислить напрямую, только где - некоторый случайный шум. (На практике: я вычисляю используя метод Монте-Карло.)f(x)f(x)f(x)f(x)f(x)f(x)f(x)+ηf(x)+ηf(x) + \etaηη\etaf(x)f(x)f(x) Какие методы доступны для нахождения корней , то есть для вычисления так, чтобы ?fffxxxf(x)=0f(x)=0f(x) = 0 Я …

2
Может ли статистический тест вернуть значение p, равное нулю?
Я не имею в виду значение, близкое к нулю (округленное до нуля некоторым статистическим программным обеспечением), а скорее значение буквально равное нулю. Если это так, будет ли это означать, что вероятность получения полученных данных в предположении, что нулевая гипотеза верна, также равна нулю? Какие (некоторые примеры) статистических тестов могут дать …

2
Интерпретация порядковой логистической регрессии
Я провел эту порядковую логистическую регрессию в R: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) Я получил это резюме модели: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error t value 1|2 …

3
Является ли «тестовая статистика» значением или случайной величиной?
Сейчас я учусь на первом курсе по статистике. Меня смущает термин «тестовая статистика». В следующем (я видел это в некоторых учебниках), похоже, является конкретным значением, рассчитанным по конкретному образцу. TTtт = х¯¯¯- μ0з / п--√Tзнак равноИкс¯-μ0s/N t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Однако в следующем (я видел это в некоторых других …

1
Подходит ли значение R-квадрата для сравнения моделей?
Я пытаюсь определить лучшую модель для прогнозирования цен на автомобили, используя цены и функции, доступные на сайтах, рекламируемых автомобилями. Для этого я использовал пару моделей из библиотеки scikit-learn и модели нейронной сети из pybrain и neurolab. Подход, который я использовал до сих пор, состоит в том, чтобы прогонять фиксированный объем …

2
Два отрицательных основных эффекта, но положительный эффект взаимодействия?
У меня есть два основных эффекта, V1 и V2. Влияние V1 и V2 на переменные отклика отрицательное. Однако по какой-то причине я получаю положительный коэффициент для члена взаимодействия V1 * V2. Как я могу интерпретировать это? возможна ли такая ситуация?

9
Расчет индекса ранда
Я пытаюсь выяснить, как рассчитать индекс Рэнда кластерного алгоритма, но я застрял в точке, как рассчитать истинные и ложные отрицания. Сейчас я использую пример из книги «Введение в поиск информации» (Manning, Raghavan & Schütze, 2009). На странице 359 они говорят о том, как рассчитать индекс Рэнда. Для этого примера они …
17 clustering 

3
Статистический тест для двух распределений, где известно только 5-значное резюме
У меня есть два распределения, в которых известны только 5-значная сводка (минимум, 1-й квартиль, медиана, 3-й квартиль, максимум) и размер выборки. В связи с вопросом здесь , не все данные доступны. Существует ли какой-либо непараметрический статистический тест, который позволяет мне проверить, отличаются ли основные распределения этих двух? Благодарность!

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.