Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

8
Обилие значений Р при отсутствии гипотезы
Я в эпидемиологии. Я не статистика, но я пытаюсь выполнить анализ самостоятельно, хотя я часто сталкиваюсь с трудностями. Я сделал свой первый анализ около 2 лет назад. Значения P были включены повсеместно в мои анализы (я просто делал то, что делали другие исследователи) от описательных таблиц до регрессионного анализа. Постепенно …

3
Почему центрирование независимых переменных может изменить основные эффекты с помощью модерации?
У меня есть вопрос, связанный с множественной регрессией и взаимодействием, навеянный этой веткой резюме: термин взаимодействия, использующий центрированные переменные иерархический регрессионный анализ? Какие переменные мы должны центрировать? При проверке эффекта модерации я центрирую свои независимые переменные и умножаю центрированные переменные, чтобы вычислить срок моего взаимодействия. Затем я запускаю свой регрессионный …

4
Оценка для корреляции трех случайных величин
Есть три случайные величины, . Три корреляции между тремя переменными одинаковы. То есть,x,y,zx,y,zx,y,z ρ=cor(x,y)=cor(x,z)=cor(y,z)ρ=cor(x,y)=cor(x,z)=cor(y,z)\rho=\textrm{cor}(x,y)=\textrm{cor}(x,z)=\textrm{cor}(y,z) Какую самую тесную границу вы можете дать для ?ρρ\rho

1
Разница между стандартным и сферическим алгоритмами k-средних
Я хотел бы понять, в чем заключается основная разница между стандартными и сферическими алгоритмами кластеризации k-средних. На каждом шаге k-means вычисляет расстояния между векторами элементов и центроидами кластера и переназначает документ этому кластеру, центроид которого является ближайшим. Затем все центроиды пересчитываются. В сферических k-средних все векторы нормированы, а мера расстояния …

3
Как бороться с мультиколлинеарностью при выборе переменных?
У меня есть набор данных с 9 непрерывными независимыми переменными. Я пытаюсь выбрать среди этих переменных, чтобы подогнать модель к одной процентной (зависимой) переменной Score. К сожалению, я знаю, что между несколькими переменными будет серьезная коллинеарность. Я пытался использовать stepAIC()функцию в R для выбора переменных, но этот метод, как ни …

3
В чем разница между доверительными интервалами и проверкой гипотез?
Я читал о противоречиях относительно проверки гипотез с некоторыми комментаторами, предлагающими, чтобы проверка гипотез не использовалась. Некоторые комментаторы предлагают использовать вместо этого доверительные интервалы . В чем разница между доверительными интервалами и проверкой гипотез? Пояснения со ссылкой и примеры будут оценены.

3
Почему RSS распространяется через квадраты времени np?
Я хотел бы понять, почему в рамках модели OLS RSS (остаточная сумма квадратов) распределяется ( - это число параметров в модели, - количество наблюдений).χ2⋅(n−p)χ2⋅(n−p)\chi^2\cdot (n-p)pppnnn Я прошу прощения за то, что задал такой простой вопрос, но мне кажется, что я не могу найти ответ онлайн (или в моих, более ориентированных …

6
t-критерий для частично парных и частично непарных данных
Исследователь желает провести комбинированный анализ нескольких наборов данных. В некоторых наборах данных имеются парные наблюдения для лечения A и B. В других есть непарные данные A и / или B. Я ищу ссылку для адаптации t-критерия или критерия отношения правдоподобия для таких частично спаренных данных. Я готов (на данный момент) …

4
Какие факторы делают задние распределения трудно поддающимися лечению?
В байесовской статистике часто упоминается, что апостериорное распределение трудноразрешимо, и поэтому необходимо применять приблизительный вывод. Какие факторы вызывают эту неразрешимость?

4
Как сделать уменьшение размерности в R
У меня есть матрица, где a (i, j) говорит мне, сколько раз я просмотрел страницу j. Есть 27 тысяч человек и 95 тысяч страниц. Я хотел бы иметь несколько «измерений» или «аспектов» в пространстве страниц, которые соответствуют наборам страниц, которые часто просматриваются вместе. Моя конечная цель состоит в том, чтобы …

4
Как это возможно, что потери проверки увеличиваются, в то время как точность проверки также увеличивается
Я обучаю простую нейронную сеть на наборе данных CIFAR10. Через некоторое время потери валидации начали увеличиваться, а точность валидации также увеличивается. Потери и точность испытаний продолжают улучшаться. Как это возможно? Кажется, что если потери при проверке возрастают, точность должна уменьшаться. PS Есть несколько похожих вопросов, но никто не объяснил, что …

5
Почему средняя функция в гауссовском процессе неинтересна?
Я только начал читать о GP, и по аналогии с обычным распределением Гаусса оно характеризуется функцией среднего и ковариационной функцией или ядром. Я разговаривал, и оратор сказал, что средняя функция обычно неинтересна, и все усилия по выводу тратятся на оценку правильной ковариационной функции. Может кто-нибудь объяснить мне, почему так должно …

8
Ищете хорошую и полную книгу вероятностей и статистики
У меня никогда не было возможности посещать курсы по математике. Я ищу книгу по теории вероятностей и статистике, которая является полной и самодостаточной. Под полным я подразумеваю, что он содержит все доказательства, а не только результаты. Под самодостаточностью я подразумеваю, что я не обязан читать другую книгу, чтобы понимать книгу. …

7
В «Наивном байесовском», зачем беспокоиться о сглаживании Лапласа, когда в тестовом наборе есть неизвестные слова?
Я читал сегодня наивную байесовскую классификацию. Я прочитал под заголовком Оценка параметров с добавлением сглаживания 1 : Пусть ccc ссылается на класс (например, Positive или Negative), а указывает на токен или слово.www Оценка максимального правдоподобия для :P(w|c)P(w|c)P(w|c)count(w,c)count(c)=counts w in class ccounts of words in class c.count(w,c)count(c)=counts w in class ccounts …


Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.