Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

6
Мультиколлинеарность, когда отдельные регрессии значительны, но VIF низкие
У меня есть 6 переменных ( ), которые я использую для предсказания . При выполнении анализа данных я сначала попробовал множественную линейную регрессию. Из этого, только две переменные были значительными. Однако, когда я запустил линейную регрессию, сравнивая каждую переменную в отдельности с , все, кроме одного, были значимыми ( где-то …


2
Что стоит на пути использования импульсных нейронных сетей в приложениях?
Импульсные или всплесковые нейронные сети включают в себя больше мембранной динамики биологических нейронов, где импульсы переносят информацию на следующий уровень. Нейроны не обязательно должны «выстреливать» все одновременно, как, например, в бэкпропе. Тем не менее, по-видимому, существуют препятствия для использования этих моделей для задач машинного обучения. Какие конкретные проблемы стоят на …

2
Филогенетически зависимые переменные: ANOVA?
Я понимаю, как получить ковариационную матрицу из филогенетических данных, чтобы сделать для двух переменных, по которым вы делаете регрессию. Но что произойдет, если у вас есть одна непрерывная переменная, которую вы ранее показали зависимой от филогении, и одна порядковая переменная? Последнее является порядковым, я не уверен, как это соотнести с …
13 anova  phylogeny 

2
При чем n-граммы становятся контрпродуктивными?
При обработке на естественном языке можно взять корпус и оценить вероятность появления следующего слова в последовательности из n. n обычно выбирается как 2 или 3 (биграммы и триграммы). Есть ли известная точка, в которой отслеживание данных для n-й цепочки становится контрпродуктивным, учитывая количество времени, которое требуется для классификации конкретного корпуса …

3
Почему часто предполагается гауссово распределение?
Цитата из статьи в Википедии об оценке параметров для наивного байесовского классификатора : «Типичное предположение состоит в том, что непрерывные значения, связанные с каждым классом, распределены в соответствии с распределением Гаусса». Я понимаю, что распределение Гаусса удобно по аналитическим причинам. Тем не менее, есть ли другие реальные причины, чтобы сделать …

1
Каков реальный ответ на вопрос о дне рождения?
«Насколько большим должен быть класс, чтобы вероятность того, что два человека с одинаковым днем ​​рождения найдут хотя бы 50%?» У меня 360 друзей на фейсбуке, и, как и следовало ожидать, распределение их дней рождения не является равномерным. У меня есть один день с 9 друзьями с тем же днем ​​рождения. …

2
Как правильно выбрать задержку при проведении коинтеграционного теста Йохансена?
При предварительном формировании коинтеграционного теста Йохансена для двух временных рядов (простой случай) вам необходимо решить, какую задержку вы хотите использовать. Выполнение теста для разных лагов дает разные результаты: для некоторых уровней лагов нулевая гипотеза может быть отклонена, а для других - нет. Мой вопрос заключается в том, что является правильным …

1
Расчеты мощности / размер выборки для исследования биомаркеров
У нас есть потенциальный биомаркер для предсказания, есть ли у пациента рак или нет. Результат теста биомаркера - бинарный, положительный или отрицательный. Мы хотим получить представление о количестве пациентов, которые необходимо протестировать, чтобы определить, является ли этот биомаркер хорошим предиктором или нет. Из чтения в интернете кажется, что нужно искать …
13 r  power 

5
Вероятность прогона k успехов в последовательности n испытаний Бернулли
Я пытаюсь найти правильную вероятность получения 8 попыток подряд в блоке из 25 испытаний, у вас есть 8 полных блоков (из 25 испытаний), чтобы получить 8 испытаний подряд. Вероятность получения любого правильного триал-теста на основе угадывания составляет 1/3, после получения правильных 8-ми строк блоки заканчиваются (поэтому получить более 8-ти правильных …



2
Как проверить, соответствует ли выборка данных гамма-распределению?
У меня есть выборка данных, которые были сгенерированы из непрерывной случайной величины X. И из гистограммы, которую я рисую с использованием R, я предполагаю, что, возможно, распределение X подчиняется определенному гамма-распределению. Но я не знаю точных параметров этого гамма-распределения. Мой вопрос заключается в том, как проверить, принадлежит ли распределение X …

2
Не вложенный выбор модели
И тест отношения правдоподобия, и AIC являются инструментами выбора между двумя моделями, и обе основаны на логарифмическом правдоподобии. Но почему тест отношения правдоподобия нельзя использовать для выбора между двумя не вложенными моделями, в то время как AIC может?

4
Существуют ли учебные пособия по Байесовской теории вероятностей или графические модели на примере?
Я видел ссылки на изучение байесовской теории вероятностей в R, и мне было интересно, есть ли еще что-то подобное, возможно, конкретно в Python? Направлены на изучение байесовской теории вероятностей, умозаключений, оценки максимального правдоподобия, графических моделей и тому подобного?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.