Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных


5
Какой язык программирования вы рекомендуете для создания прототипа проблемы машинного обучения?
В настоящее время работает в Octave, но из-за плохой документации прогресс очень медленный. Какой язык прост в изучении и использовании и хорошо документирован для решения проблем машинного обучения? Я ищу прототип на небольшом наборе данных (тысячи примеров), поэтому скорость не важна. РЕДАКТИРОВАТЬ: я разрабатываю механизм рекомендации. Итак, я заинтересован в …

1
Могу ли я использовать парный t-критерий, когда образцы обычно распределяются, но их различие отсутствует?
У меня есть данные из эксперимента, в котором я применил два разных метода лечения в одинаковых начальных условиях, и в качестве результата я получил целое число от 0 до 500 в каждом случае. Я хочу использовать парный критерий Стьюдента, чтобы определить, значительно ли отличаются эффекты, вызванные этими двумя процедурами. Результаты …

2
Как настроить пуассон с нулевой раздувкой в ​​JAGS?
Я пытаюсь настроить модель Пуассона с нулевой раздувкой в ​​R и JAGS. Я новичок в JAGS, и мне нужно некоторое руководство о том, как это сделать. Я пытался со следующим, где у [я] является наблюдаемой переменной model { for (i in 1:I) { y.null[i] <- 0 y.pois[i] ~ dpois(mu[i]) pro[i] …

1
Каков хороший показатель степени нарушения нормальности и какие описательные метки могут быть прикреплены к этому индексу?
Контекст: В предыдущем вопросе @Robbie спросил в исследовании около 600 случаев, почему тесты на нормальность предполагали значительную ненормальность, а графики предлагали нормальное распределение . Несколько человек отметили, что значимые тесты нормальности не очень полезны. С небольшими выборками такие тесты не имеют достаточной силы для выявления легких нарушений нормальности, а с …

5
Уменьшает ли стандартизация независимых переменных коллинеарность?
Я наткнулся на очень хороший текст о Bayes / MCMC. ИТ-специалисты предполагают, что стандартизация ваших независимых переменных сделает алгоритм MCMC (Metropolis) более эффективным, но также может снизить (мульти) коллинеарность. Это может быть правдой? Это то, что я должен делать как стандарт . (Извините). Крушке 2011, Анализ байесовских данных. (AP) редактировать: …

5
Как эффективно вычислить ядро ​​Гаусса в numpy [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время он не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто 3 года назад . У меня есть пустой массив с m столбцами и n строками, столбцы с размерами и точками данных строк. Теперь …

5
Почему все тесты на нормальность отвергают нулевую гипотезу?
Тест Колгоморова-Смирнова, тест Шапиро и т. Д. ... все они отвергают гипотезу о том, что распределение нормальное. Тем не менее, когда я строю нормальные квантили и гистограмму, данные явно нормальные. Может быть, потому что мощность тестов высока? Размер выборки составляет около 650. Так не должен ли хотя бы один из …

1
Робастный кластерный метод для смешанных данных в R
Я рассчитываю на кластеризацию небольшого набора данных (64 наблюдения 4-х интервальных переменных и одной трехфакторной категориальной переменной). Теперь я довольно новичок в кластерном анализе, но я знаю, что был значительный прогресс со времен, когда иерархическая кластеризация или k-средних были единственными доступными вариантами. В частности, кажется, что доступны новые методы кластеризации …

3
Оценка параметров для пространственного процесса
Мне дали сетку положительных целочисленных значений. Эти числа представляют интенсивность, которая должна соответствовать силе убеждения человека, занимающего это место в сетке (более высокое значение указывает на более высокое убеждение). Человек, как правило, будет влиять на несколько ячеек сетки.n × nn×nn\times n Я считаю, что схема интенсивностей должна «выглядеть гауссовской» в …

5
Как сделать хорошую шкалу интенсивности цвета?
Я отнюдь не хорош в статистике, но думаю, что попал в нужное место. Мой вопрос прост: Моя проблема состоит в сравнении численности населения нескольких штатов в маленькой стране, но в некоторых штатах население составляет 3000 000 человек, а в некоторых - 2000 человек. Я рисую это на карте, и «интенсивность» …

4
Как выполнить PCA для данных очень высокой размерности?
Чтобы выполнить анализ главных компонентов (PCA), вы должны вычесть средние значения каждого столбца из данных, вычислить матрицу коэффициентов корреляции и затем найти собственные векторы и собственные значения. Ну, скорее, это то, что я сделал, чтобы реализовать его в Python, за исключением того, что он работает только с небольшими матрицами, потому …
12 pca  python 

5
Можно ли рассчитать стандартное отклонение для среднего гармонического?
Можно ли рассчитать стандартное отклонение для среднего гармонического? Я понимаю, что стандартное отклонение может быть рассчитано для среднего арифметического, но если у вас есть среднее гармоническое, как вы рассчитываете стандартное отклонение или CV?

1
Должен ли поиск по сетке SVM показывать высокоточный регион с низкой точностью?
У меня есть 12 положительных тренировочных наборов (раковые клетки, обработанные лекарствами с каждым из 12 различных механизмов действия). Для каждого из этих положительных обучающих наборов я хотел бы обучить машину опорных векторов, чтобы отличить ее от отрицательного набора равного размера, выбранного из эксперимента. Каждый набор имеет от 1000 до 6000 …
12 svm 

4
Как взять много образцов из 10 из большого списка, без полной замены
У меня есть большой набор данных (20 000 точек данных), из которого я хочу взять повторные выборки из 10 точек данных. Однако, как только я выбрал эти 10 точек данных, я хочу, чтобы они больше не выбирались. Я пытался использовать sampleфункцию, но, похоже, у нее нет возможности сэмплировать без замены …
12 r  sample 

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.