Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Анализ основных компонентов и регрессия в Python
Я пытаюсь понять, как воспроизвести в Python какую-то работу, которую я проделал в SAS. Используя этот набор данных , где мультиколлинеарность является проблемой, я хотел бы выполнить анализ основных компонентов в Python. Я смотрел на scikit-learn и statsmodels, но я не уверен, как взять их результаты и преобразовать их в …

3
Какое расстояние использовать? например, Манхэттен, евклидов, Брей-Кертис и т. д.
Я не эколог сообщества, но в настоящее время я работаю над данными по экологии сообщества. Я не мог понять, кроме математики этих расстояний, критерии для каждого используемого расстояния и в каких ситуациях его можно применять. Например, что использовать с данными подсчета? Как преобразовать угол наклона между двумя точками в расстояние? …

3
Как проверить, соответствуют ли мои данные журналу нормального распределения?
Я хотел бы проверить, соответствуют Rли мои данные нормальному логарифму или парето. Как я мог это сделать? Возможно, это ks.testможет помочь мне, но как я могу получить параметры αα\alpha и kkk для распределения Парето для моих данных?

1
Обучение сверточной нейронной сети
В настоящее время я работаю над программным обеспечением для распознавания лиц, которое использует нейронные сети свертки для распознавания лиц. Основываясь на своих результатах, я понял, что сверточная нейронная сеть имеет общие веса, чтобы сэкономить время во время обучения. Но как адаптировать обратное распространение, чтобы его можно было использовать в сверточной …

3
Какие примеры скрытых переменных в контролируемых экспериментах есть в публикациях?
В этом документе: Скрывающиеся переменные: некоторые примеры Брайан Л. Джойнер The American Statistician Vol. 35, № 4, ноябрь 1981 г. 227-233 Брайан Джоунер утверждает, что «рандомизация не является панацеей». Это противоречит распространенным утверждениям, таким как приведенное ниже: Хорошо спроектированный эксперимент включает конструктивные особенности, которые позволяют исследователям исключать посторонние переменные в …

4
Классификатор для неопределенных меток классов
Допустим, у меня есть набор экземпляров с ассоциированными метками классов. Неважно, как эти экземпляры были помечены, но насколько точно их членство в классе. Каждый экземпляр принадлежит ровно одному классу. Допустим, я могу количественно определить достоверность каждого членства в классе с помощью номинального атрибута, который изменяется от 1 до 3 (от …

3
Расстояние между двумя гауссовыми смесями для оценки кластерных решений
Я провожу быстрое моделирование для сравнения различных методов кластеризации, и в настоящее время попадаю в ловушку, пытаясь оценить кластерные решения. Мне известны различные метрики проверки (многие из них содержатся в cluster.stats () в R), но я предполагаю, что они лучше всего используются, если предполагаемое количество кластеров фактически равно истинному количеству …

2
Граница принятия решения для персептрона
Я пытаюсь построить границу решения алгоритма персептрона, и я действительно запутался в нескольких вещах. Мои входные экземпляры имеют форму , в основном это двумерный входной экземпляр ( x 1 и x 2 ) и целевое значение двоичного класса ( y ) [1 или 0].[(x1,x2),y][(x1,x2),y][(x_{1},x_{2}), y]x1x1x_{1}x2x2x_{2}yyy Следовательно, мой весовой вектор имеет …

1
Мотивация за шагами алгоритма случайного леса
Метод создания случайного леса, с которым я знаком, заключается в следующем: (из http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm ) Чтобы построить дерево в лесу, мы: Загрузите образец размера N, где N - размер нашего тренировочного набора. Используйте этот загруженный образец в качестве обучающего набора для этого дерева. В каждом узле дерева случайным образом выбираем m …

2
Почему модели случайных эффектов требуют, чтобы эффекты не коррелировали с входными переменными, в то время как модели с фиксированными эффектами допускают корреляцию?
Из Википедии Существует два распространенных предположения об индивидуальном конкретном эффекте: предположение о случайных эффектах и ​​предположение о фиксированных эффектах. Предположение о случайных эффектах (сделанное в модели случайных эффектов) заключается в том, что отдельные конкретные эффекты не связаны с независимыми переменными. Предположение о фиксированном эффекте состоит в том, что индивидуальный специфический …

3
Совокупный / Совокупный график (или «Визуализация кривой Лоренца»)
Я не знаю, как называются такие сюжеты, и поэтому я дал этому вопросу глупое название. Допустим, у меня есть заказанный набор данных следующим образом 4253 4262 4270 4383 4394 4476 4635 ... Каждое число соответствует количеству публикаций, которые определенный пользователь внес на сайт. Я эмпирически исследую феномен «неравенства участия», как …

2
Почему апостериорная плотность пропорциональна функции вероятности, умноженной на предыдущую плотность?
Согласно теореме Байеса, . Но согласно моему эконометрическому тексту говорится, что . Почему это так? Я не понимаю, почему игнорируется.P(y|θ)P(θ)=P(θ|y)P(y)P(y|θ)P(θ)=P(θ|y)P(y)P(y|\theta)P(\theta) = P(\theta|y)P(y)P(θ|y)∝P(y|θ)P(θ)P(θ|y)∝P(y|θ)P(θ)P(\theta|y) \propto P(y|\theta)P(\theta)P(y)P(y)P(y)

3
Вопрос о доказательстве нормального уравнения
Как вы можете доказать, что нормальные уравнения: имеют одно или несколько решений без предположения, что X обратимо?( ХTИкс) β= ХTY(XTX)β=XTY(X^TX)\beta = X^TY Мое единственное предположение, что это как-то связано с обобщенным обратным, но я полностью потерян.
11 regression  proof 

1
Как прогнозировать новые данные с помощью сплайна / плавной регрессии
Может ли кто-нибудь помочь дать концептуальное объяснение того, как делаются прогнозы для новых данных при использовании сглаживания / сплайнов для прогнозирующей модели? Например, учитывая модель , созданную с использованием gamboostв mboostпакете в R, с р-сплайнами, как предсказания новых данных сделали? Что используется из данных обучения? Скажем, есть новое значение независимой …

2
Фишер для чайников?
Краткая версия: есть ли введение в труды Рональда Фишера (статьи и книги) по статистике, предназначенные для тех, кто мало или совсем не имеет опыта в статистике? Я думаю о чем-то вроде «аннотированного читателя Фишера», нацеленного на не статистиков. Ниже я объясню мотивацию этого вопроса, но имейте в виду, что он …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.