Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Обучение нейронной сети для регрессии всегда предсказывает среднее
Я тренирую простую сверточную нейронную сеть для регрессии, где задача состоит в том, чтобы предсказать (x, y) расположение блока на изображении, например: Выход сети имеет два узла, один для х, а другой для у. Остальная часть сети является стандартной сверточной нейронной сетью. Потеря представляет собой стандартную среднеквадратичную ошибку между прогнозируемым …

1
Почему в статьях редко сообщается, какой тип квадратов используется в результатах Anova?
Исходя из моего небольшого опыта в области статистики, кажется, что тип сумм квадратов (типа I, II, III, IV ...), используемых для получения результатов ANOVA, может существенно изменить результаты теста (особенно моделей с взаимодействиями и отсутствующими данные). Однако я еще не видел бумаги, сообщающей об этом. Почему это так? Я был …

1
Ниже, чем ожидалось, охват для важности выборки с моделированием
Я пытался ответить на вопрос Оценка интеграла Важность метода отбора проб в R . В основном, пользователь должен рассчитать ∫π0f(x)dx=∫π01cos(x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx используя экспоненциальное распределение в качестве распределения важности q(x)=λ exp−λxq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} и найдите значение которое дает лучшее приближение к интегралу (это ). Я переделал проблему как оценку среднего значения …

2
Как лучше всего оценить средний эффект лечения в продольном исследовании?
В продольном исследовании результаты YitYяTY_{it} единиц iяi многократно измеряются в моменты времени tTt с общим числом фиксированных измерений mмm (фиксированные = измерения в единицах измерения проводятся одновременно). Единицы случайным образом назначаются либо на лечение, G=1гзнак равно1G=1 , либо на контрольную группу, G=0гзнак равно0G=0 . Я хочу оценить и проверить средний …

2
Когда использовать модель гауссовой смеси?
Я новичок в использовании GMM. Я не смог найти подходящей помощи онлайн. Может ли кто-нибудь предоставить мне правильный ресурс "Как решить, подходит ли использование GMM для моей проблемы?" или в случае проблем классификации "Как решить, должен ли я использовать классификацию SVM или классификацию GMM?"

1
Вероятно, что образец начальной загрузки точно такой же, как и исходный.
Просто хочу проверить некоторые рассуждения. Если мой исходный образец имеет размер и я загружаю его, то мой мыслительный процесс выглядит следующим образом:Nnn n-11N1n\frac{1}{n} - это шанс любого наблюдения, взятого из исходного образца. Чтобы гарантировать, что следующая ничья не является ранее наблюдавшимся наблюдением, мы ограничиваем размер выборки до . Таким образом, …

1
Генерация случайных чисел из «наклонного равномерного распределения» из математической теории
Для каких-то целей мне нужно генерировать случайные числа (данные) из распределения "наклонной формы". «Наклон» этого распределения может изменяться в некотором разумном интервале, и тогда мое распределение должно измениться с равномерного на треугольное в зависимости от наклона. Вот мой вывод: Давайте сделаем это просто и сгенерируем данные от до (синий, красный …

1
Понимание топологии LSTM
Как и многие другие, я обнаружил, что ресурсы здесь и здесь чрезвычайно полезны для понимания ячеек LSTM. Я уверен, что понимаю, как значения обновляются и обновляются, и я достаточно уверен, чтобы добавить упомянутые «глазковые соединения» и т. Д. В моем примере у меня на каждом шаге времени есть входной вектор …

2
Имитация линейной регрессии с гетероскедастичностью
Я пытаюсь смоделировать набор данных, который соответствует имеющимся у меня эмпирическим данным, но я не уверен, как оценить ошибки в исходных данных. Эмпирические данные включают гетероскедастичность, но я не заинтересован в ее преобразовании, а скорее использую линейную модель с ошибочным термином для воспроизведения моделирования эмпирических данных. Например, допустим, у меня …

1
Небольшое несоответствие между встроенной функцией R Крускала-Уоллиса и ручным расчетом
Меня смущает следующее, и я не смог найти ответ в другом месте. Я пытаюсь изучить R, выполняя некоторую статистику, и, в качестве упражнения, я пытаюсь перепроверить результаты встроенных функций R, также делая их «вручную», как это было в R. Однако , для теста Крускала-Уоллиса я продолжаю получать разные результаты, и …

2
Линейная регрессия: * Почему * вы можете разделить суммы квадратов?
Этот пост относится к двумерной модели линейной регрессии, . Я всегда брал разбиение общей суммы квадратов (SSTO) на сумму квадратов для ошибки (SSE) и суммы квадратов для модели (SSR) по вере, но как только я действительно начал думать об этом, я не понимаю почему это работает ...Yi=β0+β1xiYi=β0+β1xiY_i = \beta_0 + …

1
Связь между MLE и наименьшими квадратами в случае линейной регрессии
Хасти и Тибширани упоминают в разделе 4.3.2 своей книги, что в случае линейной регрессии подход наименьших квадратов фактически является частным случаем максимальной вероятности. Как мы можем доказать этот результат? PS: не жалейте математических деталей.

2
Почему я не могу получить действительный SVD X через разложение по собственным значениям XX 'и X'X?
Я пытаюсь сделать SVD вручную: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) Но последняя строка не возвращается mобратно. Почему? Кажется, что-то связано с признаками этих собственных векторов ... Или я неправильно понял процедуру?
9 r  svd  eigenvalues 

1
Модель смешанных эффектов со сплайнами
Я подгоняю модель со смешанными эффектами сплайн-термином в приложении, где известно, что тренд во времени является криволинейным. Тем не менее, я хотел бы оценить, происходит ли криволинейный тренд из-за индивидуального отклонения от линейности, или это эффект на уровне группы, который делает подгонку уровня группы кажущейся криволинейной. Я привожу воспроизводимый пример, …
9 r  splines  lme4-nlme 

1
Многомерная линейная регрессия с лассо по r
Я пытаюсь создать сокращенную модель для прогнозирования многих зависимых переменных (DV) (~ 450), которые сильно коррелированы. Мои независимые переменные (IV) также многочисленны (~ 2000) и сильно коррелированы. Если я использую лассо, чтобы выбрать сокращенную модель для каждого выходного сигнала в отдельности, я не гарантирую получить то же подмножество независимых переменных, …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.