Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Проблема волшебного денежного дерева
Я думал об этой проблеме в душе, она была вдохновлена ​​инвестиционными стратегиями. Допустим, там было волшебное денежное дерево. Каждый день вы можете предложить денежное дерево денежному дереву, и оно либо утроит его, либо уничтожит с вероятностью 50/50. Вы сразу замечаете, что в среднем вы будете зарабатывать деньги, делая это, и …


6
Является ли настройка гиперпараметра на образце набора данных плохой идеей?
У меня есть набор данных из 140000 примеров и 30 функций, для которых я готовлю несколько классификаторов для двоичной классификации (SVM, логистическая регрессия, случайный лес и т. Д.) Во многих случаях настройка гиперпараметра для всего набора данных с использованием поиска по сетке или случайному поиску слишком затратна по времени. Я …


2
Методология прогнозирования VAR
Я строю модель VAR для прогнозирования цены актива и хотел бы знать, является ли мой метод статистически обоснованным, актуальны ли тесты, которые я включил, и нужно ли больше для обеспечения надежного прогноза на основе моих входных переменных. Ниже приведен мой текущий процесс проверки причинности Грейнджера и прогнозирования выбранной модели VAR. …
19 r  forecasting  modeling  var 


4
Лучший способ справиться с гетероскедастичностью?
У меня есть график остаточных значений линейной модели в зависимости от подогнанных значений, где гетероскедастичность очень ясна. Однако я не уверен, как мне поступить сейчас, потому что, насколько я понимаю, эта гетероскедастичность делает мою линейную модель недействительной. (Это правильно?) Используйте надежную линейную аппроксимацию, используя rlm()функцию MASSпакета, потому что он явно …

1
Хорошая посадка и какую модель выбрать линейную регрессию или Пуассона
Мне нужны некоторые советы относительно двух основных дилемм в моем исследовании, которое представляет собой исследование трех крупных фармацевтических препаратов и инноваций. Количество патентов в год является зависимой переменной. Мои вопросы Каковы наиболее важные критерии для хорошей модели? Что более / менее важно? Это то, что большинство или все переменные будут …

3
Может ли быть несколько локальных оптимальных решений, когда мы решаем линейную регрессию?
Я прочитал это утверждение на одном старом истинном / ложном экзамене: Мы можем получить несколько локальных оптимальных решений, если решим задачу линейной регрессии путем минимизации суммы квадратов ошибок с использованием градиентного спуска. Решение: Неверно У меня вопрос, какая часть этого вопроса не так? Почему это утверждение неверно?

11
Почему логистическая регрессия называется алгоритмом машинного обучения?
Если я правильно понял, в алгоритме машинного обучения модель должна учиться на своем опыте, то есть когда модель дает неправильный прогноз для новых случаев, она должна адаптироваться к новым наблюдениям, и со временем модель становится все лучше , Я не вижу, что логистическая регрессия имеет эту характеристику. Так почему же …

5
Как перекодировать категориальную переменную в числовую переменную при использовании SVM или нейронной сети
Чтобы использовать SVM или нейронную сеть, необходимо преобразовать (закодировать) категориальные переменные в числовые переменные. Обычный метод в этом случае - использовать 0-1 двоичные значения с k-ным категориальным значением, преобразованным в (0,0, .. ., 1,0, ... 0) (1 находится в k-й позиции). Существуют ли другие способы сделать это, особенно когда существует …

3
Почему t-распределение становится более нормальным с увеличением размера выборки?
Согласно Википедии, я понимаю, что t-распределение - это выборочное распределение t-значения, когда выборки представляют собой наблюдения из нормально распределенной популяции. Тем не менее, я не понимаю, почему это приводит к тому, что форма t-распределения меняется с жирнохвостого на почти совершенно нормальный. Я понимаю, что если вы делаете выборку из нормального …

2
Модели структурных уравнений (SEM) против байесовских сетей (BN)
Терминология здесь беспорядок. «Структурное уравнение» примерно так же расплывчато, как «архитектурный мост», и «байесовская сеть» не является байесовской . Даже лучше, Бог причинности, Иудея Перл, говорит, что две школы моделей почти идентичны. Итак, каковы важные различия? (Удивительно для меня, страница Википедии для SEM даже не включает слово «сеть» на момент …

3
Асимптотическое распределение выборочной дисперсии ненормального образца
Это более общий подход к проблеме, поставленной этим вопросом . После получения асимптотического распределения выборочной дисперсии мы можем применить метод Дельта, чтобы получить соответствующее распределение для стандартного отклонения. Пусть выборка размера из iid ненормальных случайных величин , со средним значением и дисперсией . Установите среднее значение выборки и выборочную дисперсию …

2
Значение нейронной сети как черного ящика?
Я часто слышу, как люди говорят о нейронных сетях, как о чёрном ящике, который вы не понимаете, что он делает или что они значат. Я на самом деле не могу понять, что они имеют в виду под этим! Если вы понимаете, как работает обратное распространение, то как это черный ящик? …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.