Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

4
Вредны ли эксперты?
Я читаю «Роль шахмат в исследованиях искусственного интеллекта» ( pdf ) и, что интересно, там написано: Опыт [...] свидетельствует о том, что вклады шахматных экспертов, хотя и в целом полезные, нельзя полностью доверять. Хорошим примером этого является функция оценки Deep Thought. Некоторые изменения, сделанные опытными специалистами по шахматам, не принесли …

3
Что такое практически хороший процесс анализа данных?
Я хотел бы знать, или иметь ссылки на процесс анализа, который проходит большинство статистических аналитиков данных для каждого проекта анализа данных. Если я составлю «список», для завершения проекта анализа данных аналитик должен: сначала собрать требования к проекту, планировать / проектировать свой анализ данных на основе этих требований до на самом …

2
LASSO / LARS против общего к специфическому (GETS) методу
Мне было интересно, почему методы выбора моделей LASSO и LARS так популярны, даже если они в основном представляют собой просто варианты пошагового прямого выбора (и, следовательно, страдают от зависимости пути)? Точно так же, почему методы General to Specific (GETS) для выбора модели в основном игнорируются, даже если они работают лучше, …

2
Какой язык использовать для генетического программирования
В рамках задания мне нужно будет написать алгоритм генетического программирования , который будет предсказывать уровни загрязнения атмосферы. Поскольку у меня нет опыта, может кто-нибудь указать мне указатели на предложения языков программирования, на которых будут написаны развитые программы . Пояснение: я не спрашиваю, на каком языке я напишу сам генетический алгоритм …

4
Классификация с высокими показателями жира
Мне нужно обучить линейный классификатор на моем ноутбуке с сотнями тысяч точек данных и около десяти тысяч функций. Какие у меня варианты? Каково современное состояние для такого рода проблем? Кажется, что стохастический градиентный спуск является перспективным направлением, и я чувствую, что это состояние дел: «Pegasos: первичный оцененный субградиентный раствор для …

2
Как сделать перекрестную проверку с помощью модели пропорциональных рисков Кокса?
Предположим, что я построил модель прогнозирования возникновения конкретной болезни в одном наборе данных (набор данных построения модели) и теперь хочу проверить, насколько хорошо модель работает в новом наборе данных (набор данных проверки). Для модели, построенной с логистической регрессией, я рассчитал бы прогнозируемую вероятность для каждого человека в наборе данных проверки …

2
Как выбрать уровень значимости для большого набора данных?
Я работаю с набором данных, имеющих N около 200 000. В регрессиях я вижу очень маленькие значения значимости << 0,001, связанные с очень маленькими величинами эффекта, например, r = 0,028. Я хотел бы знать, есть ли принципиальный способ определения подходящего порога значимости по отношению к размеру выборки? Есть ли другие …

2
Разбиение деревьев в R: партия против rpart
Прошло много времени с тех пор, как я посмотрел на разделение деревьев. В прошлый раз, когда я делал подобные вещи, мне нравилась вечеринка в R (созданная Hothorn). Идея условного вывода через выборку имеет для меня смысл. Но у rpart тоже была апелляция. В текущем приложении (я не могу дать подробности, …
15 r  cart  rpart  partitioning 

3
Какой хороший подход к обучению R в компьютерной лаборатории?
Было несколько хороших вопросов и наборов ответов на вводные книги или подходы к обучению, например, здесь и здесь . Но у меня немного другая проблема - лучший способ запустить часовой сеанс (или несколько таких сеансов) в компьютерном классе, который поможет людям начать работать с R, знаком с его базовым подходом …
15 r  teaching 

1
Как следует реализовывать разбиения дерева решений при прогнозировании непрерывных переменных?
На самом деле я пишу реализацию Случайных Лесов, но я считаю, что вопрос специфичен для деревьев решений (независимо от RF). Таким образом, контекст заключается в том, что я создаю узел в дереве решений, и предсказание и целевые переменные являются непрерывными. Узел имеет пороговое значение для разделения данных на два набора, …


1
Плотность нормального распределения при увеличении размеров
Вопрос, который я хочу задать, заключается в следующем: как изменяется доля выборок в пределах 1 SD от среднего значения нормального распределения с увеличением числа вариаций? (Почти) всем известно, что при одномерном нормальном распределении 68% выборок можно найти в пределах 1 стандартного отклонения от среднего. Как насчет 2, 3, 4, ... …

3
Как я могу оценить уникальные числа случаев по случайной выборке данных?
Допустим, у меня есть большой набор значений которые иногда повторяются. Я хочу оценить общее количество уникальных значений в большом наборе.SSS Если я возьму случайную выборку значений и определю, что она содержит уникальные значения T u , могу ли я использовать это для оценки количества уникальных значений в большом наборе?TTTTuTuT_u

3
Когда следует рассмотреть возможность использования GMM?
Одна из вещей, которая делает эконометрику уникальной, - это использование метода Обобщенного метода моментов. Какие типы проблем делают GMM более подходящим, чем другие методы оценки? Что дает вам использование GMM с точки зрения эффективности, снижения смещения или более точной оценки параметров? И наоборот, что вы теряете, используя GMM поверх MLE …

4
Какова корреляция, если стандартное отклонение одной переменной равно 0?
Как я понимаю, мы можем получить корреляцию путем нормализации ковариации с помощью уравнения ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} где - стандартное отклонениеXi.σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i Меня беспокоит, что, если стандартное отклонение равно нулю? Есть ли условие, гарантирующее, что оно не может быть нулевым? Благодарю.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.