Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Лучшие пять классификаторов, чтобы попробовать сначала
Помимо очевидных характеристик классификатора, таких как вычислительные затраты, ожидаемые типы данных функций / меток и пригодность для определенных размеров и размеров наборов данных, Какие пять (или 10, 20?) классификаторов лучше всего опробовать на новом наборе данных, о котором еще мало что известно (например, семантика и корреляция отдельных функций)? Обычно я …

2
Проверка отношения правдоподобия в R
Предположим, я собираюсь сделать одномерную логистическую регрессию для нескольких независимых переменных, например так: mod.a <- glm(x ~ a, data=z, family=binominal("logistic")) mod.b <- glm(x ~ b, data=z, family=binominal("logistic")) Я выполнил сравнение модели (тест отношения правдоподобия), чтобы проверить, лучше ли эта модель по сравнению с нулевой моделью по этой команде. 1-pchisq(mod.a$null.deviance-mod.a$deviance, mod.a$df.null-mod.a$df.residual) …
25 r  logistic  diagnostic 

2
Обнаружение схем мошенничества на экзамене с несколькими вопросами
ВОПРОС: У меня есть двоичные данные по экзаменационным вопросам (правильно / неправильно). Некоторые люди могли иметь предварительный доступ к подмножеству вопросов и их правильных ответов. Я не знаю кто, сколько или какой. Если бы обмана не было, предположим, что я бы смоделировал вероятность правильного ответа для элемента как , где …

4
Статистика сотрудничества
Будучи биологом, многие из исследовательских проектов, над которыми я в какой-то момент работаю, включают сотрудничество со статистиком, будь то простой совет или внедрение и тестирование модели для моих данных. Мои коллеги по статистике признают, что они в значительной степени сотрудничают, поскольку в процессе проверки владения рассматриваются только те документы, по …
25 academia 

8
Как оценить, сколько людей посетило мероприятие (скажем, политический митинг)?
Один студент спросил меня сегодня: «Как они узнают, сколько людей посетили большое групповое мероприятие, например,« Ралли Стюарта / Колберта по восстановлению здравомыслия »в Вашингтоне?» Новостные агентства сообщают, что оценки исчисляются десятками тысяч, но какие методы используются для получения этих оценок и насколько они надежны? Одна статья, очевидно, основывала свою оценку …

2
Как справиться с поисковым анализом данных и дноуглубительными работами в исследованиях малых выборок?
Исследовательский анализ данных (EDA) часто приводит к исследованию других «следов», которые не обязательно принадлежат исходному набору гипотез. Я сталкиваюсь с такой ситуацией в случае исследований с ограниченным размером выборки и большим количеством данных, собранных с помощью различных вопросников (социально-демографические данные, нейропсихологические или медицинские шкалы - например, умственное или физическое функционирование, …

2
Межрассовая надежность для порядковых или интервальных данных
Какие методы оценки надежности наиболее подходят для порядковых или интервальных данных? Я считаю, что «Совместная вероятность соглашения» или «Каппа» предназначены для номинальных данных. Хотя можно использовать «Пирсон» и «Спирмен», они в основном используются для двух оценщиков (хотя они могут использоваться для более чем двух оценщиков). Какие другие меры подходят для …

3
Градиент потери шарнира
Я пытаюсь реализовать базовый градиентный спуск, и я тестирую его с функцией потери шарнира, т.е. . Тем не менее, я запутался в градиенте потери шарнира. У меня сложилось впечатление, что этоlhinge=max(0,1−y x⋅w)lhinge=max(0,1−y x⋅w)l_{\text{hinge}} = \max(0,1-y\ \boldsymbol{x}\cdot\boldsymbol{w}) ∂∂wlhinge={−y x0if y x⋅w<1if y x⋅w≥1∂∂wlhinge={−y xif y x⋅w<10if y x⋅w≥1 \frac{\partial }{\partial w}l_{\text{hinge}} …

4
Amoeba Интервью Вопрос
Мне задали этот вопрос во время собеседования по поводу торговой позиции в частной торговой фирме. Я бы очень хотел узнать ответ на этот вопрос и интуицию, стоящую за ним. Вопрос о амебе: популяция амеб начинается с 1. После 1 периода эта амеба может делиться на 1, 2, 3 или 0 …

3
Визуализация данных ответа Лайкерта
Каковы хорошие способы визуализации множества ответов Лайкерта? Например, набор вопросов, спрашивающих о важности X для чьих-либо решений об A, B, C, D, E, F & G? Есть ли что-то лучше, чем гистограммы? Что делать с ответами N / A? Как они могут быть представлены? Должны ли гистограммы отображать проценты или …

7
В чем разница между вероятностью и пропорцией?
Скажем, я ел гамбургеры каждый вторник в течение многих лет. Можно сказать, что я ем гамбургеры в 14% случаев или что вероятность того, что я ем гамбургер в течение данной недели, составляет 14%. Каковы основные различия между вероятностями и пропорциями? Является ли вероятность ожидаемой пропорцией? Являются ли вероятности неопределенными и …

3
Применение вейвлетов к алгоритмам обнаружения аномалий на основе временных рядов
Эндрю Мур ( Andrew Moore) начал работать над учебными пособиями по сбору статистических данных (настоятельно рекомендуется всем, кто впервые пойдет в эту область). Я начал с чтения этого чрезвычайно интересного PDF-документа под названием «Вводный обзор алгоритмов обнаружения аномалий на основе временных рядов», в котором Мур отслеживает многие из методов, использованных …

5
В поисках определенного типа объяснения ARIMA
Это может быть трудно найти, но я хотел бы прочитать хорошо объясненный пример ARIMA, который использует минимальную математику расширяет обсуждение за пределы построения модели на использование этой модели для прогнозирования конкретных случаев использует графику, а также числовые результаты для характеристики соответствия прогнозных и фактических значений.

3
Почему работает тест Колмогорова-Смирнова?
Читая о тесте KS с двумя образцами, я точно понимаю, что он делает, но я не понимаю, почему он работает . Другими словами, я могу выполнить все шаги для вычисления эмпирических функций распределения, найти максимальную разницу между ними, чтобы найти D-статистику, вычислить критические значения, преобразовать D-статистику в p-значение и т. …

2
Я слышал, что соотношения или инверсии случайных величин часто проблематичны, поскольку не имеют ожиданий. Почему это?
Название вопроса. Мне говорят, что отношения и инверсии случайных величин часто проблематичны. Это означает, что ожидания часто не существуют. Есть ли простое, общее объяснение этого?

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.