Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Вычислить приблизительные квантили для потока целых чисел, используя моменты?
мигрировал из math.stackexchange . Я обрабатываю длинный поток целых чисел и рассматриваю возможность отслеживания нескольких моментов, чтобы иметь возможность приблизительно рассчитать различные процентили для потока без сохранения большого количества данных. Какой самый простой способ вычислить процентили из нескольких моментов. Есть ли лучший подход, который предполагает хранение небольшого количества данных?

6
Интерпретация простой линейной регрессии
Я провел простую линейную регрессию натурального логарифма двух переменных, чтобы определить, коррелируют ли они. Мой вывод такой: R^2 = 0.0893 slope = 0.851 p < 0.001 Я запутался. Глядя на значение , я бы сказал, что две переменные не коррелированы, так как оно очень близко к . Однако наклон линии …

2
Использовать ли моделирование структурных уравнений для анализа наблюдательных исследований в психологии
Я заметил, что эта проблема часто возникает в статистических консультациях, и я хотел узнать ваши мысли. контекст Я часто говорю со студентами-исследователями, которые провели исследование примерно следующим образом: Наблюдательное исследование Размер выборки может быть 100, 200, 300 и т. Д. Были измерены множественные психологические шкалы (например, возможно, тревога, депрессия, личность, …

3
Как настроить и оценить полиномиальную модель логита в R?
Я запустил полиномиальную модель логита в JMP и получил результаты, которые включали AIC, а также х-квадратные p-значения для каждой оценки параметра. Модель имеет один категорический результат и 7 категориальных объяснительных переменных. Затем я соответствую тому, что, как я думал, построю ту же модель в R, используя multinomфункцию из пакета nnet …
20 r  logistic  multinomial  logit  jmp 

2
Выбор метода сезонного разложения
Сезонная корректировка является решающим этапом предварительной обработки данных для дальнейших исследований. Исследователь, однако, имеет несколько вариантов сезонного разложения по трендовому циклу. Наиболее распространенными (судя по количеству ссылок в эмпирической литературе) конкурентными методами сезонного разложения являются X-11 (12) -ARIMA, Tramo / Seats (оба реализованы в Demetra + ) и 's stlRRR …

2
Преобразование данных пропорции: когда квадратного корня арксинуса недостаточно
Есть ли (более сильная?) Альтернатива квадратному корню арксин для преобразования процент / пропорция? В наборе данных, над которым я сейчас работаю, заметная гетероскедастичность сохраняется после того, как я применяю это преобразование, то есть график зависимости остатков от подгоночных значений все еще очень ромбовидный. Отредактировано, чтобы отвечать на комментарии: данные представляют …

2
Функция «Интерес» для вопросов StackExchange
Я пытаюсь собрать пакет сбора данных для сайтов StackExchange и, в частности, я застрял в попытке определить «самые интересные» вопросы. Я хотел бы использовать оценку вопроса, но убрать смещение из-за количества просмотров, но я не знаю, как к этому строго подходить. В идеальном мире я мог бы отсортировать вопросы, рассчитав …

10
Какая из них является нулевой гипотезой? Конфликт между теорией науки, логикой и статистикой?
Мне трудно понять основную логику в установлении нулевой гипотезы . В этом ответе очевидно общепринятое утверждение гласит, что нулевая гипотеза - это гипотеза о том, что не будет никакого эффекта, все останется тем же, то есть ничего нового под солнцем, так сказать. Тогда вы пытаетесь доказать альтернативную гипотезу, например, о …

4
Усреднение значений корреляции
Допустим, я проверяю, как переменная Yзависит от переменной Xв различных экспериментальных условиях, и получаю следующий график: Штриховые линии на графике выше представляют линейную регрессию для каждого ряда данных (экспериментальная установка), а цифры в легенде обозначают корреляцию Пирсона для каждого ряда данных. Я хотел бы рассчитать «среднюю корреляцию» (или «среднюю корреляцию») …

2
Информация Фишера в иерархической модели
Учитывая такую иерархическую модель, и, М ~ L р л с е ( 0 , с ) , где N ( ⋅ , ⋅ ) является нормальным распределением. Есть ли способ получить точное выражение для информации Фишера о предельном распределении X с учетом с . То есть, что такое информация …

2
Оценка R-квадрата и статистической значимости по модели регрессионного наказания
Я использую пакет R, оштрафованный для получения сокращенных оценок коэффициентов для набора данных, где у меня много предикторов и мало известно о том, какие из них важны. После того, как я выбрал параметры настройки L1 и L2 и доволен своими коэффициентами, есть ли статистически обоснованный способ суммирования соответствия модели с …

2
Как назвать тики в бокс-поте python matplotlib
Locked . Этот вопрос и его ответы заблокированы, потому что вопрос не по теме, но имеет историческое значение. В настоящее время он не принимает новые ответы или взаимодействия. Python matplotlib имеет команду boxplot . Обычно все части графика имеют числовые отметки. Как я могу поменять галочки на названия вместо позиций? …

1
Статья о неправильном использовании статистического метода в NYTimes
Я имею в виду эту статью: http://www.nytimes.com/2011/01/11/science/11esp.html Рассмотрим следующий эксперимент. Предположим, есть основания полагать, что монета была слегка утяжелена по отношению к головам. В тесте монета выпадает в голову 527 раз из 1000. Является ли это значительным доказательством того, что монета взвешена? Классический анализ говорит да. При честной монете шансы …

2
Какова гипотеза NULL для взаимодействия в двухстороннем ANOVA?
Допустим, у нас есть два фактора (A и B), каждый из которых имеет два уровня (A1, A2 и B1, B2) и переменную отклика (y). При выполнении двухстороннего ANOVA типа: y~A+B+A*B Мы проверяем три нулевые гипотезы: Нет разницы в средствах фактора А Там нет разницы в средствах фактора B Нет взаимодействия …

3
Какова сумма квадратов т переменных?
Пусть из t-распределения Стьюдента с степенями свободы для среднего размера (скажем, менее 100). Определить Распространяется ли почти как хи-квадрат с k степенями свободы? Есть ли что-то вроде центральной предельной теоремы для суммы квадратов случайных величин?titit_innnnnnT=∑1≤i≤kt2iT=∑1≤i≤kti2T = \sum_{1\le i \le k} t_i^2TTTkkk

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.