Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

3
Информационно-теоретическая центральная предельная теорема
Простейшая форма информационно-теоретического CLT заключается в следующем: Пусть будут iid со средним и дисперсией 1 . Пусть f_n - плотность нормализованной суммы \ frac {\ sum_ {i = 1} ^ n X_i} {\ sqrt {n}}, а \ phi - стандартная гауссовская плотность. Тогда теоретико-информационный CLT утверждает, что если D (f_n …

5
Кластеризация как средство разделения данных для логистической регрессии
Я пытаюсь предсказать успех или неудачу студентов, основываясь на некоторых особенностях модели логистической регрессии. Чтобы улучшить производительность модели, я уже думал о том, чтобы разделить учащихся на разные группы на основе очевидных различий и создать отдельные модели для каждой группы. Но я думаю, что может быть сложно определить эти группы …

2
Как оценить точность интеграла?
Чрезвычайно распространенная ситуация в компьютерной графике состоит в том, что цвет некоторого пикселя равен интегралу некоторой вещественной функции. Часто эта функция слишком сложна для аналитического решения, поэтому мы остаемся с числовым приближением. Но эта функция также часто очень дорога для вычисления, поэтому мы сильно ограничены в количестве сэмплов, которое мы …


6
Выявление выбросов для нелинейной регрессии
Я занимаюсь исследованиями в области функциональной реакции клещей. Я хотел бы сделать регрессию для оценки параметров (скорость атаки и время обработки) функции Роджерса типа II. У меня есть набор данных измерений. Как я могу лучше всего определить выбросы? Для моей регрессии я использую следующий сценарий в R (нелинейная регрессия): (набор …

3
Занятия в классе / эксперименты по обучению статистическим понятиям
Я намереваюсь прочитать часовую лекцию для подростков о статистике. Я, наверное, увижу их только один раз. Этот сценарий может происходить снова и снова. Я хотел бы дать им некоторую активность, чтобы они испытали статистику. Но я вынужден делать это с людьми, которые ничего не знают о вероятности, статистическом выводе, исследовательском …
11 teaching 

3
Хорошие книги, посвященные методам предварительной обработки данных и обнаружения выбросов
Как гласит заголовок, знает ли кто-нибудь хорошую, современную книгу, которая описывает предварительную обработку данных в целом и особенно методы обнаружения выбросов? Книга не должна быть сосредоточена исключительно на этом, но она должна быть исчерпывающе затронута вышеупомянутыми темами - я не был бы счастлив чем-то, что является отправной точкой и цитирует …

2
Расчет VC-размерности нейронной сети
Если у меня есть некоторая фиксированная неповторяющаяся (DAG) топология (фиксированный набор узлов и ребер, но алгоритм обучения может варьировать вес по ребрам) сигмоидных нейронов с входными нейронами, которые могут принимать строки только в { - 1 , 1 } n в качестве входных данных и приводит к одному выходному сигналу …


2
Как выполнить сравнение по принципу взаимодействия с моделью смешанных эффектов?
Я работаю над набором данных, чтобы оценить влияние сушки на микробную активность осадка. Цель состоит в том, чтобы определить, изменяется ли влияние высыхания между типами отложений и / или глубиной внутри отложений. Дизайн эксперимента выглядит следующим образом: Первый фактор отложений соответствует трем типам отложений (кодированные Sed1, Sed2, Sed3). Для каждого …

2
Как улучшить стабильность нейронной сети?
Я использую нейронную сеть в R, чтобы построить NN с 14 входами и одним выходом. Я строю / обучаю сеть несколько раз, используя одни и те же входные данные обучения и ту же архитектуру / настройки сети. После создания каждой сети я использую ее на отдельном наборе тестовых данных для …

4
Оценка прогнозируемости временных рядов
Предположим, у меня чуть более 20 000 месячных временных рядов, охватывающих период с января 2005 года по декабрь 2011 года. Каждый из них представляет глобальные данные о продажах для другого продукта. Что, если вместо вычисления прогнозов для каждого из них я хотел бы сосредоточиться только на небольшом количестве продуктов, которые …

1
Коэффициент Джини и границы погрешности
У меня есть временной ряд данных с N = 14 счетчиками в каждый момент времени, и я хочу вычислить коэффициент Джини и стандартную ошибку для этой оценки в каждый момент времени. Поскольку у меня есть только N = 14 отсчетов в каждый момент времени, я продолжил вычисление дисперсии складного ножа, …

3
Зачем использовать возраст в квадрате в качестве ковариации в исследовании генетической ассоциации?
Зачем использовать возраст и квадрат в качестве ковариат в исследовании генетической ассоциации? Я могу понять использование возраста, если он был определен как значимый ковариат, но я не знаю, как использовать возраст в квадрате.

2
Отчетность о результатах простой линейной регрессии: какую информацию включить?
Я только что выполнил (очень) простую линейную регрессию в Genstat и хотел бы включить краткую и содержательную сводку результатов в мой отчет. Я не уверен, что именно или сколько информации я должен включать. Основные биты моего вывода Genstat выглядят так: Summary of analysis Source d.f. s.s. m.s. v.r. F pr. …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.