Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

2
Применяется ли «Теорема об отсутствии бесплатного обеда» к общим статистическим тестам?
Женщина, на которую я работал, попросила меня сделать одностороннюю ANOVA на некоторых данных. Я ответил, что данные были данными повторных измерений (временных рядов), и что я думал, что допущение независимости было нарушено. Она ответила, что мне не следует беспокоиться о допущениях, просто проведите тест, и она примет во внимание, что …

2
Оправдание для сопряженного приора?
Помимо удобства использования, есть ли какое-либо эпистемическое обоснование (математическое, философское, эвристическое и т. Д.) Для использования сопряженных априорных значений? Или в большинстве случаев это достаточно хорошее приближение и делает вещи намного проще?

2
Как преобразовать отрицательные значения в логарифмы?
Я хотел бы знать, как преобразовать отрицательные значения в Log(), так как у меня есть гетероскедастические данные. Я прочитал, что это работает с формулой, Log(x+1)но это не работает с моей базой данных, и я продолжаю получать NaN в результате. Например, я получаю это предупреждение (я не поместил свою полную базу …
12 r  logarithm 

2
Бросает ли монета справедливый способ рандомизации группы в две группы?
Так что я и мой дядя спорим о том, является ли бросок монеты действительно случайным. Я утверждаю, что это не потому, что в реальных условиях бросок монеты всегда будет манипулировать монетой, поэтому результат не 50/50, поэтому он не является хорошим выбором в качестве метода рандомизации для назначения групп в клинических …

1
Почему люди не используют более глубокие RBF или RBF в сочетании с MLP?
Поэтому, рассматривая нейронные сети с радиальной базисной функцией, я заметил, что люди рекомендуют использовать только 1 скрытый слой, тогда как в многослойных нейронных сетях персептрона больше слоев считается лучшим. Учитывая, что сети RBF могут быть обучены с использованием версии обратного распространения, есть ли причины, по которым более глубокие сети RBF …

1
Автоматическое извлечение ключевых слов: использование косинусных сходств в качестве функций
У меня есть матрица термина документа , и теперь я хотел бы извлечь ключевые слова для каждого документа с помощью контролируемого метода обучения (SVM, Naive Bayes, ...). В этой модели я уже использую Tf-idf, тег Pos, ...MMM Но теперь я задаюсь вопросом о nexts. У меня есть матрица с косинусом …

1
Когда мне следует беспокоиться о парадоксе Джеффриса-Линдли в выборе байесовской модели?
Я рассматриваю большое (но конечное) пространство моделей различной сложности, которые я исследую с помощью RJMCMC . Приоритет вектора параметров для каждой модели достаточно информативен. В каких случаях (если таковые имеются) я должен беспокоиться о парадоксе Джеффриса-Линдли в пользу более простых моделей, когда одна из более сложных моделей будет более подходящей? …

1
Как интерпретировать высоту графика плотности
Как я должен интерпретировать высоту плотности участков: Например, на приведенном выше графике пик составляет около 0,07 при x = 18. Могу ли я сделать вывод, что около 7% значений составляют около 18? Могу ли я быть более конкретным, чем это? Существует также второй пик при х = 30 с высотой …

2
Почему n-грамм используется в идентификации текста вместо слов?
В двух популярных библиотеках идентификации языка, Compact Language Detector 2 для C ++ и Language Detector для Java, обе они использовали (на основе символов) n-граммы для извлечения текстовых функций. Почему пакет слов (одно слово / словарь) не используется, и каковы преимущества и недостатки пакета слов и n-грамм? Кроме того, каковы …

1
Приблизительное распределение продукта N нормальной IID? Особый случай μ≈0
Учитывая н.о.р. , и , ищу:X n ≈ N ( μ X , σ 2 X ) μ X ≈ 0N≥ 30N≥30N\geq30ИксN≈ N( μИкс, σ2Икс)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μИкс≈ 0μX≈0\mu_X \approx 0 точное приближение распределения замкнутой формы YN= ∏1NИксNYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} асимптотическая ( экспоненциальная ?) аппроксимация того же произведения Это особый случай более общего вопроса .μИкс≈ …

3
По поводу сходимости по вероятности
Пусть - последовательность случайных величин от st вероятности , где - фиксированная постоянная. Я пытаюсь показать следующее: и оба в вероятности. Я здесь, чтобы увидеть, была ли моя логика правильной. Вот моя работа{Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1}Xn→aXn→aX_n \to aa>0a>0a>0Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a}aXn→1aXn→1\frac{a}{X_n}\to 1 ПОПЫТКА Для первой части мы имеем Обратите внимание, что Из этого …

1
Как называется метод оценки плотности, при котором все возможные пары используются для создания нормального распределения смеси?
Я просто подумал о аккуратном (не обязательно хорошем) способе создания одномерных оценок плотности, и мой вопрос: У этого метода оценки плотности есть имя? Если нет, то является ли это частным случаем какого-либо другого метода в литературе? Вот метод: Мы имеем вектор который мы предполагаем, взят из некоторого неизвестного распределения, которое …

1
Дисперсия Коэна статистики
Коэна является одним из наиболее распространенных способов измерения размера эффекта ( см. Википедия ). Он просто измеряет расстояние между двумя средними значениями в единицах стандартного отклонения. Как мы можем получить математическую формулу оценки дисперсии Коэна ? дdddddd Декабрь 2015 г. edit: С этим вопросом связана идея вычисления доверительных интервалов вокруг …

2
Каковы преимущества использования байесовской нейронной сети
Недавно я прочитал несколько статей о байесовской нейронной сети (BNN) [Neal, 1992] , [Neal, 2012] , которая дает вероятностное соотношение между входом и выходом в нейронной сети. Обучение такой нейронной сети происходит через MCMC, который отличается от традиционного алгоритма обратного распространения. Мой вопрос: в чем преимущество использования такой нейронной сети? …

3
Количественная оценка сходства между двумя наборами данных
Резюме : Попытка найти лучший метод суммирует сходство между двумя выровненными наборами данных, используя одно значение. Детали : Мой вопрос лучше всего объяснить диаграммой. На графиках ниже показаны два разных набора данных, каждый со значениями, помеченными nfи nr. Точки вдоль оси x представляют, где были выполнены измерения, а значения на …

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.