Статистика и большие данные

Вопросы и ответы для людей, интересующихся статистикой, машинным обучением, анализом данных, интеллектуальным анализом данных и визуализацией данных

1
Удаление неиспользуемых уровней в фасетах с помощью ggplot2 [закрыто]
Закрыто. Этот вопрос не по теме . В настоящее время не принимает ответы. Хотите улучшить этот вопрос? Обновите вопрос, чтобы он соответствовал теме перекрестной проверки. Закрыто в прошлом году . Можно ли отбросить уровни, которые не используются в фасетах ggplot2s? Это мой код: tab = as.data.frame(cbind(groups = mtcars$cyl, names = …

2
Как предсказать, когда произойдет следующее событие, основываясь на времени предыдущих событий?
Я учусь в старших классах и работаю над проектом по программированию, но у меня нет большого опыта в области статистики и моделирования данных, кроме курса по статистике в старших классах, поэтому я немного растерялся. По сути, у меня есть достаточно большой список (предположим, он достаточно большой, чтобы соответствовать предположениям для …

2
Обновление вероятности классификации в логистической регрессии во времени
Я строю прогностическую модель, которая прогнозирует вероятность успеха студента в конце семестра. Меня особенно интересует, успешен ли студент или нет, где успех обычно определяется как завершение курса и достижение 70% или более баллов из возможных баллов. Когда я внедряю модель, оценка вероятности успеха должна обновляться с течением времени, когда становится …

3
Когда повторные измерения ANOVA предпочтительнее, чем модель со смешанными эффектами?
В ответ на этот вопрос относительно того, был ли мой дизайн, в котором я случайно представил участников с изображениями из разных категорий, примером, в котором я должен использовать повторные измерения ANOVA, я получил ответ, что вместо этого я должен использовать смешанную модель с одним из причины в том, что у …

3
Обучение под наблюдением, активное обучение и глубокое обучение для классификации
Окончательное редактирование со всеми обновленными ресурсами: Для проекта я применяю алгоритмы машинного обучения для классификации. Задача: довольно ограниченные помеченные данные и гораздо больше непомеченных данных. Цели: Применить классификацию под наблюдением Применять как-то полу-контролируемый процесс маркировки (известный как активное обучение) Я нашел много информации из исследовательских работ, таких как применение EM, …

4
Визуализация ответов Лайкерта с использованием R или SPSS
У меня есть 82 респондента в 2 группах (43 в группе A и 39 в группе B), которые завершили опрос по 65 вопросов Лайкерта, каждый в диапазоне от 1 до 5 (полностью согласен - категорически не согласен). Поэтому у меня есть фрейм данных с 66 столбцами (1 для каждого вопроса …

5
2D аналог стандартного отклонения?
Рассмотрим следующий эксперимент: группе людей дается список городов, и их просят пометить соответствующие места на карте мира (без маркировки). Для каждого города вы получите разброс точек, примерно по центру соответствующего города. Некоторые города, скажем, Стамбул, будут демонстрировать меньше рассеяния, чем другие, скажем, Москва. Предположим, что для данного города мы получаем …

2
Что такое распределение разности двух-t-распределений
... и почему ? Предполагая, что X1X1X_1 , X2X2X_2 являются независимыми случайными величинами со средним значением и дисперсией соответственно. Моя базовая книга статистики говорит мне, что дистрибутив имеет следующие свойства:μ1,μ2μ1,μ2\mu_1,\mu_2σ21,σ22σ12,σ22\sigma^2_1,\sigma^2_2X1−X2X1−X2X_1-X_2 E(X1−X2)=μ1−μ2E(X1−X2)=μ1−μ2E(X_1-X_2)=\mu_1-\mu_2 Var(X1−X2)=σ21+σ22Var(X1−X2)=σ12+σ22Var(X_1-X_2)=\sigma^2_1 +\sigma^2_2 Now let's say X1X1X_1, X2X2X_2 are t-distributions with n1−1n1−1n_1-1, n2−2n2−2n_2-2 degrees of freedom. What is the distribution …

4
Как рассчитать доверительный интервал среднего значения?
Представьте, что вы повторяете эксперимент три раза. В каждом эксперименте вы собираете три измерения. Трипликаты имеют тенденцию быть довольно близко друг к другу, по сравнению с различиями между тремя экспериментальными средствами. Вычислить великое среднее довольно легко. Но как можно вычислить доверительный интервал для среднего значения? Образец данных: Эксперимент 1: 34, …

3
Кто-нибудь решил упражнение PTLOS 4.1?
Это упражнение дается в теории вероятностей: Логика науки Эдвин Джейнс, 2003. Существует частичное решение здесь . Я разработал более общее частичное решение, и мне было интересно, если кто-то еще решил его. Я подожду немного, прежде чем опубликовать свой ответ, чтобы дать другим возможность. Итак, предположим, что у нас есть nnn …

1
Каково мнение сообщества о Четвертом квадранте?
Нассим Талеб, известный (или позорный) Черный лебедь , развил концепцию и разработал то, что он называет «картой границ статистики» . Его основной аргумент заключается в том, что существует один вид решения проблемы, когда использование любой статистической модели вредно. Это могут быть любые проблемы с принятием решения, когда последствия принятия неправильного …

7
Среднее скользящего окна в R
У меня есть вектор значений, который я хотел бы сообщить о среднем в окнах вдоль меньшего слайда. Например, для вектора следующих значений: 4, 5, 7, 3, 9, 8 Размер окна 3 и слайд 2 будут делать следующее: (4+5+7)/3 = 5.33 (7+3+9)/3 = 6.33 (9+8)/3 = 5.67 И вернуть вектор этих …
19 r 

6
Разница между d Коэна и g Хеджеса для показателей размера эффекта
Что касается анализа величины эффекта, я заметил, что существуют различия между d Коэна, g Хеджеса и g * Хеджеса. Эти три показателя обычно очень похожи? В каком случае они будут давать разные результаты? Кроме того, это вопрос предпочтения, с которым я использую или сообщаю?

4
Когда я должен использовать вариационный авто-кодер, а не авто-кодер?
Я понимаю основную структуру вариационного автоэнкодера и нормального (детерминированного) автоэнкодера и математическую схему, стоящую за ними, но когда и почему я предпочел бы один тип автоэнкодера другому? Все, о чем я могу думать, - это предварительное распределение скрытых переменных вариационного автоэнкодера, которое позволяет нам выбирать скрытые переменные и затем создавать …

1
Почему использование метода Ньютона для оптимизации логистической регрессии называется итеративным пересчитанным методом наименьших квадратов?
Почему использование метода Ньютона для оптимизации логистической регрессии называется итеративным пересчитанным методом наименьших квадратов? Это кажется мне неясным, потому что логистическая потеря и потеря наименьших квадратов - совершенно разные вещи.

Используя наш сайт, вы подтверждаете, что прочитали и поняли нашу Политику в отношении файлов cookie и Политику конфиденциальности.
Licensed under cc by-sa 3.0 with attribution required.