У меня есть меньшие модульные тесты, которые используют небольшие фрагменты из реальных наборов данных. Я также хотел бы проверить свою программу на полные наборы данных по множеству причин. Единственная проблема заключается в том, что один реальный набор данных составляет около 5 ГБ. Я не нашел точных цифр для того, что могут хранить репозитории Git, но это кажется слишком большим.
Решение, принятое моей командой, состоит в том, что у проекта есть файл, содержащий путь к подключенной к сети файловой системе, в которой хранятся наши тестовые данные. Файл Git игнорируется.
Я чувствую, что это несовершенное решение по двум причинам. Когда NAS не работает, работает медленно или не работает, мы не можем выполнить полный тест. Вторая причина заключается в том, что когда кто-то сначала клонирует репозиторий, модульные тесты не пройдены, поэтому им нужно выяснить, как монтировать объекты с определенным именем и синтаксисом, используемым для создания файла пути тестирования.
Так что мой вопрос в два раза. Сколько данных - это слишком много данных для хранения в системе контроля версий?
Как лучше обрабатывать большие объемы тестовых данных?