Аугментация данных (Data Augmentation)

Что это такое?

Аугментация данных — искусственное увеличение объёма обучающих данных за счёт изменения уже существующих примеров: поворота и обрезки изображений, изменения громкости звука, перестановки слов в тексте. Модель получает больше разнообразных примеров без сбора новых реальных данных.

Зачем нужна?

Реальных данных часто не хватает, а аугментация позволяет расширить выборку без дорогого сбора новых примеров.

  • увеличивает объём данных, когда реальных примеров недостаточно;
  • делает модель устойчивее к разным условиям: освещению, ракурсу, шуму;
  • снижает риск переобучения на маленькой выборке;
  • ускоряет подготовку данных по сравнению со сбором новых;
  • помогает моделировать редкие ситуации, которые сложно снять на практике.

Где применяется?

Компьютерное зрение, распознавание речи, обработка текста.

Пример: компания обучает модель распознавания брака на конвейере и дополнительно поворачивает и затемняет исходные фото деталей, чтобы модель узнавала дефект при любом освещении.

Что важно знать?

Аугментация не заменяет реальные данные полностью — она расширяет уже собранный набор, а не создаёт информацию с нуля. Слишком агрессивные изменения могут исказить смысл примера.