Обучение

Дообучение мультимодальных моделей на промышленных данных

Что меняется, когда вместо генеративных описаний нужна строгая проверка условий на изображении.

·12 мин чтения

Мультимодальные модели хорошо описывают сцену в свободной форме, но производственная задача обычно звучит иначе: выполнено ли конкретное условие на этом кадре. Это ближе к классификации, чем к генерации.

Первое решение — зафиксировать формат ответа схемой и валидировать вывод. Свободный текст превращает оценку качества в отдельную исследовательскую задачу, а строгая схема позволяет считать привычные метрики.

Второе — аккуратно собрать отрицательные примеры. Модель, обученная только на кадрах с нарушением, уверенно находит нарушение там, где его нет.

Дообучение с адаптерами обычно достаточно: полный файнтюн редко окупается на выборке в несколько тысяч примеров и заметно усложняет откат к предыдущей версии.

Ко всем статьям