Инференс

Детекция в реальном времени: где на самом деле теряется время

Разбираем бюджет задержки в пайплайне видеоаналитики и показываем, почему ускорение модели редко даёт ожидаемый прирост.

·8 мин чтения

Когда сценарий видеоаналитики не укладывается в требуемую задержку, первым делом обычно берутся оптимизировать модель. Это разумно ровно до того момента, пока не измерен полный бюджет времени от кадра до события.

На практике инференс занимает меньшую часть пути. Декодирование потока, копирование кадра между хостом и устройством, препроцессинг, постобработка и логика трекинга суммарно нередко дают больше, чем сама нейросеть.

Полезное упражнение — прогнать пайплайн с заглушкой вместо модели. Если задержка упала не в разы, дальнейшая оптимизация архитектуры почти ничего не даст, и работать нужно с окружением.

Второе типовое место потерь — батчинг. Сбор кадров с разных камер в один батч поднимает пропускную способность, но добавляет ожидание. Для сценариев с реакцией оператора это ожидание часто дороже, чем выигрыш в утилизации GPU.

Ко всем статьям