Метрики качества детектора дефектов — это количественные показатели, оценивающие точность, полноту и эффективность системы машинного зрения при выявлении производственных дефектов. Ключевые метрики включают precision (точность), recall (полноту), F1-score, mAP (средняя точность) и IoU (пересечение с объединением). Они позволяют инженерам сравнивать алгоритмы, настраивать пороги срабатывания и прогнозировать влияние автоматизации на долю брака.
Что такое метрики детектора дефектов
Метрики детектора дефектов — это числовые характеристики, описывающие способность системы идентифицировать и классифицировать дефекты на изображениях или видеопотоке. В отличие от субъективной оценки оператора, метрики дают объективную основу для:
- выбора алгоритма под конкретный тип дефектов (трещины, сколы, вмятины);
- калибровки порогов уверенности модели;
- расчёта экономического эффекта от внедрения.
Базовые метрики строятся на четырёх исходах работы детектора:
- Истинно положительный (TP) — дефект обнаружен и классифицирован верно.
- Ложноположительный (FP) — система пометила область как дефект, но её нет.
- Истинно отрицательный (TN) — отсутствие дефекта подтверждено правильно.
- Ложноотрицательный (FN) — дефект пропущен.
Precision и recall: баланс точности и полноты
Precision и recall — две взаимодополняющие метрики, отражающие разные аспекты качества детектора.
| Метрика | Формула | Что показывает | Типичные значения* |
|---|---|---|---|
| Precision | TP / (TP + FP) | Доля верно обнаруженных дефектов среди всех срабатываний | 0.85–0.98 |
| Recall | TP / (TP + FN) | Доля найденных дефектов от общего числа реальных дефектов | 0.70–0.95 |
*Диапазоны зависят от типа дефектов и условий съёмки. Например, для микротрещин на металле recall обычно ниже из-за сложности детекции.
Как работает баланс:
- Высокий precision критичен, когда ложные срабатывания ведут к остановке линии (например, при контроле лекарственных ампул).
- Высокий recall важен для безопасности (дефекты сварных швов в авиастроении), где пропуск дефекта опаснее ложной тревоги.
Настройка порога уверенности модели позволяет смещать баланс между precision и recall. График precision-recall curve визуализирует этот компромисс.
F1-score и mAP: агрегированные метрики
Когда precision и recall противоречат друг другу, используют агрегированные метрики.
| Метрика | Формула | Когда применять | Ограничения |
|---|---|---|---|
| F1-score | 2 × (Precision × Recall) / (Precision + Recall) | Для бинарной классификации (дефект/не дефект) | Не учитывает распределение классов |
| mAP | Среднее AP по всем классам дефектов | Для многоклассовой детекции (например, трещины + коррозия + сколы) | Требует большого объёма данных |
Пример расчёта F1-score:
- Precision = 0.90, Recall = 0.80 → F1-score = 0.85.
- Precision = 0.95, Recall = 0.70 → F1-score = 0.81.
mAP (mean Average Precision) — стандарт для оценки детекторов в задачах object detection (YOLO, Faster R-CNN). Рассчитывается как площадь под precision-recall curve для каждого класса дефектов, затем усредняется.
IoU: метрика локализации дефектов
IoU (Intersection over Union) оценивает точность позиционирования дефекта на изображении. Формула:
IoU = Площадь пересечения / Площадь объединения
где:
- Площадь пересечения — область, где предсказанный bounding box совпадает с истинным.
- Площадь объединения — суммарная площадь обоих боксов за вычетом пересечения.
| IoU | Интерпретация | Применение |
|---|---|---|
| < 0.5 | Неудовлетворительная локализация | Требует дообучения модели |
| 0.5–0.7 | Приемлемо для грубой детекции | Контроль крупных дефектов (вмятины) |
| > 0.7 | Высокая точность | Микродефекты (трещины < 0.1 мм) |
IoU критичен для задач, где важна не только классификация, но и геометрия дефекта (например, при лазерной резке металла).
Этапы оценки метрик на производстве
Внедрение детектора дефектов требует поэтапной валидации метрик.
| Этап | Действия | Ключевые метрики |
|---|---|---|
| Сбор данных | Формирование датасета с аннотированными дефектами (минимум 1000 примеров на класс) | — |
| Обучение модели | Тренировка алгоритма на 70–80% данных, валидация на 20–30% | Precision, Recall, mAP |
| Тестирование | Проверка на реальных изображениях с линии | IoU, F1-score |
| Калибровка | Настройка порогов уверенности и фильтров | Precision (для минимизации FP) |
| Мониторинг | Непрерывный сбор статистики в эксплуатации | Recall (для минимизации FN) |
Числовые пороги здесь — типовые ориентиры для планирования, а не гарантированный результат. На конкретной линии их согласуют и фиксируют в техническом задании до старта работ.
Типичные ошибки на этапах:
- Сбор данных: Несбалансированные классы (например, 90% изображений без дефектов).
- Обучение: Переобучение на специфичных артефактах камеры.
- Тестирование: Использование синтетических данных вместо реальных шумов линии.
Применение метрик на производстве
Метрики детектора дефектов напрямую влияют на ключевые показатели производства.
Снижение доли брака:
- Recall > 0.90 позволяет сократить пропуск дефектов на финальном контроле.
- Пример: На линии упаковки лекарств recall 0.95 снижает риск отгрузки бракованной продукции.
Оптимизация затрат:
- Precision > 0.90 уменьшает количество ложных остановок линии.
- Пример: В металлургии precision 0.92 сокращает расходы на повторный контроль.
Интеграция с ERP:
- Метрики mAP и IoU используются для автоматической классификации дефектов в системах MES.
Реальный кейс: На заводе по производству автомобильных стекол детектор с mAP 0.85 и IoU 0.75 заменил ручной контроль 3 операторов. Recall 0.88 обеспечил выявление 9 из 10 микротрещин, а precision 0.91 снизил ложные срабатывания до 1 на 1000 изделий.
Типичные ошибки при работе с метриками
Игнорирование контекста:
- Стремление к максимальному recall без учёта последствий (например, остановка линии из-за FP).
- Решение: Анализ стоимости ошибок (FN vs FP) для конкретного производства.
Оценка только на тестовых данных:
- Метрики на чистых изображениях не отражают реальные условия (вибрация, пыль, изменение освещения).
- Решение: Тестирование на данных с линии в разное время суток.
Смешение метрик:
- Использование accuracy (доля верных ответов) для несбалансированных классов.
- Пример: Если дефекты встречаются в 1% случаев, accuracy 99% может скрывать низкий recall.
Статичные пороги:
- Фиксированный порог уверенности не учитывает вариативность дефектов.
- Решение: Динамическая настройка порогов с помощью ROC-кривых.
FAQ
1. Какую метрику выбрать для детекции микротрещин на металле? Для микротрещин критичен recall (минимизация пропусков), но с контролем IoU > 0.7 для точной локализации. Типичный компромисс: recall 0.85 при precision 0.80.
2. Почему mAP лучше F1-score для многоклассовой детекции? F1-score усредняет метрики по классам без учёта распределения дефектов. mAP учитывает ранжирование предсказаний и лучше отражает качество детектора для редких классов (например, коррозия на 5% изображений).
3. Как часто нужно пересчитывать метрики в эксплуатации? Метрики пересчитываются при:
- изменении условий съёмки (новая камера, освещение);
- появлении новых типов дефектов;
- обновлении модели. Рекомендуемый интервал — раз в 3–6 месяцев или после 10 000 обработанных изображений.