Метрики качества детектора дефектов

Метрики качества детектора дефектов — это количественные показатели, оценивающие точность, полноту и эффективность системы машинного зрения при выявлении про…

Метрики качества детектора дефектов — это количественные показатели, оценивающие точность, полноту и эффективность системы машинного зрения при выявлении производственных дефектов. Ключевые метрики включают precision (точность), recall (полноту), F1-score, mAP (средняя точность) и IoU (пересечение с объединением). Они позволяют инженерам сравнивать алгоритмы, настраивать пороги срабатывания и прогнозировать влияние автоматизации на долю брака.


Что такое метрики детектора дефектов

Метрики детектора дефектов — это числовые характеристики, описывающие способность системы идентифицировать и классифицировать дефекты на изображениях или видеопотоке. В отличие от субъективной оценки оператора, метрики дают объективную основу для:

  • выбора алгоритма под конкретный тип дефектов (трещины, сколы, вмятины);
  • калибровки порогов уверенности модели;
  • расчёта экономического эффекта от внедрения.

Базовые метрики строятся на четырёх исходах работы детектора:

  1. Истинно положительный (TP) — дефект обнаружен и классифицирован верно.
  2. Ложноположительный (FP) — система пометила область как дефект, но её нет.
  3. Истинно отрицательный (TN) — отсутствие дефекта подтверждено правильно.
  4. Ложноотрицательный (FN) — дефект пропущен.

Precision и recall: баланс точности и полноты

Precision и recall — две взаимодополняющие метрики, отражающие разные аспекты качества детектора.

Метрика Формула Что показывает Типичные значения*
Precision TP / (TP + FP) Доля верно обнаруженных дефектов среди всех срабатываний 0.85–0.98
Recall TP / (TP + FN) Доля найденных дефектов от общего числа реальных дефектов 0.70–0.95

*Диапазоны зависят от типа дефектов и условий съёмки. Например, для микротрещин на металле recall обычно ниже из-за сложности детекции.

Как работает баланс:

  • Высокий precision критичен, когда ложные срабатывания ведут к остановке линии (например, при контроле лекарственных ампул).
  • Высокий recall важен для безопасности (дефекты сварных швов в авиастроении), где пропуск дефекта опаснее ложной тревоги.

Настройка порога уверенности модели позволяет смещать баланс между precision и recall. График precision-recall curve визуализирует этот компромисс.


F1-score и mAP: агрегированные метрики

Когда precision и recall противоречат друг другу, используют агрегированные метрики.

Метрика Формула Когда применять Ограничения
F1-score 2 × (Precision × Recall) / (Precision + Recall) Для бинарной классификации (дефект/не дефект) Не учитывает распределение классов
mAP Среднее AP по всем классам дефектов Для многоклассовой детекции (например, трещины + коррозия + сколы) Требует большого объёма данных

Пример расчёта F1-score:

  • Precision = 0.90, Recall = 0.80 → F1-score = 0.85.
  • Precision = 0.95, Recall = 0.70 → F1-score = 0.81.

mAP (mean Average Precision) — стандарт для оценки детекторов в задачах object detection (YOLO, Faster R-CNN). Рассчитывается как площадь под precision-recall curve для каждого класса дефектов, затем усредняется.


IoU: метрика локализации дефектов

IoU (Intersection over Union) оценивает точность позиционирования дефекта на изображении. Формула:

IoU = Площадь пересечения / Площадь объединения

где:

  • Площадь пересечения — область, где предсказанный bounding box совпадает с истинным.
  • Площадь объединения — суммарная площадь обоих боксов за вычетом пересечения.
IoU Интерпретация Применение
< 0.5 Неудовлетворительная локализация Требует дообучения модели
0.5–0.7 Приемлемо для грубой детекции Контроль крупных дефектов (вмятины)
> 0.7 Высокая точность Микродефекты (трещины < 0.1 мм)

IoU критичен для задач, где важна не только классификация, но и геометрия дефекта (например, при лазерной резке металла).


Этапы оценки метрик на производстве

Внедрение детектора дефектов требует поэтапной валидации метрик.

Этап Действия Ключевые метрики
Сбор данных Формирование датасета с аннотированными дефектами (минимум 1000 примеров на класс)
Обучение модели Тренировка алгоритма на 70–80% данных, валидация на 20–30% Precision, Recall, mAP
Тестирование Проверка на реальных изображениях с линии IoU, F1-score
Калибровка Настройка порогов уверенности и фильтров Precision (для минимизации FP)
Мониторинг Непрерывный сбор статистики в эксплуатации Recall (для минимизации FN)

Числовые пороги здесь — типовые ориентиры для планирования, а не гарантированный результат. На конкретной линии их согласуют и фиксируют в техническом задании до старта работ.

Типичные ошибки на этапах:

  1. Сбор данных: Несбалансированные классы (например, 90% изображений без дефектов).
  2. Обучение: Переобучение на специфичных артефактах камеры.
  3. Тестирование: Использование синтетических данных вместо реальных шумов линии.

Применение метрик на производстве

Метрики детектора дефектов напрямую влияют на ключевые показатели производства.

  1. Снижение доли брака:

    • Recall > 0.90 позволяет сократить пропуск дефектов на финальном контроле.
    • Пример: На линии упаковки лекарств recall 0.95 снижает риск отгрузки бракованной продукции.
  2. Оптимизация затрат:

    • Precision > 0.90 уменьшает количество ложных остановок линии.
    • Пример: В металлургии precision 0.92 сокращает расходы на повторный контроль.
  3. Интеграция с ERP:

    • Метрики mAP и IoU используются для автоматической классификации дефектов в системах MES.

Реальный кейс: На заводе по производству автомобильных стекол детектор с mAP 0.85 и IoU 0.75 заменил ручной контроль 3 операторов. Recall 0.88 обеспечил выявление 9 из 10 микротрещин, а precision 0.91 снизил ложные срабатывания до 1 на 1000 изделий.


Типичные ошибки при работе с метриками

  1. Игнорирование контекста:

    • Стремление к максимальному recall без учёта последствий (например, остановка линии из-за FP).
    • Решение: Анализ стоимости ошибок (FN vs FP) для конкретного производства.
  2. Оценка только на тестовых данных:

    • Метрики на чистых изображениях не отражают реальные условия (вибрация, пыль, изменение освещения).
    • Решение: Тестирование на данных с линии в разное время суток.
  3. Смешение метрик:

    • Использование accuracy (доля верных ответов) для несбалансированных классов.
    • Пример: Если дефекты встречаются в 1% случаев, accuracy 99% может скрывать низкий recall.
  4. Статичные пороги:

    • Фиксированный порог уверенности не учитывает вариативность дефектов.
    • Решение: Динамическая настройка порогов с помощью ROC-кривых.

FAQ

1. Какую метрику выбрать для детекции микротрещин на металле? Для микротрещин критичен recall (минимизация пропусков), но с контролем IoU > 0.7 для точной локализации. Типичный компромисс: recall 0.85 при precision 0.80.

2. Почему mAP лучше F1-score для многоклассовой детекции? F1-score усредняет метрики по классам без учёта распределения дефектов. mAP учитывает ранжирование предсказаний и лучше отражает качество детектора для редких классов (например, коррозия на 5% изображений).

3. Как часто нужно пересчитывать метрики в эксплуатации? Метрики пересчитываются при:

  • изменении условий съёмки (новая камера, освещение);
  • появлении новых типов дефектов;
  • обновлении модели. Рекомендуемый интервал — раз в 3–6 месяцев или после 10 000 обработанных изображений.

Частые вопросы

1. Какую метрику выбрать для детекции микротрещин на металле?
Для микротрещин критичен recall (минимизация пропусков), но с контролем IoU > 0.7 для точной локализации. Типичный компромисс: recall 0.85 при precision 0.80.
2. Почему mAP лучше F1-score для многоклассовой детекции?
F1-score усредняет метрики по классам без учёта распределения дефектов. mAP учитывает ранжирование предсказаний и лучше отражает качество детектора для редких классов (например, коррозия на 5% изображений).
3. Как часто нужно пересчитывать метрики в эксплуатации?
Метрики пересчитываются при: