Разметка данных

**Разметка данных (data labeling)** — процесс присвоения меток объектам исходного датасета: изображениям, видеокадрам, сигналам с датчиков, временным рядам PLC, текстовым журналам событий. Метка задаёт класс дефекта, идентификатор детали или состояние оборудования. Без размеченной обучающей выборки невозможно обучить модель машинного зрения или предиктивной аналитики — алгоритму не с чем сравнивать предсказания.

**Разметка данных (data labeling)** — процесс присвоения меток объектам исходного датасета: изображениям, видеокадрам, сигналам с датчиков, временным рядам PLC, текстовым журналам событий. Метка задаёт класс дефекта, идентификатор детали или состояние оборудования. Без размеченной обучающей выборки невозможно обучить модель машинного зрения или предиктивной аналитики — алгоритму не с чем сравнивать предсказания. На производстве разметка превращает сырые данные в структурированный набор примеров с известными правильными ответами. Это могут быть кадры сварного шва с обведёнными трещинами, аудиозаписи с метками аномальных вибраций подшипников или журналы параметров ПЛК с пометками предотказных состояний.

Зачем нужна разметка

Качество размеченного датасета напрямую определяет точность финальной модели. Смещение классов на 3-5 % на этапе аннотации приводит к падению precision на 15-20 % при промышленном внедрении.

Разметка решает три практические задачи:

  • Формирует эталонный набор для обучения алгоритмов распознавания дефектов, деталей, аномалий.
  • Создаёт базу для контроля качества работы модели на валидационных выборках.
  • Обеспечивает измеримый критерий приемки модели перед запуском в цех.

Без размеченных данных любое AI-решение остаётся на уровне гипотезы.

Как выполняется разметка

Процесс строится из последовательных этапов. Разметчики — технологи, операторы или привлечённые эксперты — открывают сырой датасет в специализированном ПО и проставляют аннотации. Типы меток зависят от задачи: прямоугольная рамка (bounding box) для локализации дефекта, полигон для точного контура, класс для категории, значение для числового параметра.

Этапы процесса с описанием и результатом каждого — в таблице.

Этап Действие Результат
1 Сбор сырых данных с камер, датчиков, PLC Исходный датасет без меток
2 Выбор инструмента разметки и назначение разметчиков Настроенный рабочий процесс
3 Простановка аннотаций по инструкции (класс, рамка, полигон) Первичный размеченный датасет
4 Контроль согласованности — несколько разметчиков на одних фрагментах Оценка межразметчикового расхождения
5 Разрешение спорных случаев по регламенту с экспертом Консенсусная разметка
6 Сплит датасета на обучающую, валидационную и тестовую части (обычно 70/15/15) Три выборки для обучения и контроля
7 Итеративная корректировка по результатам тестирования модели Актуализированная разметка

На каждом цикле датасет может возвращаться на доразметку — когда модель показывает низкую уверенность на определённых классах, эти примеры отправляют эксперту для уточнения.

Сравнение подходов к разметке

На практике используют три основных варианта организации процесса. Каждый имеет свою область применения и ограничения.

Критерий Ручная разметка экспертами Полуавтоматическая (pre-labeling) Аутсорсинг через платформы
Точность меток Высокая (доменная экспертиза) Средняя — зависит от качества пре-модели Низкая-средняя без профильного контроля
Скорость обработки Низкая — 50-200 кадров в час Высокая — модель размечает, человек верифицирует Высокая — параллельная работа сотен разметчиков
Стоимость одного объекта Высокая (время инженера) Средняя (соотношение 1:3 — 1:5 по времени) Низкая на объёме, но скрытые затраты на контроль
Применимость для редких дефектов Высокая — эксперт знает нетипичные случаи Средняя — пре-модель не обучена на редкостях Низкая — аутсорсер не имеет отраслевого контекста
Контроль качества на всём датасете Полный Частичный (проверяют расхождения) Фрагментарный — проверяют только выборочно

Автоматизация без контроля качества не рекомендуется: модель, обученная на "грязной" разметке, выдаёт нестабильные результаты на новых партиях. Оптимальный компромисс — предварительная разметка обученной моделью с последующей верификацией технологом (pre-labeling + human-in-the-loop). Такой подход сокращает трудозатраты в 3-5 раз без потери качества при условии чёткого регламента верификации.

Когда применять: критерии и пороги

Инвестиции в разметку окупаются, если проект удовлетворяет нескольким условиям. В таблице — пороговые значения для принятия решения.

Условие Пороговое значение Действие
Ожидаемое снижение ручного контроля качества > 30 % трудозатрат Проект экономически оправдан
Разнообразие типов дефектов на линии > 5 классов Обязательна детальная классификация
Частота появления нетипичных дефектов > 2 % от объёма Требуется отдельное аннотирование редкостей
Число камер на линии > 3 единиц Необходима автоматизация процесса разметки
Доступность технологов для аннотации > 10 часов в неделю Можно вести ручную разметку силами предприятия
Бюджет на подготовку датасета > 500 тыс. руб. Целесообразен наём специализированного подрядчика

Минимальный объём для старта обучения определяется экспериментально — универсального числа не существует. Для простой бинарной классификации (брак/годен) достаточно 500-1000 размеченных кадров. Для сегментации дефектов сварных швов требуется от 5000 аннотированных изображений с учётом разных условий освещения и положений детали.

Где применяется на производстве

  • Визуальный контроль качества — разметка кадров с дефектами покрытия, царапинами, сколами, трещинами на литых и штампованных деталях.
  • Классификация брака — присвоение категорий типовым отклонениям (недолив, утяжина, разнотолщинность) для автоматической сортировки.
  • Сегментация деталей на конвейере — выделение контуров узлов на сборочных линиях для подсчёта и проверки комплектности.
  • Мониторинг состояния по виброакустике — маркировка участков сигнала с аномальными частотами, соответствующими деградации подшипников или дисбалансу.
  • Анализ журналов PLC и SCADA — разметка временных рядов с предотказными паттернами для предиктивной диагностики.

Частые ошибки

  1. Разметка силами неспециалистов без отраслевого контекста — операторы понимают процесс, но не знают критериев дефекта по стандарту; проектировщики знают стандарты, но не видят процесс в динамике. Классы смешиваются. Решение — привлекать технологов, которые работают с дефектами ежедневно.

  2. Датасет не покрывает редкие классы — модель обучается на частых дефектах и пропускает нетипичный брак. На производстве редкие классы составляют 2-5 % объёма, но именно они дают наибольшие потери. Решение — целенаправленный сбор и даунсемплинг редких случаев.

  3. Отсутствие контроля консистентности между разметчиками — один оператор отмечает трещину, другой — царапину, третий пропускает оба дефекта. Межразметчиковое расхождение выше 5 % делает датасет непригодным для обучения. Решение — регулярные калибровочные сессии и метрика согласованности (Cohen's Kappa).

  4. Разметка без учёта вариативности условий съёмки — модель обучается на кадрах при идеальном освещении и отказывает в цеховых условиях с бликами, тенями, смещением детали. Решение — включать в датасет все реальные условия работы камер.

  5. Экономия на проверке размеченных данных — выборку не перепроверяют после разметки. Ошибки накапливаются, модель учится на шуме. Решение — выделять 10-15 % датасета на кросс-проверку независимым экспертом.

Вывод

Разметка данных — обязательный этап подготовки обучающей выборки для моделей компьютерного зрения и предиктивной аналитики. Качество аннотаций напрямую определяет точность промышленного AI: смещение классов на 5 % снижает precision на 15-20 %. Эффективный подход — полуавтоматическая разметка с верификацией экспертом и контролем согласованности между разметчиками, что сокращает трудозатраты в 3-5 раз при сохранении качества датасета.

Частые вопросы

Сколько примеров нужно разметить для старта обучения?
Минимальный объём определяется сложностью задачи и числом классов. Для бинарной задачи (дефект/норма) на стабильном производстве достаточно 500-1000 аннотированных кадров. Для многоклассовой сегментации с учётом вариативности освещения требуется от 5000. Точные пороги устанавливают экспериментально по кривой обучения — когда добавление новых примеров перестаёт повышать метрику на валидации.
Можно ли полностью автоматизировать разметку данных?
Полная автоматизация без экспертного контроля не рекомендуется. Оптимальный вариант — предварительная разметка моделью с последующей верификацией технологом (pre-labeling). Такой подход сокращает время разметки в 3-5 раз, сохраняя качество на уровне ручной аннотации.
Кто должен выполнять разметку на предприятии?
Предпочтительно технологи или операторы, знакомые с конкретным типом дефекта и условиями процесса. Доменная экспертиза критична: только специалист отличит усталостную трещину от риски от инструмента или решит, является ли затемнение на сварном шве дефектом или допустимым отклонением по стандарту.
Как контролировать качество разметки в больших проектах?
Вводят межразметчиковое согласование: один фрагмент аннотируют 2-3 человека, расхождения разрешаются по регламенту. Метрика согласия (например, Cohen's Kappa) не должна опускаться ниже 0,8. Дополнительно выделяют 10-15 % датасета для кросс-проверки независимым экспертом.

Подробнее в гайде: Компьютерное зрение в контроле качества: как AI снижает брак на 60–80%