Надёжная ИИ-система не обещает отсутствие ошибок. Она знает, какие ошибки допустимы, обнаруживает критичные случаи и не позволяет неподтверждённому ответу стать бизнес-действием.
Разделите классы ошибок
Нужно отдельно считать выдуманные факты, пропущенные факты, неправильную классификацию, неверный формат, использование устаревшего источника, нарушение инструкции и опасное действие.
Одна средняя «точность 90%» скрывает распределение риска и почти ничего не говорит о готовности к промышленная эксплуатация.
Задайте источник истины
Фактический ответ должен опираться на утверждённые данные. Для RAG сохраняются идентификаторы и версии источников; пользователю или проверяющему показывается основание ответа.
Если подтверждённого источника нет, система должна отказаться от утверждения, запросить уточнение или передать задачу человеку.
Ограничьте формат и пространство ответа
Структурированная схема, перечисление допустимых значений, валидация типов и бизнес-правил позволяют обнаружить часть ошибок до их попадания в систему.
Проверка должна происходить вне модели. Просьба «проверь себя» может быть дополнительным шагом, но не заменяет детерминированную валидацию.
- JSON Schema или типизированная модель
- Проверка обязательных полей
- Ссылочная целостность
- Диапазоны и бизнес-ограничения
Создайте эталонный набор
Тестовый набор включает обычные, граничные, конфликтующие и враждебные примеры. Для каждого примера фиксируются ожидаемый результат и недопустимые ответы.
После изменения модели, промпта, источников или правил набор запускается повторно. Так качество становится частью релиза, а не разовой демонстрацией.
Контролируйте промышленная эксплуатация
В эксплуатации измеряются качество по выборке, доля отказов, ручных исправлений, эскалаций, стоимость операции и дрейф распределения входов.
Пользователь должен иметь простой способ отметить ошибку, а команда — связать её с версией модели, промпта, источника и инструментов.
Ориентиры и стандарты
Материал опирается на практику проектирования и следующие открытые источники: