Когда команда говорит «мы взяли GPT и сделали агента», опытный инженер слышит примерно то же, что механик в фразе «мы купили двигатель и сделали автомобиль». Двигатель необходим, но автомобилем его делает всё остальное — и именно это «всё остальное» в мире агентов называется словом harness.

Буквально harness — «упряжь»: то, что превращает силу лошади в полезную работу. Метафора точнее, чем кажется. Языковая модель сама по себе умеет одно — продолжать текст. Harness превращает эту способность в выполнение задач: даёт модели инструменты, следит за циклом её работы, ограничивает ущерб от ошибок и возвращает результат в форме, которой можно доверять.

Из чего состоит harness

В зрелых системах harness — это четыре слоя, каждый из которых отвечает на свой вопрос.

Контур исполнения. Кто решает, что модель закончила? Цикл «подумала — вызвала инструмент — получила результат — продолжила» кажется тривиальным, пока не встречаешь задачу на сорок шагов, где на двадцать третьем модель уходит не туда. Контур определяет бюджеты шагов, условия остановки и то, как система понимает, что зашла в тупик.

Инструменты. Что модель может делать, кроме как писать текст? Поиск, выполнение кода, запросы к базам, отправка писем. Проектирование инструментов — отдельное ремесло: слишком широкий инструмент опасен, слишком узкий бесполезен, а описание инструмента — это интерфейс, который модель должна понять без обучения.

Контекст. Что модель видит в каждый момент? Окно конечно, задачи — нет. Harness решает, что сжать, что вынести во внешнюю память, что показать заново. Большая часть «глупости» агентов — на самом деле плохо собранный контекст.

Ограждения. Что произойдёт, когда модель ошибётся? Не «если» — «когда». Права доступа, песочницы, подтверждения необратимых действий, журналирование. Ограждения — это разница между неприятным инцидентом и заголовком в новостях.

Команды меняют модель и ждут чуда. Но если агент буксует, в девяти случаях из десяти чинить нужно упряжь, а не лошадь.

Почему это понятие стало главным

Модели за последние два года подорожали в возможностях и подешевели в доступе — у всех примерно одинаковый «двигатель». Конкурентное преимущество переехало в harness: у кого лучше устроен цикл исполнения, инструменты и контроль качества, у того агент реально работает. Это заметно даже по продуктам: разница между посредственным и отличным кодинг-агентом на одной и той же модели — целиком разница в harness.

Отсюда практический вывод для тех, кто планирует внедрение: вопрос «какую модель возьмём?» стоит задавать последним. Сначала — «как устроен контур, кто проверяет качество и что случится при ошибке». Ответы на эти вопросы и есть проект.

Как проверить свой harness

Три вопроса, которые мы задаём на каждой диагностике. Если на любой из них ответ «не знаем» — работа есть.

Первый: можно ли воспроизвести неудачный запуск? Без журналирования каждого шага отладка агента — гадание.

Второй: что агент физически не может сделать? Список должен существовать в коде, а не в надеждах.

Третий: как вы узнаете, что новая версия хуже старой? Если ответ — «пользователи пожалуются», эвалов у вас нет.

Harness — скучное слово для скучной работы. Но именно эта работа отличает агентов, которые показывают на демо, от агентов, которым доверяют деньги и данные. Мы за вторых.

← Все статьи