Запуск AI-агента: прогон на истории, тихий режим и пилот

Для кого эта статья: для тех, у кого AI-агент уже собран и настроен — и очень хочется нажать «включить». Это разбор шестого шага из гайда «Как создать AI-агента»: как запустить так, чтобы первые ошибки агента не увидели клиенты.
Чем поможет: опишет три ступени запуска — прогон на истории, «тихий» режим и пилот, — какие метрики собирать на каждой и когда можно расширять охват.
Запуск агента сразу «в бой» — самый дорогой способ узнать, что вы что-то упустили. Ошибки на старте неизбежны: не потому что агент плохой, а потому что реальность всегда богаче тестовых сценариев. Вся механика поэтапного запуска построена на одной идее: пусть агент ошибается там, где это ничего не стоит.

Ступень 1. Прогон на исторических данных
Возьмите 100–200 реальных кейсов из прошлого — писем, диалогов, заявок — и дайте их агенту. У каждого кейса уже есть ответ человека, значит есть с чем сравнивать. Здесь ловятся системные проблемы: агент не понимает ваш жаргон, путается в похожих товарах, теряется на длинных диалогах. Чинить их на этой ступени — бесплатно: ни один клиент ничего не видел.
Отобранные кейсы не выбрасывайте — это готовый эталонный набор для регресс-тестов, который дальше прогоняется после каждой правки промпта (зачем это нужно — в разборе настройки агента).
Ступень 2. «Тихий» режим
Shadow-режим — главный инструмент безопасного запуска. Агент работает на живом потоке: читает реальные обращения, формирует ответы и действия. Но финальную кнопку нажимает человек: он видит вариант агента, может отправить его, поправить или написать свой.
Что это даёт:
- Точную метрику качества. Каждое обращение — сравнение «агент против человека». Ориентир для перехода дальше: совпадение решений выше 95% и ноль критических ошибок.
- Разметку бесплатно. Каждая правка оператора — указание, где агент слаб. Это готовый список доработок.
- Привыкание команды. Операторы видят, что агент — помощник, который пишет черновики, а не конкурент. Сопротивление тает до запуска, а не после.
Типичная ловушка тихого режима: смотреть только на процент совпадений. Разбирайте расхождения по одному — среди них есть и ошибки агента, и, внезапно, ошибки людей, которые агент делал правильно. Второе случается чаще, чем ожидают.
Ступень 3. Пилот на ограниченном участке
Когда тихий режим дал стабильные цифры, агент получает право действовать сам — но на узком участке: один канал, одна категория вопросов, часть клиентов. Границы участка выбирайте там, где цена ошибки минимальна: внутренние процессы, типовые вопросы, некритичные операции.
Метрики пилота:
- точность — доля ответов, не потребовавших исправления;
- эскалации — как часто агент передаёт диалог человеку и по каким причинам;
- скорость — время ответа и время решения вопроса до и после;
- реакция клиентов — оценки, повторные обращения по той же теме, жалобы.
Расширяйте охват шагами: новый канал, новая категория, больше клиентов — и после каждого шага смотрите на метрики, а не на календарь. Если качество просело — шаг назад и разбор, это нормальная часть процесса, а не провал.
После запуска: мониторинг — это режим, а не проверка
Полный запуск не отменяет наблюдение. Метрики собираются постоянно, расхождения разбираются, база знаний пополняется. Отдельно следите за «дрейфом»: вендор обновил модель — поведение агента может измениться без единой вашей правки. Ловится это тем же эталонным набором кейсов, прогнанным по расписанию. И у всего этого должен быть владелец внутри компании — иначе через пару месяцев метрики никто не смотрит, а агент тихо деградирует.
Запустим без нервов
Проведём агента по всем трём ступеням — от прогона на истории до пилота с метриками — и передадим вам работающий процесс, а не эксперимент: AI-агенты для бизнеса под ключ. Найти процесс для первого пилота поможет AI-аудит. Разбор вашей задачи — бесплатно.
Похожая задача в вашем бизнесе?
Разберём ваш контур и подскажем, как закрыть её на вашем стеке — бесплатно.

