← Назад к блогу

Агент сломал production. Что писать в postmortem?

Агент сломал production. Что писать в postmortem?Агент сломал production. Что писать в postmortem?

Допустим, AI-агент изменил конфигурацию, запустил не ту команду или удалил данные. Production лежит.

Самый бесполезный вывод такого расследования:

«Модель ошиблась».

Это примерно как написать в RCA «разработчик ошибся» и гордо закрыть инцидент.

В обычном postmortem мы спрашиваем:

— что произошло; 
— почему защита не сработала; 
— как предотвратить повтор.

Для инцидента с AI этого недостаточно. Нужно восстановить всю цепочку принятия решения.

Какой контекст получил агент? 
Были ли в нём актуальные данные, ограничения и состояние системы?

Какие инструкции ему дали? 
Не допускали ли они несколько трактовок? Было ли явно сказано, чего делать нельзя?

Какой инструмент позволил выполнить опасное действие? 
Зачем агенту вообще был доступен production, удаление данных или запуск команд без ограничений?

Где должна была сработать проверка? 
Перед генерацией решения, перед выполнением команды или после изменения?

Можно ли было проверить результат автоматически? 
Например, через dry run, тест, diff, health-check или откат.

Почему человек одобрил изменение? 
Он увидел понятный diff и оценил последствия — или просто нажал Approve, потому что «AI обычно справляется»?

Root cause почти никогда не находится внутри модели.

Обычно он находится в системе вокруг неё:

— слишком широкие права; 
— недостаточный контекст; 
— неоднозначные инструкции; 
— отсутствие проверок; 
— непрозрачный результат; 
— формальное человеческое одобрение.

AI-инциденты не требуют отказаться от агентов. Они требуют проектировать их как потенциально ошибающихся участников процесса.

Хороший postmortem отвечает не на вопрос «почему AI ошибся?», а на вопрос «почему одна ошибка смогла дойти до production и причинить ущерб?».