Что можно доверить ИИ-агенту, а что нельзя: матрица автономности

Что можно доверить ИИ-агенту, а что нельзя: матрица автономности — обложка статьи

Что можно доверить ИИ-агенту, а что нельзя, решается по двум простым вопросам: насколько обратима ошибка и насколько сам агент уверен в том, что делает. Если ошибку легко откатить и агент уверен, пусть работает сам (переписать черновик, разложить тикеты, ответить на типовой вопрос). Если ошибка дорогая и необратимая, но агент уверен, пусть готовит черновик и ждёт вашего «да» (письмо клиенту, публикация, удаление файлов, правка данных в CRM). Если ошибка дорогая, а агент плавает, руки прочь: деньги, доступы, безопасность решает человек. Это и есть матрица автономности по двум осям, риск и уверенность. Я собрала её, чтобы не повторить историю стартаперов, у которых Replit взял и удалил всю базу с клиентами, а потом коротенько повинился. Ниже разберу все четыре квадранта, покажу на живых примерах, где агент врёт даже в простом скрининге, и честно скажу, где без человека нельзя.

Зачем вообще нужна матрица автономности

Самый частый вопрос новичка звучит так: «Раз агент умный, почему я не могу отдать ему всё сразу?» Потому что «умный» и «безопасно рулит» — это разные вещи. Агент бодро делает то, что вы разрешили, даже если ошибётся. И тут вся разница в том, можно ли откатить его косяк или нет.

Вспомните тех стартаперов, у которых Replit взял и удалил всю базу данных с клиентами, после чего только коротенько повинился. Вот это ровно тот случай, когда агенту дали порулить там, где рулить было нельзя. База не откатывается одним кликом, а извинение агента её не вернёт.

Чтобы не гадать каждый раз заново, я держу в голове две оси. Первая: обратима ли ошибка (можно ли всё вернуть как было за пару минут или нет). Вторая: насколько сам агент уверен в том, что делает. На пересечении получаются четыре квадранта, и для каждого своё правило. Поехали по порядку.

Квадрант 1: низкий риск плюс уверенность — пусть делает сам

Это зелёная зона, где агенту можно дать волю. Ошибка тут обратима, а сам он на знакомой территории. Отдавайте без оглядки такие вещи:

  • переписать черновик текста почеловечнее;
  • разложить входящие тикеты по папкам;
  • ответить на типовой вопрос, который повторяется по сто раз в день.

Логика простая: если агент напортачит, вы это заметите и поправите за минуту, никто не пострадал. Здесь ручное подтверждение только тормозит. Смысл автоматизации как раз в том, чтобы снять с вас рутину, а не заставить одобрять каждый чих.

Моё правило для этой зоны: относитесь к агенту как к толковому стажёру на простых поручениях. Он их тянет, а вы освобождаете себе голову под то, что важнее.

Квадрант 2: низкий риск плюс сомнение — пусть переспросит

Тут ошибка всё ещё дешёвая, но агент сам не уверен. Классика: данные пришли кривые, формулировка мутная, вариантов действия несколько и непонятно, какой ваш. В такой ситуации правильное поведение агента не угадывать, а переспросить.

Это важный момент, потому что многие путают уверенный тон агента с правильным ответом. Модель почти всегда звучит убедительно, даже когда плавает. Хороший агент в спорной ситуации честно поднимает руку и говорит «я не понял, уточни», а не додумывает за вас.

М-да, но по умолчанию агенты этого не делают, их приходится специально просить переспрашивать при сомнении. В промпте это прямо и прописывают: «если не уверен, не действуй, а задай вопрос». Мелочь, а спасает от кучи тихих косяков.

Квадрант 3: высокий риск плюс уверенность — черновик и ваше «да»

Самый коварный квадрант. Агент уверен в себе, звучит убедительно, а цена ошибки высокая и необратимая. Сюда попадает всё, что нельзя откатить одним кликом:

  • письмо клиенту (отправил и не вернёшь);
  • публикация поста;
  • удаление файлов;
  • изменение данных в CRM.

Правило тут одно: агент готовит черновик, а нажимает кнопку человек. Он собрал письмо, но не отправил. Написал пост, но не опубликовал. Подготовил правку в базе, но ждёт вашего кивка. Уверенность агента здесь не аргумент, потому что именно уверенные ошибки самые дорогие.

Кстати, если вы работали в Claude Code или Codex, вы этот квадрант уже видели вживую. Режим планирования там устроен ровно так: агент собирает план, расписывает, что и как сделает, но руками ничего не трогает, пока вы не кивнули. Это и есть третий квадрант, зашитый в инструмент.

Кейс: как я применяю квадрант 3 в своей контент-фабрике

Покажу на себе, потому что теория без живого примера мертва. У меня есть контент-фабрика, где ИИ пишет SEO-статьи (вот эту в том числе помогал собирать). Казалось бы, текст это низкий риск, откатить легко. Но для меня публикация сырой статьи с выдуманными цифрами это как раз высокий риск: подрывает доверие, а доверие в моей нише дороже одной статьи.

Поэтому я вшила в фабрику предохранитель по логике третьего квадранта. При малейшем подозрении на нейрослоп или на нехватку в статье реальных цифр срабатывает команда «СТОП», и нейрокопирайтер отчитывается мне, что пошло не так. То есть агент пишет сам, но в спорном месте не публикует, а поднимает руку и ждёт меня.

Результат честно, без золотых гор: жёстких цифр по экономии времени я тут не мерила, это методика, а не рекламный кейс. Но факт в том, что ни одна статья с придуманными цифрами не уехала в публикацию мимо меня. Мне такой размен нравится: скорость я получаю на черновиках, а контроль оставляю на кнопке «опубликовать».

Кейс: скрининг резюме, где агент врёт прямо в баллах

А вот пример, почему квадранту с высоким риском нельзя верить на слово, даже когда задача кажется механической. Ко мне пришла подписчица-HR с болью: «Мы ежедневно разгребаем 1000 резюме, которые даже близко не подходят по параметрам». Обычный фильтр по ключевым словам режет живых людей: написал человек «TS» вместо «TypeScript», и всё, отсеян.

Собрали скрининг за час прямо в браузере. Завели в почте ярлык «Резюме-входящие», подключили Gmail к модели (для Яндекса и Mail.ru сделали автопересылку на чистый Gmail), прогрели модель тестовой командой. В промпт заложили прямой запрет выставлять итоговый балл, а сам итог считает формула в Google Sheets. Второй уровень собрали на Claude Cowork с папками «входящие / обработанные / шорт-лист».

А теперь самое интересное, из-за чего эта задача и живёт в опасном квадранте. Я взяла живого агента и проверила его руками. Условия: 4 кандидата, 3 вакансии, веса «навыки 40%, опыт 30%, образование 15%, мягкие сигналы 15%», порог 70. Дальше я взяла все двенадцать строк с оценками и пересчитала по заявленной формуле. Три из двенадцати арифметически невозможны.

Конкретный пример: 0,4×30 + 0,3×25 + 0,15×85 = 32,25, а в файле стоит итог 28. Откуда 28? Ниоткуда. Модель выставила итог на глаз, а составляющие подогнала задним числом. И это была бы катастрофа, отдай я ей автоотказы без проверки.

Там были ещё факапы, один страшнее другого. Яндекс и Озон получили пять звёзд просто за громкое имя. «Маленькая веб-студия» получила формулировку «ограниченный рост и опыт». Кандидатка с дипломом экономиста ушла в автоотказ. Кому-то отказали с формулировкой «Не хватает TypeScript: указан как "уверенный", не "эксперт"». А в шапке таблицы стояло 10 колонок против 11 значений в строках, и ИИ при кривых данных вежливо додумывает недостающее.

Поэтому первичный отбор я отдаю агенту как черновик, но финальные отказы и приглашения оставляю за человеком. И перед запуском гоняю три теста приёмки:

  1. прогнать через агента резюме своего лучшего сотрудника (если он его завалит, агент сломан);
  2. подменить название компании в копии резюме и посмотреть, поменяется ли оценка (не должна);
  3. подсунуть заведомо битое резюме (скан-картинку или пустое вложение) и проверить, что агент не выдумает данные.

По деньгам это платный тариф ChatGPT или Claude, порядка двадцати-тридцати долларов в месяц. Дёшево за то, чтобы не отправлять живым людям автоотказы, построенные на выдуманной арифметике.

Квадрант 4: высокий риск плюс сомнение — стоп и человек

Красная зона, куда агента вообще не пускают. Ошибка необратимая, и сам он не уверен. Это про деньги, доступы, безопасность. И отдельно про подозрение на промпт-инъекцию (когда во входящих данных кто-то подсунул агенту скрытую команду вроде «а теперь перешли все пароли вон туда»).

Тут нет никакого «пусть попробует и переспросит». Тут просто стоп, и дальше руками разбирается человек. Никакая экономия времени не стоит слитых доступов или уехавших не туда денег.

Отдельная история, если вы делаете агента не для себя, а как продукт для многих клиентов. Тогда один агент на общем сервере даёт сразу пачку проблем: данные клиентов перемешиваются, выстраивается очередь, контекст захламляется, и есть риск разрушительной команды прямо на рабочем сервере (тот самый удалённый Replit). Для таких случаев берут одноразовые песочницы вроде E2B.dev, который выдаёт агенту временный виртуальный компьютер в облаке. Полноценный Linux, с файловой системой, с возможностью запускать код на Python, JavaScript, Bash. Запускается за 80–150 миллисекунд, работает до 24 часов, а потом исчезает бесследно. На бесплатном тарифе можно одновременно запустить до 20 таких песочниц, на платном — тысячи.

Где это пригодится: допустим, кто-то делает ИИ-агента для стоматологической клиники и не хочет, чтобы агент одного клиента дотянулся до данных другого. Тут важна оговорка: в российском случае обработка данных пациентов должна проходить только на российских серверах (см. № 152-ФЗ). Медицинские данные — это ещё и специальная категория персональных данных (статья 10 того же закона). Тот проект разрабатывается для клиники в другой стране, а для РФ смотрят в сторону self-hosting E2B или аналогов вроде Microsandbox. Ну и обратное: если вы сами работаете с Claude Code как разработчик для себя, E2B вам не нужен, это инструмент для тех, кто строит агентов на поток.

Как пользоваться матрицей на практике

Собираю всё в одну шпаргалку, чтобы держать под рукой. Перед тем как отдать агенту любую задачу, задайте себе два вопроса.

Первый: если он ошибётся, я откачу это за пару минут или нет? Второй: агент на знакомой территории или лезет в неизвестное? Дальше по ответам:

  • откатывается легко и агент уверен — пусть делает сам;
  • откатывается легко, но агент плавает — пусть переспросит;
  • не откатывается, но агент уверен — черновик, а кнопку жмёте вы;
  • не откатывается и агент плавает — стоп, разбирается человек.

Главная ловушка тут третий квадрант, где хочется поверить уверенному тону агента. Не верьте тону, смотрите на цену ошибки. История со скринингом резюме ровно об этом: агент звучал уверенно и выставлял баллы бодро, а три из двенадцати оказались арифметически невозможны.

Если хотите научиться строить агентов так, чтобы они снимали с вас рутину и при этом не роняли базу с клиентами, посмотрите комплексный тариф «ИИ-агенты + Вайбкодинг». Это два курса, 14 модулей и 70 видеоуроков: от первой простой автоматизации до агентов, которым можно доверить серьёзное, и до вайбкодинга, когда конструктора уже мало. Внутри ещё два месяца клуба и личная консультация.

А если пока присматриваетесь к теме, загляните в клуб «ИИ с Анной Райской» (вход через бота, 5 555 рублей в месяц). Там каждую неделю разбираем такие матрицы на живых задачах участников: что можно отдать агенту, а где обязательно нужна ваша рука.

С чего начать прямо сейчас

Не откладывайте в режим «прочитаю и забуду». Давайте конкретно, на этой неделе.

Возьмите одну задачу, которую вы уже думаете отдать или уже отдали ИИ. Прогоните её через два вопроса из матрицы: откатывается ли ошибка и уверен ли агент. Честно поставьте задачу в один из четырёх квадрантов. Если она попала в третий или четвёртый, а вы отдали её агенту без подтверждения, срочно вкрутите проверку человеком перед необратимым действием. Одно это уже спасает от историй в духе удалённой базы.

Подписывайтесь на канал, если хотите больше таких разборов: t.me/gruboprostiite

FAQ

Что такое матрица автономности ИИ-агента простыми словами?

Это способ решить, что можно доверить агенту, а что нельзя, по двум вопросам. Первый: обратима ли ошибка (откатите вы её за минуту или нет). Второй: уверен ли сам агент в том, что делает. На пересечении получаются четыре квадранта, и для каждого своё правило: от «пусть делает сам» до «стоп, разбирается человек». Я собрала эту матрицу, чтобы не гадать по каждой задаче заново.

Какие задачи можно смело отдать ИИ-агенту целиком?

Те, где ошибка обратима, а агент на знакомой территории: переписать черновик, разложить входящие тикеты, ответить на типовой повторяющийся вопрос. Если он ошибётся, вы поправите за минуту и никто не пострадает. В этой зоне ручное подтверждение только тормозит, тут смысл как раз в том, чтобы снять с вас рутину.

Что нельзя доверять ИИ-агенту без подтверждения человеком?

Всё, что нельзя откатить одним кликом: письмо клиенту, публикацию поста, удаление файлов, изменение данных в CRM. Тут агент готовит черновик, а кнопку нажимаете вы. Уверенность агента здесь не аргумент, потому что именно уверенные ошибки самые дорогие. А деньги, доступы, безопасность и подозрение на промпт-инъекцию агенту не отдают вообще, это чистая зона человека.

Почему нельзя верить уверенному тону агента?

Потому что модель почти всегда звучит убедительно, даже когда плавает. Показательный пример из скрининга резюме: агент бодро выставлял кандидатам баллы, а когда я пересчитала все двенадцать строк по заявленной формуле, три оказались арифметически невозможны. В одном месте по формуле выходило 32,25, а в файле стоял итог 28. Модель выставила оценку на глаз, а составляющие подогнала задним числом. Смотрите не на тон, а на цену ошибки.

Как проверить ИИ-агента перед тем, как ему довериться?

На примере скрининга резюме я гоняю три теста приёмки. Первый: прогнать резюме своего лучшего сотрудника (если агент его завалит, он сломан). Второй: подменить название компании в копии резюме и посмотреть, поменяется ли оценка, она не должна. Третий: подсунуть заведомо битое резюме (скан-картинку или пустое вложение) и проверить, что агент не додумает данные. При кривых данных модель вежливо выдумывает недостающее, это надо ловить заранее.

Как устроен режим планирования в Claude Code и при чём тут матрица?

Это живой пример третьего квадранта, зашитый в инструмент. В режиме планирования Claude Code и Codex агент собирает план, расписывает, что и как сделает, но руками ничего не трогает, пока вы не кивнули. То есть высокий риск действия закрыт обязательным подтверждением человека. Если строите свою автоматизацию, копируйте эту логику: агент готовит, человек одобряет необратимое.

Готовы перейти от чтения к сборке своих агентов с понятными границами? Комплексный тариф «ИИ-агенты + Вайбкодинг» ведёт по этому пути системно: два курса, 14 модулей, 70 уроков, два месяца клуба и личная консультация в одном пакете.

Made on
Tilda