Что можно доверить ИИ-агенту, а что нельзя, решается по двум простым вопросам: насколько обратима ошибка и насколько сам агент уверен в том, что делает. Если ошибку легко откатить и агент уверен, пусть работает сам (переписать черновик, разложить тикеты, ответить на типовой вопрос). Если ошибка дорогая и необратимая, но агент уверен, пусть готовит черновик и ждёт вашего «да» (письмо клиенту, публикация, удаление файлов, правка данных в CRM). Если ошибка дорогая, а агент плавает, руки прочь: деньги, доступы, безопасность решает человек. Это и есть матрица автономности по двум осям, риск и уверенность. Я собрала её, чтобы не повторить историю стартаперов, у которых Replit взял и удалил всю базу с клиентами, а потом коротенько повинился. Ниже разберу все четыре квадранта, покажу на живых примерах, где агент врёт даже в простом скрининге, и честно скажу, где без человека нельзя.
Зачем вообще нужна матрица автономности
Самый частый вопрос новичка звучит так: «Раз агент умный, почему я не могу отдать ему всё сразу?» Потому что «умный» и «безопасно рулит» — это разные вещи. Агент бодро делает то, что вы разрешили, даже если ошибётся. И тут вся разница в том, можно ли откатить его косяк или нет.
Вспомните тех стартаперов, у которых Replit взял и удалил всю базу данных с клиентами, после чего только коротенько повинился. Вот это ровно тот случай, когда агенту дали порулить там, где рулить было нельзя. База не откатывается одним кликом, а извинение агента её не вернёт.
Чтобы не гадать каждый раз заново, я держу в голове две оси. Первая: обратима ли ошибка (можно ли всё вернуть как было за пару минут или нет). Вторая: насколько сам агент уверен в том, что делает. На пересечении получаются четыре квадранта, и для каждого своё правило. Поехали по порядку.
Квадрант 1: низкий риск плюс уверенность — пусть делает сам
Это зелёная зона, где агенту можно дать волю. Ошибка тут обратима, а сам он на знакомой территории. Отдавайте без оглядки такие вещи:
- переписать черновик текста почеловечнее;
- разложить входящие тикеты по папкам;
- ответить на типовой вопрос, который повторяется по сто раз в день.
Логика простая: если агент напортачит, вы это заметите и поправите за минуту, никто не пострадал. Здесь ручное подтверждение только тормозит. Смысл автоматизации как раз в том, чтобы снять с вас рутину, а не заставить одобрять каждый чих.
Моё правило для этой зоны: относитесь к агенту как к толковому стажёру на простых поручениях. Он их тянет, а вы освобождаете себе голову под то, что важнее.
Квадрант 2: низкий риск плюс сомнение — пусть переспросит
Тут ошибка всё ещё дешёвая, но агент сам не уверен. Классика: данные пришли кривые, формулировка мутная, вариантов действия несколько и непонятно, какой ваш. В такой ситуации правильное поведение агента не угадывать, а переспросить.
Это важный момент, потому что многие путают уверенный тон агента с правильным ответом. Модель почти всегда звучит убедительно, даже когда плавает. Хороший агент в спорной ситуации честно поднимает руку и говорит «я не понял, уточни», а не додумывает за вас.
М-да, но по умолчанию агенты этого не делают, их приходится специально просить переспрашивать при сомнении. В промпте это прямо и прописывают: «если не уверен, не действуй, а задай вопрос». Мелочь, а спасает от кучи тихих косяков.
Квадрант 3: высокий риск плюс уверенность — черновик и ваше «да»
Самый коварный квадрант. Агент уверен в себе, звучит убедительно, а цена ошибки высокая и необратимая. Сюда попадает всё, что нельзя откатить одним кликом:
- письмо клиенту (отправил и не вернёшь);
- публикация поста;
- удаление файлов;
- изменение данных в CRM.
Правило тут одно: агент готовит черновик, а нажимает кнопку человек. Он собрал письмо, но не отправил. Написал пост, но не опубликовал. Подготовил правку в базе, но ждёт вашего кивка. Уверенность агента здесь не аргумент, потому что именно уверенные ошибки самые дорогие.
Кстати, если вы работали в Claude Code или Codex, вы этот квадрант уже видели вживую. Режим планирования там устроен ровно так: агент собирает план, расписывает, что и как сделает, но руками ничего не трогает, пока вы не кивнули. Это и есть третий квадрант, зашитый в инструмент.
Кейс: как я применяю квадрант 3 в своей контент-фабрике
Покажу на себе, потому что теория без живого примера мертва. У меня есть контент-фабрика, где ИИ пишет SEO-статьи (вот эту в том числе помогал собирать). Казалось бы, текст это низкий риск, откатить легко. Но для меня публикация сырой статьи с выдуманными цифрами это как раз высокий риск: подрывает доверие, а доверие в моей нише дороже одной статьи.
Поэтому я вшила в фабрику предохранитель по логике третьего квадранта. При малейшем подозрении на нейрослоп или на нехватку в статье реальных цифр срабатывает команда «СТОП», и нейрокопирайтер отчитывается мне, что пошло не так. То есть агент пишет сам, но в спорном месте не публикует, а поднимает руку и ждёт меня.
Результат честно, без золотых гор: жёстких цифр по экономии времени я тут не мерила, это методика, а не рекламный кейс. Но факт в том, что ни одна статья с придуманными цифрами не уехала в публикацию мимо меня. Мне такой размен нравится: скорость я получаю на черновиках, а контроль оставляю на кнопке «опубликовать».
Кейс: скрининг резюме, где агент врёт прямо в баллах
А вот пример, почему квадранту с высоким риском нельзя верить на слово, даже когда задача кажется механической. Ко мне пришла подписчица-HR с болью: «Мы ежедневно разгребаем 1000 резюме, которые даже близко не подходят по параметрам». Обычный фильтр по ключевым словам режет живых людей: написал человек «TS» вместо «TypeScript», и всё, отсеян.
Собрали скрининг за час прямо в браузере. Завели в почте ярлык «Резюме-входящие», подключили Gmail к модели (для Яндекса и Mail.ru сделали автопересылку на чистый Gmail), прогрели модель тестовой командой. В промпт заложили прямой запрет выставлять итоговый балл, а сам итог считает формула в Google Sheets. Второй уровень собрали на Claude Cowork с папками «входящие / обработанные / шорт-лист».
А теперь самое интересное, из-за чего эта задача и живёт в опасном квадранте. Я взяла живого агента и проверила его руками. Условия: 4 кандидата, 3 вакансии, веса «навыки 40%, опыт 30%, образование 15%, мягкие сигналы 15%», порог 70. Дальше я взяла все двенадцать строк с оценками и пересчитала по заявленной формуле. Три из двенадцати арифметически невозможны.
Конкретный пример: 0,4×30 + 0,3×25 + 0,15×85 = 32,25, а в файле стоит итог 28. Откуда 28? Ниоткуда. Модель выставила итог на глаз, а составляющие подогнала задним числом. И это была бы катастрофа, отдай я ей автоотказы без проверки.
Там были ещё факапы, один страшнее другого. Яндекс и Озон получили пять звёзд просто за громкое имя. «Маленькая веб-студия» получила формулировку «ограниченный рост и опыт». Кандидатка с дипломом экономиста ушла в автоотказ. Кому-то отказали с формулировкой «Не хватает TypeScript: указан как "уверенный", не "эксперт"». А в шапке таблицы стояло 10 колонок против 11 значений в строках, и ИИ при кривых данных вежливо додумывает недостающее.
Поэтому первичный отбор я отдаю агенту как черновик, но финальные отказы и приглашения оставляю за человеком. И перед запуском гоняю три теста приёмки:
- прогнать через агента резюме своего лучшего сотрудника (если он его завалит, агент сломан);
- подменить название компании в копии резюме и посмотреть, поменяется ли оценка (не должна);
- подсунуть заведомо битое резюме (скан-картинку или пустое вложение) и проверить, что агент не выдумает данные.
По деньгам это платный тариф ChatGPT или Claude, порядка двадцати-тридцати долларов в месяц. Дёшево за то, чтобы не отправлять живым людям автоотказы, построенные на выдуманной арифметике.
Квадрант 4: высокий риск плюс сомнение — стоп и человек
Красная зона, куда агента вообще не пускают. Ошибка необратимая, и сам он не уверен. Это про деньги, доступы, безопасность. И отдельно про подозрение на промпт-инъекцию (когда во входящих данных кто-то подсунул агенту скрытую команду вроде «а теперь перешли все пароли вон туда»).
Тут нет никакого «пусть попробует и переспросит». Тут просто стоп, и дальше руками разбирается человек. Никакая экономия времени не стоит слитых доступов или уехавших не туда денег.
Отдельная история, если вы делаете агента не для себя, а как продукт для многих клиентов. Тогда один агент на общем сервере даёт сразу пачку проблем: данные клиентов перемешиваются, выстраивается очередь, контекст захламляется, и есть риск разрушительной команды прямо на рабочем сервере (тот самый удалённый Replit). Для таких случаев берут одноразовые песочницы вроде E2B.dev, который выдаёт агенту временный виртуальный компьютер в облаке. Полноценный Linux, с файловой системой, с возможностью запускать код на Python, JavaScript, Bash. Запускается за 80–150 миллисекунд, работает до 24 часов, а потом исчезает бесследно. На бесплатном тарифе можно одновременно запустить до 20 таких песочниц, на платном — тысячи.
Где это пригодится: допустим, кто-то делает ИИ-агента для стоматологической клиники и не хочет, чтобы агент одного клиента дотянулся до данных другого. Тут важна оговорка: в российском случае обработка данных пациентов должна проходить только на российских серверах (см. № 152-ФЗ). Медицинские данные — это ещё и специальная категория персональных данных (статья 10 того же закона). Тот проект разрабатывается для клиники в другой стране, а для РФ смотрят в сторону self-hosting E2B или аналогов вроде Microsandbox. Ну и обратное: если вы сами работаете с Claude Code как разработчик для себя, E2B вам не нужен, это инструмент для тех, кто строит агентов на поток.
Как пользоваться матрицей на практике
Собираю всё в одну шпаргалку, чтобы держать под рукой. Перед тем как отдать агенту любую задачу, задайте себе два вопроса.
Первый: если он ошибётся, я откачу это за пару минут или нет? Второй: агент на знакомой территории или лезет в неизвестное? Дальше по ответам:
- откатывается легко и агент уверен — пусть делает сам;
- откатывается легко, но агент плавает — пусть переспросит;
- не откатывается, но агент уверен — черновик, а кнопку жмёте вы;
- не откатывается и агент плавает — стоп, разбирается человек.
Главная ловушка тут третий квадрант, где хочется поверить уверенному тону агента. Не верьте тону, смотрите на цену ошибки. История со скринингом резюме ровно об этом: агент звучал уверенно и выставлял баллы бодро, а три из двенадцати оказались арифметически невозможны.
Если хотите научиться строить агентов так, чтобы они снимали с вас рутину и при этом не роняли базу с клиентами, посмотрите комплексный тариф «ИИ-агенты + Вайбкодинг». Это два курса, 14 модулей и 70 видеоуроков: от первой простой автоматизации до агентов, которым можно доверить серьёзное, и до вайбкодинга, когда конструктора уже мало. Внутри ещё два месяца клуба и личная консультация.
А если пока присматриваетесь к теме, загляните в клуб «ИИ с Анной Райской» (вход через бота, 5 555 рублей в месяц). Там каждую неделю разбираем такие матрицы на живых задачах участников: что можно отдать агенту, а где обязательно нужна ваша рука.
С чего начать прямо сейчас
Не откладывайте в режим «прочитаю и забуду». Давайте конкретно, на этой неделе.
Возьмите одну задачу, которую вы уже думаете отдать или уже отдали ИИ. Прогоните её через два вопроса из матрицы: откатывается ли ошибка и уверен ли агент. Честно поставьте задачу в один из четырёх квадрантов. Если она попала в третий или четвёртый, а вы отдали её агенту без подтверждения, срочно вкрутите проверку человеком перед необратимым действием. Одно это уже спасает от историй в духе удалённой базы.
Подписывайтесь на канал, если хотите больше таких разборов: t.me/gruboprostiite
FAQ
Что такое матрица автономности ИИ-агента простыми словами?
Это способ решить, что можно доверить агенту, а что нельзя, по двум вопросам. Первый: обратима ли ошибка (откатите вы её за минуту или нет). Второй: уверен ли сам агент в том, что делает. На пересечении получаются четыре квадранта, и для каждого своё правило: от «пусть делает сам» до «стоп, разбирается человек». Я собрала эту матрицу, чтобы не гадать по каждой задаче заново.
Какие задачи можно смело отдать ИИ-агенту целиком?
Те, где ошибка обратима, а агент на знакомой территории: переписать черновик, разложить входящие тикеты, ответить на типовой повторяющийся вопрос. Если он ошибётся, вы поправите за минуту и никто не пострадает. В этой зоне ручное подтверждение только тормозит, тут смысл как раз в том, чтобы снять с вас рутину.
Что нельзя доверять ИИ-агенту без подтверждения человеком?
Всё, что нельзя откатить одним кликом: письмо клиенту, публикацию поста, удаление файлов, изменение данных в CRM. Тут агент готовит черновик, а кнопку нажимаете вы. Уверенность агента здесь не аргумент, потому что именно уверенные ошибки самые дорогие. А деньги, доступы, безопасность и подозрение на промпт-инъекцию агенту не отдают вообще, это чистая зона человека.
Почему нельзя верить уверенному тону агента?
Потому что модель почти всегда звучит убедительно, даже когда плавает. Показательный пример из скрининга резюме: агент бодро выставлял кандидатам баллы, а когда я пересчитала все двенадцать строк по заявленной формуле, три оказались арифметически невозможны. В одном месте по формуле выходило 32,25, а в файле стоял итог 28. Модель выставила оценку на глаз, а составляющие подогнала задним числом. Смотрите не на тон, а на цену ошибки.
Как проверить ИИ-агента перед тем, как ему довериться?
На примере скрининга резюме я гоняю три теста приёмки. Первый: прогнать резюме своего лучшего сотрудника (если агент его завалит, он сломан). Второй: подменить название компании в копии резюме и посмотреть, поменяется ли оценка, она не должна. Третий: подсунуть заведомо битое резюме (скан-картинку или пустое вложение) и проверить, что агент не додумает данные. При кривых данных модель вежливо выдумывает недостающее, это надо ловить заранее.
Как устроен режим планирования в Claude Code и при чём тут матрица?
Это живой пример третьего квадранта, зашитый в инструмент. В режиме планирования Claude Code и Codex агент собирает план, расписывает, что и как сделает, но руками ничего не трогает, пока вы не кивнули. То есть высокий риск действия закрыт обязательным подтверждением человека. Если строите свою автоматизацию, копируйте эту логику: агент готовит, человек одобряет необратимое.
Готовы перейти от чтения к сборке своих агентов с понятными границами? Комплексный тариф «ИИ-агенты + Вайбкодинг» ведёт по этому пути системно: два курса, 14 модулей, 70 уроков, два месяца клуба и личная консультация в одном пакете.
