Главное, что нужно понять до всякой настройки: если ИИ-агент работает с файлами на вашем компьютере, это ещё не значит, что данные остались дома. Claude Code, Cursor и Codex запускаются локально, но саму обработку они гоняют на зарубежных серверах. То есть ваш файл открылся у вас, а ушёл считаться за океан. Настоящий локальный стек, где данные не покидают машину, выглядит иначе: Ollama плюс локальная модель плюс агент вроде OpenCode. И вот тут начинается честный разговор про цену. Приватность есть, но за неё вы платите скоростью и деньгами на железо: задача, которую облачный Claude Code делает за полминуты, у локальной модели заняла семнадцать минут, а с частью данных она вовсе не справилась. И сразу оговорюсь: я не обещаю вам соответствие 152-ФЗ. Локальный стек оставляет данные на вашей машине, а вывод о том, законна ли именно ваша обработка, делает юрист вашей организации, а не эта статья. Ниже разберу, кому это реально надо, что показал «кастинг» локальных моделей и почему вывод не «переходите на локальное», а развилка.
«Мне нельзя в облако»: откуда вообще этот запрос
Один из самых популярных вопросов в моём клубе звучит так: «Анна, я хочу автоматизировать всё и вся, но мне НЕЛЬЗЯ». Госслужба, персональные данные, коммерческая тайна, тот самый 152-ФЗ. Человеку и правда нельзя просто взять и залить рабочие документы в облачную модель, потому что он не знает, где они окажутся и кто их прочитает.
И вот тут живёт главное заблуждение, ради которого я вообще села писать эту статью. Люди слышат «Claude Code работает у меня на компьютере» и выдыхают: значит, данные никуда не уходят. Не уходят? Ещё как уходят. Claude Code, Cursor и Codex действительно запускаются локально и видят ваши файлы, но обработку они отправляют в американские облака. Файл лежит у вас, а его содержимое едет на чужой сервер, чтобы модель могла с ним что-то сделать.
Для человека, которому «нельзя», это принципиальная разница. Ему нужен стек, где данные физически не выходят за пределы его машины. Такой стек существует, и я его собирала руками. Только у него есть цена, и цену эту продавцы локального ИИ обычно стыдливо замалчивают. Я не буду.
Что такое настоящий локальный стек и чем он отличается от Claude Code
Разложу по-простому. Настоящий локальный агент собирается из трёх частей.
Ollama. Это программа, которая запускает ИИ-модель прямо на вашем компьютере (по-простому, «движок», который крутит модель у вас, без интернета). Никаких запросов на чужие серверы, всё считается на вашем железе.
Локальная модель. Это и есть сам «мозг», который вы скачиваете к себе одним большим файлом. Например Qwen3-8B или qwen3-coder:30b. Модель весит десятки гигабайт и живёт на вашем диске.
Агент. Это оболочка, которая позволяет модели не просто болтать, а действовать: читать файлы, заполнять документы, запускать команды. В моих сборках это был OpenCode (он, к слову, поддерживает больше 75 провайдеров моделей, так что вы не привязаны к одному варианту).
Собрали три кубика, и получаете то, ради чего всё затевалось: ваши данные не покидают компьютер. Ни выписка, ни акт, ни таблица клиентов никуда не улетают. Звучит красиво. Дальше начинается реальность.
Кейс: облачный Claude Code против локального стека на одной задаче
Расскажу, как я это проверяла вживую, потому что без живого сравнения тут одни разговоры. Задачу взяла настоящую, из клуба.
Подписчица занимается муниципальным земельным контролем. Она вручную переносит данные из выписок ЕГРН в акты обследования, и объёмы такие, что её слова я запомнила дословно: «если не смогу автоматизировать часть процессов, то к концу года в центре комнаты будут висеть не гирлянды, а мы с начальницей». Задача идеальная для агента: есть источник (PDF-выписка) и есть шаблон (акт в формате .docx), надо аккуратно перекладывать поля.
Сначала я прогнала это в облачном Claude Code. Дала ему реальную выписку ЕГРН и образец акта, попросила заполнить поля и оставить пустые места под ручной осмотр. Claude Code за три минуты перенёс данные из выписки в акт. Тем же способом мы сделали и пакетную обработку, когда актов много. Быстро, чисто, приятно. Одна беда: данные ЕГРН при этом уходили в облако, а подписчице как раз этого делать нельзя.
Тогда я собрала локальный стек: Ollama плюс Node.js плюс OpenCode, и устроила «кастинг» моделей, чтобы понять, какая из них потянет ту же задачу без интернета. Вот тут и вылезла настоящая цена приватности, о которой ниже отдельная секция. Если коротко: то, что облако делает за полминуты, локальная модель Qwen3-8B делала семнадцать минут, а с переносом данных из ЕГРН она вовсе не справилась. Оперативная память при этом доходила до 88% загрузки, и выполнение задачи жёстко висло.
«Кастинг» локальных моделей: кто соврал, кто завис, кто заработал
Это, наверное, самая полезная часть для вас, потому что тут я сэкономлю вам те вечера, которые сама потратила впустую. Я перебирала локальные модели одну за другой, и почти каждая отваливалась по-своему.
Одна модель печатала команды текстом вместо того, чтобы их выполнять. То есть красиво писала: «сейчас я создам файл, потом заполню поля», а на деле не делала ничего. Просто рассказывала, что она якобы делает.
Вторая не влезла в видеокарту и уползла считать на процессоре со скоростью улитки. Модель тяжёлая, видеопамяти не хватило, и вся работа переехала на процессор, где всё еле ползёт.
Третья бодро ВРАЛА, что создала файлы. Отчиталась, что всё готово, файлы на месте. Идёшь проверять, а там пусто. Вот и доверяй после этого агентам.
Отдельная история с Qwen 2.5 Coder. Она обещает вызов инструментов (это когда модель не болтает, а реально нажимает кнопки: создаёт файл, запускает команду), но на практике их не вызывает. На бумаге умеет, в деле нет.
Из всего этого зверинца заработала только Qwen3-8B. Она хотя бы честно выполняла простые задачи, пусть и медленно. С самой тяжёлой частью, переносом данных из ЕГРН, не справилась и она, но по крайней мере не врала и не зависала намертво. Так что «локальный агент» звучит как одна кнопка, а на деле это перебор кандидатов, где большинство отваливается.
Вывод из кастинга простой: не всякая локальная модель годится в агенты. Многие умеют красиво говорить и совсем не умеют делать. И заранее, по названию, вы это не угадаете, приходится проверять руками.
Обязательная настройка, без которой ничего не заведётся
Один технический момент, который стоит мне отдельной секции, потому что на нём спотыкаются вообще все. Ollama по умолчанию даёт модели контекст всего 4 тысячи токенов. Контекст (по-простому, «оперативная память разговора», сколько модель держит в голове за раз) в 4 тысячи токенов для агента слишком мал.
Дело в том, что агенту для вызова инструментов нужно минимум 32 тысячи токенов. Ему надо удержать в голове и задачу, и содержимое файлов, и описания инструментов, которыми он пользуется. В четыре тысячи это всё не влезает, и агент просто не работает как агент.
Лечится это через Modelfile. Modelfile (это небольшой конфигурационный файл, где вы вручную задаёте модели настройки) позволяет поднять контекст с четырёх тысяч до нужных тридцати двух. Без этого шага вы будете долго не понимать, почему локальная модель тупит и не вызывает инструменты. Она не тупит, ей просто не дали памяти.
Ещё один бытовой момент из той же серии. Модель qwen3-coder:30b весит 18 гигабайт и требует примерно 32 гигабайта оперативной памяти. Скачать 18 гигабайт по обычному домашнему интернету, как я убедилась, тот ещё квест. Так что закладывайте время не только на настройку, но и на саму загрузку.
Сколько это стоит на самом деле: цена железа
Теперь про деньги, и вот тут я хочу, чтобы вы читали медленно. Именно на этом месте заканчивается романтика «свой ИИ дома бесплатно».
Сама модель бесплатная, да. Ollama бесплатная, OpenCode бесплатный. Но чтобы локальный агент реально тянул рабочие задачи, а не висел на 88% памяти, нужна машина. Готовые машины для более-менее серьёзных локальных ИИ-агентов в среднем стоят от 500 тысяч рублей, а комфортные варианты стоят в районе 1 миллиона рублей. Это не опечатка. Полмиллиона за старт и около миллиона за то, чтобы работало без мучений.
По видеопамяти памятка такая: от стартовых 6 гигабайт до комфортных 24. На стартовых 6 вы будете упираться в те самые проблемы из кастинга, когда модель не влезает в видеокарту и уползает на процессор. На 24 гигабайтах уже дышится, но это дорогая карта.
Сравните с облаком по-честному. Запросы к облачному Claude на старте стоят копейки. А ещё есть промежуточный вариант, про который я писала отдельно: вынести Claude Code на свой сервер за границей, ориентировочно от 5 долларов в месяц (около 500 рублей). Это, правда, не решает вопрос приватности так, как локальный стек: данные всё равно уходят на сервер и в облако модели. Но по деньгам разница с локальной машиной колоссальная.
Так что математика приватности выглядит грубо так: облако — копейки за запрос, но данные уходят. Локальный стек — данные дома, но полмиллиона за железо и работа в разы медленнее. Каждый выбирает под свою ситуацию, а не под красивый лозунг.
Если вы как раз тот человек, которому «нельзя в облако», и хотите собрать локальный стек по понятной системе, а не методом моих проб и ошибок, посмотрите комплексный тариф «ИИ-агенты + Вайбкодинг». Это два курса, 14 модулей и 70 видеоуроков: от первого простого агента до локальных сборок и вайбкодинга, когда готовых инструментов уже мало. Внутри ещё два месяца клуба и личная консультация.
А если пока прощупываете тему, загляните в клуб «ИИ с Анной Райской» (вход через бота, 5 555 рублей в месяц). Там мы каждую неделю разбираем такие задачи на живых кейсах участников, включая тех, кому по работе нельзя ничего лишнего.
Так локальный или облачный? Развилка, а не приговор
Соберу всё в решение, потому что ради него всё и затевалось. Вывод у меня не «бросайте облако и переходите на локальное». Это была бы такая же реклама, только с другой стороны. Вывод — это развилка, и проходить её надо честно, по типу ваших данных.
Если данные несекретные (тексты для блога, черновики, публичная информация, то, что и так лежит в открытом доступе), ведите их спокойно в облако. Быстро, дёшево, качественно. Городить полумиллионную машину ради постов в соцсетях — это стрелять из пушки по воробьям.
Если данные чувствительные (персональные данные граждан, коммерческая тайна, всё, что нельзя выпускать за пределы организации), тогда локальный стек, и вы миримся с его ценой: с медленной работой и дорогим железом. Это осознанная плата за то, чтобы файлы не уходили с вашей машины.
И ещё одна мысль напоследок, важная для тех, кто думает «да я лучше обычный скрипт напишу». Для сложных автоматизаций даже «тупой» ИИ-агент надёжнее хорошего скрипта, потому что скрипт ломается на любом отклонении от шаблона. Пришла выписка чуть в другом формате, и скрипт встал. Агент хотя бы попытается сообразить. Так что выбор часто не «агент или скрипт», а «какой именно агент и где он считается».
Юридическую точку я снова ставить не буду. Локальный стек оставляет данные у вас, а законна ли именно ваша обработка, скажет юрист вашей организации. Моя задача — показать, чем вы платите за каждый вариант, чтобы вы выбирали с открытыми глазами.
FAQ
Claude Code работает у меня на компьютере — значит, мои данные никуда не уходят?
Нет. Это главное заблуждение по теме. Claude Code, Cursor и Codex запускаются локально и видят ваши файлы, но саму обработку отправляют на зарубежные серверы. Файл лежит у вас, а его содержимое едет считаться в облако. Если данные нельзя выпускать наружу, вам нужен настоящий локальный стек: Ollama плюс локальная модель плюс агент вроде OpenCode, где обработка идёт прямо на вашей машине.
Насколько локальный агент медленнее облачного?
Сильно медленнее. Я проверяла на одной и той же задаче: то, что облачный Claude Code делает примерно за полминуты, локальная модель Qwen3-8B делала семнадцать минут. А с самой тяжёлой частью, переносом данных из выписки ЕГРН, она вовсе не справилась. При этом оперативная память доходила до 88% загрузки, и задача жёстко висла. Так что приватность вы получаете, но платите за неё скоростью.
Какая локальная модель реально работает как агент?
Из тех, что я перебирала, заработала только Qwen3-8B, да и та справлялась не со всем. Остальные отваливались: одна печатала команды текстом вместо выполнения, вторая не влезла в видеокарту и уползла на процессор, третья врала, что создала файлы. Qwen 2.5 Coder обещает вызов инструментов, но на практике их не вызывает. Вывод простой: не всякая локальная модель годится в агенты, и по названию это заранее не угадать, надо проверять.
Сколько стоит компьютер под локальный ИИ-агент?
Прилично. Готовые машины для более-менее серьёзных локальных агентов в среднем стоят от 500 тысяч рублей, а комфортные варианты в районе 1 миллиона. По видеопамяти памятка такая: от стартовых 6 гигабайт до комфортных 24. Сами модели, Ollama и OpenCode бесплатные, но без нормального железа локальный агент будет висеть и упираться в память. Для сравнения, облачные запросы на старте стоят копейки.
Почему локальная модель не вызывает инструменты и как это чинить?
Чаще всего дело в контексте. Ollama по умолчанию даёт модели всего 4 тысячи токенов контекста, а агенту для вызова инструментов нужно минимум 32 тысячи. В четыре тысячи не влезает ни задача, ни файлы, ни описания инструментов, поэтому агент не работает как агент. Лечится через Modelfile (небольшой конфигурационный файл), где вы вручную поднимаете контекст до нужных 32 тысяч. Без этого шага модель будет тупить, и вы долго не поймёте почему.
Гарантирует ли локальный стек соответствие 152-ФЗ?
Нет, и я специально об этом говорю. Локальный стек делает физическую вещь: данные не покидают вашу машину, обработка идёт на вашем железе, без облака. Но вывод о том, законна ли именно ваша обработка, делает юрист вашей организации, а не статья и не разработчик модели. Я показываю техническую сторону и цену вопроса, а юридическую точку ставит специалист по вашим данным.
Готовы собрать локальный агент под свою «нельзя в облако» задачу, не наступая на мои грабли? Комплексный тариф «ИИ-агенты + Вайбкодинг» ведёт по этому пути системно: два курса, 14 модулей, 70 уроков, два месяца клуба и личная консультация в одном пакете.
