Личная база знаний с ИИ: от свалки файлов до вики

Личная база знаний с ИИ: от свалки файлов до вики — обложка статьи

Личную базу знаний с ИИ можно собрать, даже если у вас гора файлов и ноль опыта в программировании. Смысл простой: вы наводите порядок в своих материалах, а поверх них ставите ИИ, который умеет по ним искать, отвечать на вопросы и собирать из них вики. Начать стоит не с инструмента, а с уборки: пометить архивом всё, к чему вы не прикасались год (обычно это 60–70 процентов файлов), и перевести остальное в Markdown, потому что интерфейсы меняются, а ваши документы остаются. Дальше выбираете один из пяти путей: память самой платформы, готовый сервис вроде Notion, ИИ поверх ваших файлов, автономный агент или свой сервер для чувствительных данных. Я сама так собирала персональную Википедию за один вечер и делала из Telegram-канала эксперта «скилл» для агента. Ниже разберу все пути по порядку, покажу на трёх живых кейсах, что получается, и честно скажу, где этот подход ломается и где нужен человек.

Что вообще значит «база знаний с ИИ» и зачем она нетехнарю

Сначала расчистим термины, чтобы дальше было понятно. База знаний — это ваши материалы, сложенные так, чтобы по ним можно было быстро найти нужное: заметки, договоры, конспекты вебинаров, переписки, куски исследований. Обычно всё это валяется по папкам «Загрузки», «Новая папка», «Новая папка (2)», и найти там что-то через полгода нереально.

«База знаний с ИИ» значит, что поверх этой кучи стоит модель, которая умеет читать ваши файлы и отвечать на вопросы по ним человеческим языком. Вы спрашиваете «что я записывала про этого клиента в марте», и вам это находят, а не вы сами лезете перелопачивать двадцать документов.

Кому это нужно в первую очередь. Эксперту, у которого за годы накопились сотни постов и конспектов. Предпринимателю, который хочет отдать инвестору не мёртвый отчёт, а живую штуку, которой можно задавать вопросы. Специалисту, который тонет в своих же материалах и тратит по полчаса на поиск того, что точно где-то есть. Если это про вас, дальше будет полезно.

Сразу честно, без розовых очков: ИИ поверх свалки работает плохо. Мусор на входе даёт мусор на выходе. Поэтому первая и главная часть работы вообще не про ИИ, а про порядок. С неё и начнём.

Сначала уборка: пять шагов, без которых ИИ бесполезен

Этот блок я разбирала на вебинаре клуба «Как навести порядок в файлах с помощью ИИ». Порядок действий такой, и первый шаг снимает большую часть работы.

  1. Аудит. Пройдитесь по своим папкам и пометьте как архив всё, к чему вы не прикасались год. Обычно это 60–70 процентов файлов, а база нужна лишь для оставшейся трети. То есть половину дела вы делаете, просто честно отложив в сторону то, что давно не открывали.
  2. Группировка. Оставшуюся треть разложите по осмысленным темам: клиенты, проекты, знания, личное. Не по типу файла, а по смыслу, чтобы потом искалось по-человечески.
  3. Обогащение. Добавьте к материалам контекст: короткие описания, даты, о чём этот документ. Голый файл «doc_final_2.docx» ИИ мало о чём скажет, а помеченный «договор с таким-то, март, черновик» уже понятен.
  4. Перевод форматов. Приводите разношёрстные файлы к единому виду, лучше всего к Markdown (про это отдельно ниже, это важно).
  5. Опись. Соберите общий список того, что у вас есть и где лежит. Это ваш каталог, по которому потом ориентируется и человек, и агент.

Ясно-понятно, звучит занудно. Но именно на этих пяти шагах решается, будет ваша база знаний работать или превратится в ту же свалку, только с ИИ сверху.

Правило Markdown и латинские папки: два лайфхака, которые сэкономят вам нервы

Два момента с того же вебинара, которые я советую запомнить сразу, чтобы потом не переделывать.

Переводите файлы в Markdown. Markdown (по-простому, текстовый формат с простой разметкой, где заголовки и списки помечаются значками вроде решёток и звёздочек) хорош тем, что его читает кто угодно и что угодно. Главный принцип я формулирую так: инструменты и интерфейсы постоянно меняются, а вечны (и то относительно) только ваши документы. Сегодня вы в Notion, завтра в чём-то ещё, а текст в Markdown переживёт любой из этих переездов. Поэтому файлы лучше переводить именно в него.

Называйте папки латиницей, без кириллицы и пробелов. Иначе агенты начинают спотыкаться. Звучит мелко, но когда автономный агент вдруг перестаёт видеть вашу папку «Мои документы» с пробелом и русскими буквами, вы полдня будете гадать, почему. Лучше сразу `moi-dokumenty`, и голова не болит.

Пять путей к базе знаний: от памяти платформы до своего сервера

Дальше главный вопрос: чем именно ставить ИИ поверх ваших файлов. Путей пять, и они разные по сложности и по тому, насколько вы отдаёте свои данные наружу. Разберу от простого к серьёзному.

1. Память самой платформы

Самое простое. Многие чат-боты теперь умеют запоминать то, что вы им рассказали раньше, и учитывать это в новых ответах. Никакой настройки, вы просто общаетесь, а платформа копит контекст о вас. Годится, чтобы попробовать саму идею на вкус. Минус в том, что вы привязаны к одной платформе и в любой момент можете упереться в её потолок.

2. Готовый сервис (Notion и подобные)

Следующий уровень. Вы складываете материалы в готовый сервис вроде Notion, а ИИ ищет и отвечает уже внутри него. Удобно, всё из коробки, ничего не надо собирать руками. Расплата за удобство: ваши документы живут на чужой платформе по её правилам, и это ровно тот случай, когда стоит вспомнить про правило Markdown выше.

3. ИИ поверх ваших файлов (золотая середина)

Вот это я называю золотой серединой. Инструменты вроде Cursor или Claude Cowork работают прямо с вашей папкой файлов на компьютере: ничего не надо загружать в чужой сервис, ИИ читает то, что лежит у вас, и отвечает по этому. Вы держите данные при себе и при этом получаете умный поиск и ответы. Для большинства нетехнарей это лучшая точка старта после того, как порядок наведён.

4. Автономный агент (Claude Code, Codex)

Уровень серьёзнее. Автономный агент вроде Claude Code или Codex не просто отвечает на вопросы, а сам делает работу с вашими файлами: перекладывает, компилирует, собирает из них новую структуру. Именно так я собирала персональную вики, про это отдельный кейс ниже. Порог входа выше, зато и возможностей больше.

5. Свой сервер с локальной моделью

Самый закрытый вариант. Если у вас чувствительные данные, которые нельзя отдавать наружу вообще, ставите модель у себя на сервере, и она работает с файлами, не выходя за пределы вашего контура. Это уже требует технической руки или помощи, зато данные не покидают ваш компьютер. Для нетехнаря это скорее «на вырост», но знать про такой путь полезно.

Кейс: персональная Википедия за вечер

Теперь на живом примере. Пришёл запрос от подписчика: повторить подход Андрея Карпати и отдать инвестору не отчёт на 50 листов, а вики, которой можно задавать вопросы. Мне идея понравилась, и я села собирать.

Схема получилась такая. Завела две папки: `raw/` только для чтения, туда складываются исходники, и `wiki/`, куда собирается результат. Написала файл `CLAUDE.md` с правилами для агента: делать перекрёстные ссылки между темами, цитировать источники и явно фиксировать противоречия в данных. Дальше Claude Code компилирует по этим правилам вики, Quartz собирает из неё статичный сайт, всё уезжает в GitHub, а оттуда на Vercel и превращается в публичную ссылку.

Что получилось. Вся компиляция заняла 5–7 минут. Агент сам выделил 10 концепций и нашёл три противоречия в данных, включая одно, на которое я даже не обращала внимания. Время от пустой папки до публичной ссылки, если делать в спокойном темпе, вышло 2–3 часа. Живой пример лежит по адресу legalassist-wiki.vercel.app, репозиторий публичный.

А теперь честная часть, без которой это была бы сказка. У меня сломалось минимум семь раз. `git init` запустила не в той папке. Vercel не понимал Quartz, пока руками не пропишешь Build Command `npx quartz build` и Output Directory `public`. Чистые адреса страниц потребовали отдельного файла `vercel.json`. А когда я создала этот файл через PowerShell командой `Out-File -Encoding utf8`, он добавил невидимый значок в начало файла (это называется BOM), и Vercel упал с ошибкой «Invalid vercel.json file provided». Я честно поплутала, прежде чем всё завелось. Так что «за вечер» это правда, но вечер был с приключениями.

Кейс: виртуальный двойник эксперта, скилл вместо RAG

Второй кейс интереснее по идее. У Anthropic была мысль: сделать из книги «скилл» для агента (скилл — это, по-простому, готовый конспект метода, который агент подхватывает и применяет). Я решила проверить идею, только вместо книги взяла открытый бесплатный Telegram-канал эксперта по 115-ФЗ.

Собирала так. Выгрузила канал через десктопный Telegram в файл JSON, это заняло пару минут даже за несколько лет постов. Claude Code написал маленькую программку для очистки, и из 1910 сообщений осталось 1763 содержательных поста. Дальше главный трюк: я не просила «перепиши канал в один файл». Я просила вытащить из этих постов метод и сложить его в структуру. Готовые рубрики канала при этом сами стали оглавлением справочника. На выходе получился `SKILL.MD` с методом плюс десяток справочников по темам, которые агент подгружает по требованию.

Здесь важно понять разницу между скиллом и модным словом RAG. RAG ищет похожие слова, а не понимает метод. RAG — это библиотека, а скилл — это конспект. И на тесте это было видно: я дала агенту запутанную ситуацию, а он разложил её ровно по методу эксперта, разделив кашу на три отдельных сюжета. И сам приписал, что это не заменяет живого юриста.

Маленькая техническая деталь на будущее: у Claude в браузере есть лимит на длину описания навыка, и мой скилл под него не влез. В Claude Code такого ограничения нет, поэтому собирала там.

И этическая рамка, которую я считаю обязательной. Посты в том канале — это авторский труд эксперта, и право на них остаётся за ним. Такой скилл я делала для себя, чтобы проверить подход. Выкладывать его как готовый продукт и тем более продавать нельзя. Собираете двойника чужого канала для себя — держите это в голове.

Где этот подход не годится и где нужен человек

Теперь честная часть, без которой статья была бы рекламой. Личная вики и скилл поверх файлов выручают во многом, но не везде, и я на этом обжигалась.

Сборка вики через Claude Code и Quartz плохо годится для больших объёмов структурированных данных: там, где нужны нормальные таблицы и база, статичный сайт из заметок не тянет. Не годится она и для задач, где важна юридическая точность цитирования, когда каждая ссылка на источник должна стоять буква в букву. И отдельно тяжело в проектах, где критично помнить, что написал человек, а что модель, потому что вики сплавляет всё в один текст.

Со скиллом та же оговорка про живого человека: агент по 115-ФЗ красиво раскладывал ситуацию по методу, но сам же честно приписывал, что юриста он не заменяет. Это правильная рамка, и я её всегда держу.

Поэтому моё правило простое: ИИ поверх вашей базы знаний это толковый помощник для поиска, компиляции и черновиков. А там, где цена ошибки высокая (юридическая точность, чувствительные данные, авторство фраз), последнее слово остаётся за человеком.

Если хотите собрать свою базу знаний по понятной системе, а не продираться через семь поломок в одиночку, посмотрите комплексный тариф «ИИ-агенты + Вайбкодинг». Это два курса, 14 модулей и 70 видеоуроков: от порядка в файлах и работы с ИИ поверх ваших материалов до автономных агентов и вайбкодинга, когда готового инструмента уже мало. Внутри ещё два месяца клуба и личная консультация.

А если пока пробуете тему на вкус, начните с бесплатного: загляните в клуб «ИИ с Анной Райской» (вход через бота, 5 555 рублей в месяц). Там мы регулярно разбираем такие сборки на живых задачах участников, тот же вебинар про порядок в файлах был именно оттуда.

С чего начать прямо сейчас

Не уходите со страницы в режим «займусь этим как-нибудь потом». Давайте конкретно, на этой неделе.

Откройте свои папки и сделайте только первый шаг из пяти: аудит. Пометьте архивом всё, к чему вы не прикасались год. С высокой вероятностью это уберёт из работы 60–70 процентов файлов, и станет видно, что база нужна лишь для оставшейся трети. Уже одно это ощущается как выдох. Дальше оставшуюся треть переименуйте латиницей без пробелов и, где можете, переведите в Markdown. Только после этого имеет смысл ставить сверху ИИ, будь то Notion, Cursor или автономный агент. Порядок сначала, инструмент потом.

Подписывайтесь на канал, если хотите больше таких разборов: t.me/gruboprostiite

FAQ

Что такое личная база знаний с ИИ простыми словами?

Это ваши материалы (заметки, договоры, конспекты, переписки), сложенные в порядок, поверх которых стоит ИИ и умеет по ним искать и отвечать на вопросы человеческим языком. Вы спрашиваете «что я записывала про этого клиента в марте», и вам находят это, а не вы сами перелопачиваете двадцать документов. Работает только если сначала навести порядок в файлах: мусор на входе даёт мусор на выходе.

С чего начать, если файлов накопилась гора?

Не с инструмента, а с уборки. Первый шаг — аудит: пометьте как архив всё, к чему не прикасались год. Обычно это 60–70 процентов файлов, а база нужна лишь для оставшейся трети. Дальше разложите остаток по темам, добавьте короткие описания, переведите в Markdown и составьте опись того, что где лежит. И только потом ставьте сверху ИИ.

Почему все советуют Markdown?

Потому что инструменты и интерфейсы постоянно меняются, а вечны (и то относительно) только ваши документы. Markdown — это простой текстовый формат, который читает что угодно и кто угодно, он переживёт любой переезд с платформы на платформу. Сегодня вы в Notion, завтра в чём-то ещё, а текст в Markdown останется с вами. Ещё лайфхак: называйте папки латиницей без кириллицы и пробелов, иначе агенты начинают спотыкаться.

Чем скилл отличается от RAG?

RAG ищет похожие слова, а не понимает метод. RAG — это библиотека, а скилл — это конспект. Я проверяла это на канале эксперта по 115-ФЗ: собрала из его постов не пересказ, а вытяжку метода в файл SKILL.MD. На тесте агент разложил запутанную ситуацию ровно по методу эксперта, разделив кашу на три отдельных сюжета, и сам приписал, что живого юриста он не заменяет. Просто «залить все посты в один файл» так не работает.

Сколько времени займёт собрать личную вики?

По моему опыту, от пустой папки до публичной ссылки вышло 2–3 часа в спокойном темпе, а сама компиляция агентом заняла 5–7 минут. Только честно предупрежу: у меня по дороге сломалось минимум семь раз, от `git init` не в той папке до невидимого значка BOM в файле настроек, из-за которого падал Vercel. «За вечер» это правда, но вечер с приключениями. По готовой системе эти грабли обходятся заранее.

Где этот подход не сработает?

Не везде. Сборка вики через агента и статичный сайт плохо тянет большие объёмы структурированных данных (там нужна нормальная база с таблицами), задачи с юридической точностью цитирования и проекты, где важно помнить, что написал человек, а что модель. И отдельно: ИИ поверх вашей базы это помощник для поиска и черновиков, а там, где цена ошибки высокая, последнее слово остаётся за вами.

Готовы перейти от чтения к своей базе знаний? Комплексный тариф «ИИ-агенты + Вайбкодинг» ведёт вас по этому пути системно: два курса, 14 модулей, 70 уроков, два месяца клуба и личная консультация в одном пакете.

Made on
Tilda