СтатьяИИ и бизнес

У корпоративного ИИ пять уровней. На пятом лучше отобрать пароль от прода :D

Разбираю путь от тайного ChatGPT в соседней вкладке до автономных процессов: контекст, инструменты, скиллы, eval-наборы, права и стоп-условия. Заодно прикладываю эту шкалу к xedoc.ru.

21 июля 2026 г.8 минут чтения

Зацепился за шкалу из ролика ToTheMoon и пошёл выяснять, как она называется. В результате провалился в семейство AI Maturity Models — моделей зрелости внедрения ИИ.

Короткую версию я опубликовал в «Лосе в проде». Здесь раскладываю каждый уровень подробнее и пытаюсь понять, где на этой карте находится xedoc.ru.

Главная мысль оказалась довольно неприятной для любителей купить двадцать лицензий и объявить трансформацию завершённой: зрелость определяется процессом целиком. Модель может быть самой новой, а права, данные и проверка результата — жить на уровне «ну вроде Сергей смотрит».

Пять уровней человеческим языком

Шкала из ролика авторская, зато узнаваемая с первого пункта.

  1. Теневой ИИ. Сотрудники тайком носят задачи в ChatGPT, потому что официально ИИ запрещён или про него никто ничего не решил.
  2. Разрешённые инструменты. Появляются корпоративные аккаунты, правила по данным и список сервисов, куда можно ходить без ритуального согласования.
  3. Доступ к рабочему контексту. ИИ безопасно читает внутренние документы, CRM, Git, базы и API. Он уже видит задачу внутри настоящего процесса.
  4. Переиспользуемые скиллы. Команды собирают проверенные автоматизации с инструкциями, инструментами, тестами и правилами остановки.
  5. Автономный процесс. Агент получает цель и исполняет цепочку целиком. Человек подключается на развилках, исключениях и рискованных действиях.

Переход между уровнями происходит не в момент покупки новой модели. Меняются права, ответственность и способ проверки результата.

На первом уровне человек копирует текст руками. На третьем агент уже читает рабочую систему. На пятом он сам решает, какой следующий шаг нужен процессу. Разница между этими состояниями куда больше, чем между двумя соседними версиями GPT.

Версия Microsoft: пять уровней по каждой способности

У Microsoft есть более формальная Agentic AI Adoption Maturity Model. Там уровни называются так:

  • 100 — Initial: разрозненные эксперименты, которые держатся на отдельных энтузиастах;
  • 200 — Repeatable: первые повторяемые практики уже есть, но команды используют их неравномерно;
  • 300 — Defined: процессы, стандарты, документация и governance формализованы;
  • 400 — Capable: агенты встроены в операции и могут масштабироваться между командами;
  • 500 — Efficient: организация работает в agent-first режиме и постоянно улучшает систему.

Самое полезное здесь — оценка сразу по нескольким направлениям. Microsoft отдельно смотрит на стратегию и пользовательский опыт, перестройку бизнес-процессов, измерение ценности, governance и безопасность, архитектуру, эксплуатацию, культуру и обучение.

Компания не получает один красивый номер на лоб. У неё может быть:

  • архитектура на уровне 400;
  • обучение сотрудников на 200;
  • безопасность на 300;
  • измерение пользы на честном 100;

Именно так обычно и выглядит реальность. Код уже пишет агент с доступом к репозиторию, а решение о том, можно ли показывать ему клиентские данные, хранится в переписке трёхмесячной давности.

Уровень 1. Все уже пользуются, официально никто не знает

Первый уровень часто выглядит как запрет. Внутри компании обсуждают риски, а сотрудники тем временем открывают личный ChatGPT и решают реальные задачи.

Польза появляется сразу: черновики, перевод, формулы, код, разбор документов. Вместе с ней появляется теневой поток данных. Никто не знает, что именно ушло наружу, какая модель использовалась и можно ли повторить результат.

Признаки уровня:

  • личные аккаунты и случайный набор инструментов;
  • данные копируются руками;
  • нет журнала запросов и результатов;
  • качество зависит от того, кто лучше научился объяснять задачу;
  • успешные приёмы остаются в личной истории чата.

Переход дальше начинается с инвентаризации. Какие задачи люди уже отдают ИИ? Какие данные там встречаются? Где получается экономия времени? Запрет без этой карты просто делает использование менее заметным.

Уровень 2. Появился официальный вход

На втором уровне организация выбирает разрешённые сервисы, заводит корпоративные аккаунты и формулирует правила работы с данными.

Это ещё не агентная система. Скорее, контролируемая точка входа: сотрудник сам приносит контекст, проверяет ответ и переносит результат обратно в рабочий процесс.

Здесь полезно зафиксировать минимум:

  1. какие классы данных можно отправлять;
  2. где хранятся история и вложения;
  3. используются ли запросы для обучения провайдера;
  4. кто отвечает за результат;
  5. как сообщить об ошибке или утечке.

Главный артефакт этого уровня — понятная политика на одну страницу. Если для ответа нужен сорокаминутный звонок с безопасностью, сотрудники снова откроют личную вкладку. Человек устроен удивительно предсказуемо :D

Уровень 3. ИИ перестаёт работать через буфер обмена

Третий уровень начинается, когда модель получает управляемый доступ к настоящему контексту: базе знаний, задачам, CRM, репозиторию, терминалу или внутренним API.

Качество растёт по двум причинам. Агент видит актуальные данные и может сам получить недостающую часть контекста. Сотруднику больше не нужно вручную собирать десять файлов и надеяться, что он не забыл одиннадцатый.

Цена ошибки тоже растёт. Чтение документа и выполнение команды — разные полномочия. Поэтому интеграции лучше проектировать как набор узких инструментов:

  • найти документ;
  • прочитать конкретную задачу;
  • создать черновик ответа;
  • запустить тесты;
  • подготовить изменение без публикации.

Каждый инструмент получает собственную схему входа, разрешения и журнал. Универсальная кнопка «дать доступ ко всему» экономит примерно один день настройки и потом очень бодро участвует в расследовании инцидента.

Уровень 4. Скилл — это промпт, который оброс зубами

Четвёртый уровень оказался для меня самым интересным.

Хорошего промпта уже мало. Рабочий скилл — это повторяемая операция, которую можно версионировать, тестировать и передавать другому человеку или агенту.

У нормального скилла есть шесть частей:

  1. Вход: какая задача подходит и какие данные обязательны.
  2. Контекст: что агент должен прочитать до первого действия.
  3. Инструменты: какие операции доступны и с какими параметрами.
  4. Права: что разрешено читать, менять и публиковать.
  5. Проверка: команды, тесты и критерии готовности.
  6. Остановка: условия, при которых агент зовёт человека.

Например, скилл «исправить GitHub issue» открывает задачу, читает правила репозитория, создаёт ветку, меняет код, запускает проверки и готовит PR. Он не выбирает новый продуктовый сценарий, если issue допускает два разных поведения. На этой развилке работа ставится на паузу.

issue → контекст репозитория → изменение → тесты → review → черновик PR
                                      ↘ неоднозначность → человек

Именно здесь ИИ перестаёт быть очень умным окном ввода. Появляется производственный процесс, который можно улучшать независимо от выбранной модели.

Уровень 5. Агенту дают цель, человеку оставляют тормоза

На пятом уровне агент получает уже не отдельную команду, а результат: обработать входящие обращения, выпустить обновление документации, проверить очередь задач или провести часть расследования.

Он сам выбирает следующие операции, повторяет неудачные шаги в пределах лимита и координирует несколько инструментов. Человек следит за метриками и подключается к исключениям.

Для такого режима нужны вещи, которые в красивом демо обычно остаются за кадром:

  • очередь и устойчивый планировщик;
  • сохранение состояния между шагами;
  • ограничение времени, стоимости и числа попыток;
  • трассировка решений и вызовов инструментов;
  • eval-наборы для регулярной проверки качества;
  • разграничение прав;
  • подтверждение рискованных действий;
  • понятный откат.

Без этого автономность получается только по названию. Агент честно движется к цели, а организация утром выясняет, что его представление о цели было творческим.

Где на этой карте находится xedoc.ru

Сначала я собирал xedoc.ru как доступ к разным моделям из браузера и VS Code. Это второй уровень: единая разрешённая точка входа вместо набора случайных вкладок.

Потом за чатом появился реальный контур: проекты, репозитории, ветки, терминал, Git, сборка и деплой. Агент видит рабочий контекст и действует через инструменты — третий уровень.

Следом центр тяжести переехал в Projects, спеки и скиллы. Проект хранит смысл, скилл — повторяемый способ работы, а модель внутри можно заменить. Это уже движение к четвёртому.

Моя идея ночной смены залезает на пятый: днём я валидирую SDD, ночью диспетчер раскладывает задачи по worktree, выбирает модели, запускает агентов и ревьюера, гоняет тесты, а утром приносит один отчёт.

До полноценного пятого уровня платформе ещё нужны реестр скиллов, eval-наборы, отдельные политики прав, трассировка запусков и устойчивый планировщик. В отдельных задачах разработки процесс уже выглядит именно так, но локальный успех сценария ещё не делает зрелой всю систему.

Моя матрица разрешений

Чем больше полномочий получает агент, тем точнее должны быть стоп-условия. Я делю действия на три группы.

Можно выполнять самостоятельно:

  • чтение разрешённого контекста;
  • поиск и анализ;
  • изменение файлов в отдельной ветке;
  • тесты, линтеры и локальная сборка;
  • подготовка черновиков.

Можно выполнять в пределах лимита:

  • повторная попытка после известной ошибки;
  • вызовы платных моделей;
  • создание временных окружений;
  • параллельный запуск нескольких агентов.

Только после подтверждения:

  • платёж;
  • публикация от имени человека или компании;
  • удаление данных;
  • миграция;
  • merge и deploy;
  • изменение прав доступа.

Это не универсальный закон. Для каждой организации границы будут своими. Важно, чтобы они существовали до запуска, а не возникали в момент, когда агент уже нашёл кнопку.

Четыре вопроса перед ростом автономности

Теперь я смотрю на любого агента через четыре вопроса:

  1. Какой контекст он видит?
  2. Какие инструменты и права у него есть?
  3. Как проверяется результат?
  4. Где он обязан остановиться и позвать человека?

Если ответы конкретные, следующий уровень можно пробовать на ограниченном процессе и измерять результат.

Если ответа на четвёртый вопрос нет, это тоже пятый уровень. Только по уровню смелости :DD

Материалы: ролик ToTheMoon, модель зрелости Microsoft и исходный пост в Telegram.