AI-first проектный менеджмент: когда работу делают агенты
Gartner ожидает, что к концу 2027 года свернут более 40% агентных ИИ-проектов — из-за «растущих издержек, неясной бизнес-ценности или недостаточного контроля рисков». Перечитайте этот список: все три причины описывают операционную модель вокруг агента — издержки, ценность, контроль рисков. Про самого агента там ни слова.
Я строю системы на этих агентах и руковожу командами, в которые они встраиваются. Провал каждый раз устроен одинаково, и я к этой мысли возвращаюсь постоянно: модель — как раз самое простое. Ломается то, что вокруг: кто пускает результат агента в дело, кто его проверяет, кто отвечает, когда агент ошибётся. AI-first проектный менеджмент — это дисциплина: сначала спроектировать этот контур, и только потом масштабировать агентов внутри него.
Что меняется, когда в команду приходят ИИ-агенты?
Юнит-экономика работы переворачивается. Сгенерировать черновик (код, презентацию, аналитику) теперь почти бесплатно. Проверить, что он верен, — по-прежнему нет. Ограничение переезжает: раньше упирались в то, как быстро команда производит, теперь — в то, как быстро она проверяет. Вместе с ограничением переезжает и настоящая работа руководителя.
И это уже сегодняшняя средняя команда. По опросу разработчиков Stack Overflow 2025 года, 84% используют или планируют использовать ИИ-инструменты. Gartner ожидает, что к 2028 году треть корпоративных приложений будет содержать агентный ИИ — против менее 1% в 2024-м — и что на том же горизонте как минимум 15% повседневных рабочих решений будут приниматься автономно. Агенты уже в команде. Развилка одна: управлять ими как ускоренной версией прежней команды — это и есть типичная ошибка — или переустроить команду вокруг того, что стало дефицитом.
Почему узким местом становится проверка?
Потому что агенты наращивают объём результата быстрее, чем доверие к нему, и кому-то приходится закрывать этот разрыв. Главная претензия к ИИ-инструментам для кода в опросе Stack Overflow 2025 года — «решения, которые почти правильные, но не совсем»: её назвали 66% разработчиков, чаще любой другой. «Почти правильно» — самый дорогой сорт ошибки: такое решение проходит беглый просмотр и ломается в проде.
Этот налог — обязательную перепроверку — теперь измерили. Исследование 2026 года разобрало 278 790 ревью-обсуждений в 300 open-source-проектах. С кодом от ИИ ревьюеры проходили на 11,8% больше раундов, чем с кодом от людей, а предложения ИИ принимали в 16,6% случаев — против 56,5% у предложений от людей. Больше половины отклонённых предложений ИИ оказались неверными либо были заменены другим решением. Больше результата, больше проверки, меньше отдачи с каждого предложения.
При этом тот же эффект виден и уровнем выше — в поставке. Отчёт Google DORA за 2024 год, около 39 000 респондентов, показал: рост внедрения ИИ на 25% сопровождался снижением пропускной способности поставки примерно на 1,5% и её стабильности — на 7,2%. Собственный вывод отчёта: «ИИ не выглядит панацеей». Отдельный человек ускоряется, система проседает — это почерк неуправляемого разрыва проверки. Адди Османи, который занимается таким ревью в Google профессионально, формулирует сдвиг прямо:
Трудное в инженерии теперь не написать код, а решить, можно ли ему доверять, — поэтому ревью и стало самым окупаемым навыком в разработке. — Адди Османи, Agentic Code Review
Какую работу отдавать агенту, а какую нет?
Соотносите задачу с радиусом поражения (тем, насколько широко разойдутся последствия ошибки). Агенты сильны там, где работа чётко описана и проверяется дёшево, и слабы там, где ошибка тихая и дорогая. «Проблема 70%» у Османи описывает ловушку точно: агент на удивление быстро довозит вас до 70% пути, но оставшиеся 30% вязнут в убывающей отдаче — и именно в них сидит всё, где нужно суждение человека.
Сортировать — работа руководителя, и весь вопрос в том, насколько ошибка останется локальной:
| Работа | Отдать агенту? | Почему |
|---|---|---|
| Шаблонный код, каркасы, документация, заготовки тестов | Да | радиус поражения малый, проверка быстрая |
| Миграции, рутинный рефакторинг, черновая аналитика | Да, с ревью | механика, но поведение на краях проверьте |
| Бизнес-логика с реальными краевыми случаями | За человеком, агент в помощь | сбои незаметны и дороги |
| Безопасность, изменения модели данных, контракты API | За человеком | одна незаметная ошибка — широкий радиус |
За пределами разработки закономерность та же. Всё, у чего есть чёткая спецификация и дешёвая проверка, — кандидат на передачу; всё, где «почти правильно» опасно, остаётся за ответственным человеком, а агент при нём — быстрый первый прогон. Anthropic по опыту собственных систем замечает: в задачах по коду распараллеливаемых подзадач меньше, чем в исследовательских. Характер работы и решает, сколько можно отдать.
Один агент или команда агентов?
Готового ответа у индустрии нет — выбирать придётся вам. В одну и ту же неделю июня 2025 года две авторитетные лаборатории опубликовали противоположные советы. Anthropic сообщила, что мультиагентная схема — ведущий агент раздаёт задачи параллельным субагентам — обошла одиночного агента на 90,2% на её внутренней оценке исследовательских задач. Cognition в ту же неделю выпустила текст «Don’t Build Multi-Agents» — «не стройте мультиагентов».
Расхождение это полезное, потому что каждая сторона права насчёт своего типа работы:
| Мультиагенты, параллельно (Anthropic) | Один поток, линейно (Cognition) | |
|---|---|---|
| Лучше для | широкого поиска, распараллеливаемых подзадач | общего контекста, тесных зависимостей |
| Цена | примерно в 15 раз больше токенов, чем обычный чат | один контекст, кратно дешевле |
| Главный риск | координация и потеря контекста | нет параллелизма |
| Правило | ценность должна оправдывать счёт за токены | каждое действие несёт неявные решения, а конфликт решений даёт плохой результат |
Anthropic не скрывает цену: по её данным, мультиагентные системы тратят примерно в 15 раз больше токенов, чем обычный чат, и одно только потребление токенов объясняет 80% разброса в качестве. Качество здесь покупается расходом. Там же названо, где веер — неверный инструмент: в областях, где всем агентам нужен общий контекст или где между агентами много зависимостей, мультиагентные системы сегодня работают плохо. Рецепт Cognition для таких областей ровно обратный: один линейный агент в одном потоке, чтобы контекст оставался непрерывным. AI-first проектный менеджер выбирает архитектуру под работу: веер — там, где подзадачи независимы и проверяются по отдельности; линейная схема — там, где контекст общий. Это конструкторское решение, мода здесь не аргумент.
Агент — это компонент. Продукт — по-прежнему команда.
Вы не управляете моделью — вы переустраиваете контур, в котором она работает: кто получает сигнал, как быстро он может действовать, какими свидетельствами оправдан расход, кто ставит подпись. Я уже писал, что расстояние от демо до внедрённой системы — это операционная модель; агенты её не отменяют — только поднимают ставки. Рекомендация Next-Best-Action, под которую не перестроили работу команды, — это дашборд. Агент, который генерирует код, когда проверять его некому, — тот же дашборд, только быстрее.
Я строю такие системы своими руками, и это меняет то, как я ими руковожу. У меня работает самодельный MCP-хаб данных, который отдаёт управляемые коммерческие датасеты прямо ИИ-ассистентам. Собрать такое самому — самый быстрый известный мне способ почувствовать, где многообещающий результат перестаёт доезжать до прода: неуправляемый путь данных, тихий фолбэк, шаг, который на деле никто не проверяет. Продукт — это команда, ритм и цепочка подписей.
Кто отвечает, когда агент что-то ломает?
За результатом каждого агента стоит человек с именем и фамилией. Автономия без границ — верный способ получить инцидент, за который никто внятно не отвечает: ответственность просто не назначили заранее.
В июле 2025 года кодинг-агент Replit выполнил разрушительные команды в продакшн-базе — во время объявленной заморозки кода и изменений. Сгенерированный самим агентом текст называл это «катастрофическим провалом с моей стороны»; глава Replit Амджад Масад назвал случившееся недопустимым — такое, по его словам, вообще не должно быть возможным — и в ответ развёл dev- и prod-среды и ввёл режим «только планирование».
Четырнадцать лет в регулируемой фарме превратили управление рисками в рефлекс: документирование, валидация, человек в контуре — без них в высокорисковой области продукт вообще не выходит. Ровно это нужно и команде агентов: очерченные границы — что каждый агент вправе трогать, — журнал действий и человек, отвечающий за результат. Ответственность остаётся за тем, кто развернул агента, и на модель не переходит никогда.
Как понять, что агенты действительно помогли?
Внедрение — ещё не эффект. Считайте исходы против контроля, иначе вы измеряете энтузиазм. Именно на этом тихо проваливается большинство AI-first-программ: отчитываются использованием: сколько PR затронуто, сколько лицензий активно, сколько строк сгенерировано, — пока качество и поставка едут в другую сторону. У рыночной версии этого сбоя есть имя: Gartner называет её «agent washing» — переклейка ярлыка «агент» на старые продукты — и оценивает, что из тысяч заявленных агентных вендоров настоящих около 130.
Klarna — поучительный случай. В 2024 году компания заявила, что её ИИ-ассистент делает работу 700 операторов и обрабатывает около двух третей обращений в поддержку. К маю 2025-го гендиректор Себастьян Семятковски развернул курс и снова начал нанимать людей, признав: издержкам при перестройке дали слишком большой вес, и качество на выходе оказалось ниже. Метрика внедрения выглядела блестяще. Эффект не устоял.
Я предъявляю агентам тот же стандарт, что и любому вмешательству: число, за которым стоит контроль. В программе Next-Best-Action, которую я вёл в топ-5 фармкомпании в СНГ, мы получили +7% приростных назначений (Rx), посчитанных как «визиты против отсутствия визитов», индекс 100 → 107, — у этой цифры есть контрфакт, охват и роль; у графика использования нет ни первого, ни второго, ни третьего. Это та самая дисциплина измерения, которая нужна и агентам: прежде чем поверить рассказу о выросшей продуктивности, спросите, с чем агентов сравнивали.
- Scope
- Программа Next-Best-Action, топ-5 фарма в СНГ
- Baseline
- индекс 100, визиты против отсутствия визитов
- Role
- AI-лид и разработчик
- Result
- +7% incremental Rx (100 → 107)
Разве более сильные модели не снимут эту проблему?
Способности моделей растут каждый месяц; разрыв в операционной модели сам собой не сужается. Доказательство — расстояние между экспериментом и масштабом. По отчёту McKinsey «The State of AI» за 2025 год, 62% организаций экспериментируют с ИИ-агентами, но в любой отдельно взятой функции масштабируют их не более 10%. Более сильная модель этот разрыв не закроет; закрывать его — вам: контуром, ресурсом на проверку, управлением рисками.
При этом каждое новое поколение моделей вопрос только заостряет. Более способный агент выдаёт больше результата, и результат этот всё правдоподобнее, а значит, каждый непроверенный релиз обходится дороже. От следующего поколения моделей выиграют те команды, которые на нынешнем построили контур — проверку, ответственного владельца, измерение, — потому что именно это накапливается. Модель арендована и улучшается сразу для всех. Операционная модель — ваша.
AI-first проектный менеджмент: с чего начать
Если агенты уже в работе команды или вот-вот в ней появятся, первый квартал уходит на контур, благодаря которому возросший поток результатов можно безопасно отправлять. Пять шагов, по порядку:
- Очертите границы. Запишите, что агенты вправе трогать, а что остаётся за людьми, — с сортировкой по радиусу поражения, — прежде чем кто-то начнёт масштабировать использование.
- Дайте проверке ресурс. Сделайте её полноценным шагом с реальной мощностью. Если объём результата вот-вот вырастет, пропускная способность ревью должна вырасти вместе с ним — иначе разрыв всё равно закроется, только дефектами в проде.
- Назначьте ответственного владельца за результат каждого агента. Автономия — это нормально; анонимность — нет.
- Подберите архитектуру по задаче. Веер — только там, где подзадачи независимы и проверяются по отдельности; линейная схема — там, где контекст общий. Мерило — счёт за токены и сценарии отказа.
- Считайте прирост против контроля. Отчитывайтесь контрфактом; счётчик внедрения им не является. Если ничего не придержали в контроле — вы читаете дашборд.
Сделайте это — и агенты станут тем, чем и должны быть: быстрым дешёвым первым прогоном внутри контура, которому вы доверяете. Пропустите — и ваш проект уже кандидат в те 40%, которым Gartner прочит отмену.
Вшить этот стандарт в то, как команда планирует, нанимает и тратит, — это работа над операционной моделью, которой я занимаюсь, и та же дисциплина стоит за программой Next-Best-Action в топ-5 фарма в СНГ. Если в вашей агентной программе много графиков внедрения и мало защищённых цифр — начните с контура.