Aleksei Ogarkov
← // Тексты
// ТЕКСТЫ

Ваш next-best-action работает на публику, а не на назначения

В марте 2026 года IQVIA представила единую агентную ИИ-платформу, отчитавшись о более чем 150 развёрнутых интеллектуальных агентах и о том, что 19 из 20 крупнейших фармкомпаний уже встраивают её агентов в свои процессы. В мае свои агентные продукты запустила ZS. За двенадцать месяцев агентный анонс превратился в дежурный пресс-релиз категории, а флагманский сценарий — next-best-action (NBA), движок, который решает за медпреда, к какому врачу идти дальше и с чем.

Движки становятся быстрее. А вопрос, от которого зависит, окупятся ли они, звучит куда тише: за что движок получает награду, пока учится? Я вёл программу Next-Best-Action, где прирост считали против контрольной когорты, поэтому задаю этот вопрос как разработчик, а не как зритель. Честный ответ, общий для всех вендоров, такой: движок в основном учится на том, что видит, — принятая подсказка, открытое письмо, состоявшийся визит. А всё это — аплодисменты зала. Но аплодисменты — ещё не назначения.

На что на самом деле работает агентный next-best-action?

Сигнал, который он видит, — это вовлечённость. Движок рекомендует следующее касание, а дальше ему нужна обратная связь, чтобы учиться. Результат, ради которого он и создан, — сдвиг в назначениях — приходит медленно, тонет в шуме, и его не отделить от десятка других факторов. Клик же приходит мгновенно. Поэтому контур обучения замыкается на том, что приходит быстро: принятые и отклонённые подсказки, открытия писем, состоявшиеся визиты.

Вендоры и сами описывают контур именно так. Aktana, один из пионеров рынка, пишет, что «высокая вовлечённость не только ведёт к принятию „следующих наилучших действий“, но и даёт критически важную обратную связь для уточнения стратегии», и советует измерять «частоту принятия, отклонения и вовлечённости» по подсказкам. Отчёт IQVIA 2025 года о коммерческом ИИ ожидает, что в число возможностей войдёт «запуск действий — доставка контента, таргетинг аккаунтов, выстраивание последовательностей — с минимальным участием человека»: именно в эту сторону, по словам IQVIA, всё и движется. Аудировать этот контур пока никто не брался.

19 из 20
крупнейших фармкомпаний уже встраивают агентов IQVIA в свои процессы — по собственным подсчётам вендора из релиза о запуске; такова скорость агентной волны — IQVIA (март 2026) ↗

Логику такой конструкции понять можно: обучающимся системам нужна быстрая обратная связь. Но здесь и начинается проблема: быстрый сигнал и настоящий — не одно и то же.

Почему вовлечённость — неверная награда?

Потому что обучающаяся система работает не на ваш замысел, а за награду. Антрополог Мэрилин Стратерн сжала общий закон до одной фразы: «Когда мера становится целью, она перестаёт быть хорошей мерой». Вовлечённость была разумной мерой коммерческого внимания — ровно до момента, когда движку велели её максимизировать.

У исследователей ИИ для того, что происходит дальше, есть отдельный термин. Амодеи с коллегами описали reward hacking — взлом награды — ещё в 2016 году: агенты взламывают свою целевую функцию вместо того, чтобы решать задачу, и с точки зрения самого агента это «не баг — просто так устроена среда». Хрестоматийный пример — агент-лодка OpenAI из игры CoastRunners. Игра начисляла очки за сбитые по маршруту мишени, поэтому лодка нашла изолированную лагуну и принялась в ней кружить, сшибая возрождающиеся мишени (то и дело загораясь и врезаясь в другие лодки), — и набрала примерно на 20% больше очков, чем игроки-люди, так ни разу и не финишировав. Лодка не сломалась — сломалась награда.

Наложите это на коммерческие решения:

Награда, которую видит движокЧто он учится выдаватьЧто было нужно бизнесу
Принятие подсказокПодсказки, которые медпреду легко принятьКонтакты, меняющие назначения
Открытия и клики в письмахБолее кликабельные темы и удачное время отправкиИзменение поведения врача
Состоявшиеся визитыВизиты к доступным и дружелюбным врачамПрирост у нужных врачей
Балл вовлечённости по каналамБольше касаний в отзывчивых каналахПрирост на одно касание

Ни один сигнал из левой колонки не бесполезен — это диагностика. Портятся они лишь тогда, когда их возводят в ранг целевой функции.

Ловушка принятия: движок подстраивается под медпреда, а не под рынок

Самый незаметный вариант этого сбоя замыкает контур внутри полевой команды. Медпред принимает удобные подсказки (знакомый врач, привычный маршрут, визит, который и так бы состоялся) и отклоняет неудобные. Движок засчитывает принятие как успех и подстраивается.

Aktana говорит это прямо: её обучающий модуль «отдаёт приоритет подсказкам, которые с большей вероятностью будут отвечать предпочтениям представителя». Со временем система притирается к привычкам полевой команды, а график внедрения, который это сближение и показывает, уверенно ползёт вверх и вправо.

Я видел этот сценарий изнутри NBA-программы. Принятие подсказок — самая льстивая метрика в стеке, потому что обеим сторонам контура платят за согласие друг с другом: медпред получает подсказки, по которым легко действовать, а движок — принятие, которое можно записать себе в актив. И никому внутри этого контура не платят за то, чтобы заметить: эти назначения врач выписал бы и так.

Это только в фарме так?

Нет. Награда за наблюдаемый прокси — типовой сбой везде, где вообще оптимизируют вовлечённость. Клейнберг, Муллайнатан и Рагхаван формализовали это для рекомендательных платформ: платформа, которая «просто хочет максимизировать пользу для пользователя, но наблюдает только вовлечённость», может делать пользователям хуже — и это доказано формально; они точно описывают условия, при которых «рост вовлечённости не увеличивает пользу».

Милли с коллегами затем замерили это на живой платформе: ранжирование Twitter по вовлечённости «усиливает эмоционально заряженный, враждебный к чужой группе контент», а алгоритмически отобранные политические твиты нравятся пользователям не больше остальных.

Маркетинговая наука знает свою версию этого закона уже десятилетие. Когда eBay наконец поставил эксперимент со своим платным поиском, реклама по брендовым запросам, которой модели атрибуции годами приписывали заслуги, показала «отсутствие измеримого краткосрочного эффекта»: клики приходили от людей, которые и так бы пришли. Аскарса показала ту же закономерность в программах удержания: клиенты с наибольшим предсказанным риском оттока — не обязательно те, с кем стоит работать: усилия окупаются на тех, на кого вмешательство действительно действует. И закон один и тот же в каждой индустрии, которая поставила эксперимент: измеримый прокси уплывает от результата ровно в тот момент, когда вы берётесь его оптимизировать.

Как перенастроить награду на результат?

Наведите целевую функцию на прирост и сделайте контрфакт частью операционной рутины, а не разбором задним числом. Конкретно: выведите сопоставимых врачей или территории из-под действия движка, считайте разницу в результатах — и пусть система держит ответ именно за эту разницу, а не за принятие подсказок. Метрики вовлечённости остаются в стеке, но уже в разряде диагностики.

Именно так была устроена программа Next-Best-Action и маркетинг-микса, которую я вёл в топ-5 фармкомпании в СНГ. Действия движка оценивались против контрольной когорты: +7% приростных назначений (Rx), посчитанных как «визиты против отсутствия визитов», индекс 100 → 107; моя роль — AI-лид и разработчик. Это число справедливо для той когорты и той конструкции — и только для них. Отстоять его позволяет выбор, сделанный до масштабирования: за что система будет получать награду. Дисциплина измерения вырастает из этого выбора.

RECEIPT
Scope
Next-Best-Action + маркетинг-микс, топ-5 фарма в СНГ
Baseline
индекс 100, визиты против отсутствия визитов
Role
AI-лид и разработчик
Result
+7% incremental Rx (100 → 107)

Движок, которому хлопают, научится работать на публику. Нужны назначения — платите за них: за прирост, измеренный на врачах, которых движок не трогал.

// Возражение

Разве «вдвое эффективнее» не закрывает вопрос?

Это фраза вендора, а не измерение, которое можно проверить. ZS пишет, что «динамические таргетированные визиты вдвое эффективнее прочих и дают прирост продаж бренда на 5–10%», — методология к фразе не приложена. Эффективнее в чём и против какого контрфакта? Заявление может оказаться даже правдой. Суть в другом: из числа, за которым нет контроля, покупатель ничего не может узнать, а движок — научиться нужному.

заявление ZS о динамических таргетированных визитах против прочих — вендорская цифра без опубликованной методологии; проверьте её, прежде чем брать на веру — ZS (2025) ↗

Тот же скепсис подкрепляют и цифры самих вендоров. Gartner называет переклейку ярлыков «agent washing» и оценивает, что из тысяч заявленных агентных вендоров настоящих около 130, — и всё это в том же пресс-релизе, где ожидается отмена более 40% агентных ИИ-проектов к 2027 году. При этом сама ZS теперь продаёт test-and-control-аналитику, обещая «перейти от поверхностных метрик вовлечённости к настоящему влиянию на продажи»: значит, зазор видят и сами вендоры. Когда питч и сноска расходятся, читайте сноску.

С чего начать: почините награду до масштабирования движка

Если агентный NBA стоит у вас в дорожной карте или уже работает, функция награды — первое, что стоит проаудировать. Четыре шага, начиная с самого дешёвого:

  1. Запишите, за что движок получает награду сегодня. Фактический сигнал обратной связи в контуре, каким бы нелестным он ни был. Если ответ — принятие, открытия и визиты, вы натаскиваете систему на аплодисменты, а не на результат.
  2. Встройте контроль в операционный процесс. Постоянная контрольная группа из сопоставимых врачей, территорий или аккаунтов, которых движок не трогает, превращает прирост из квартального исследования в живой сигнал, на котором система и учится.
  3. Перенаведите целевую функцию. Награждайте за прирост против этого контроля; вовлечённость возвращается в телеметрию. Ожидайте, что графики внедрения просядут: они держались на вовлечённости.
  4. Проверяйте каждое вендорское заявление о приросте на контрфакт. Почти всё решает один вопрос: по сравнению с кем? У вендора с ответом есть измерение; у вендора без ответа — брошюра.

Движки ускоряются с каждым кварталом — тем важнее починить целевую функцию сейчас: система, которая быстро учится не тому, быстро в этом и преуспевает.

Выбирать, за что платят коммерческому движку, — это работа над операционной моделью, та же дисциплина, что стояла за программой Next-Best-Action, измеренной против контроля. Если в вашем NBA-дашборде много метрик внедрения и ни слова о приросте — посмотрим на функцию награды.