Aleksei Ogarkov
← // Тексты
// ТЕКСТЫ

ROI от ИИ: сдвинулось число — или только дашборд?

Про отдачу от ИИ ходят две цифры — и обе сразу верными быть не могут. В отчёте Google Cloud «The ROI of AI 2025» 74% руководителей ответили, что видят возврат инвестиций уже в первый год работы с генеративным ИИ. В исследовании MIT Project NANDA 95% корпоративных пилотов того же генеративного ИИ не дали никакого измеримого эффекта в P&L — при вложенных, по оценкам, $30–40 млрд. Получается, корпоративный мир в одном и том же квартале записывает себе и триумф, и погрешность округления.

Шумом опросов такой разрыв не объяснить. Я вёл программы по обе его стороны, и дело ни разу не было в модели. Одни меряют дашборд, другие — число. И честное измерение ROI от ИИ начинается с простого: разобраться, что именно намерили вы.

95%
корпоративных пилотов генеративного ИИ не дали измеримого эффекта в P&L — при вложенных, по оценкам, $30–40 млрд — MIT Project NANDA ↗

Атрибуция — про касания, ROI — про причину

Это не спор о терминах: в P&L попадает только причина.

Атрибуция распределяет заслугу между точками контакта, которые ей вообще видны на пути к результату. Инкрементальность задаёт другой вопрос: а что случилось бы и так, без вмешательства? Маркетинг прошёл эту войну десять лет назад. Компания Haus, которая как раз меряет инкрементальность, описывает типичную картину: многоканальная атрибуция насчитывает ретаргетингу, скажем, ROAS 3,8×, а гео-холдаут на той же кампании раз за разом показывает, что 40–60% этих конверсий случились бы всё равно. Айк Армстронг из Haus говорит об этом прямо: инструменты, построенные на корреляциях, всегда будут систематически перекармливать бюджетом то, что измеримо, и недокармливать то, что измерить нельзя.

Теперь перенесите это на ИИ. Ассистент открыт на экране в момент, когда закрывается сделка, — и сделку записывают на ассистента. Копайлот открыт в редакторе, когда фича уходит в релиз, — и фичу записывают на копайлота. Базовый спрос, квалификация самого продавца, десяток параллельных инициатив — всё уходит в зачёт ИИ, потому что ничего из этого не вычли. Присутствие — это атрибуция. Прироста оно не доказывает. Поэтому Андреа Сивьеро из IDC и пишет, что агентный ИИ ломает саму модель ROI: когда плавают и выгода, и стоимость системы, деление одного плавающего числа на другое уже ничего не описывает.

Число, которое сдвинулось, может оказаться вашим собственным ощущением

Почти всё, чем доказывают «ROI от ИИ», — самооценка. А самооценка смещена вверх, и смещена уверенно.

Самый резкий результат последних двух лет — не опрос про ROI. Это рандомизированный эксперимент METR 2025 года. Опытные open-source-разработчики работали в собственных репозиториях. До начала они ожидали, что ИИ сократит им время на 24%. После — считали, что он ускорил их на 20%. А рандомизированный контроль показал: с ИИ они стали на 19% медленнее. Между тем, что чувствовали эти эксперты, и тем, что показал секундомер, — разрыв примерно в 40 пунктов, и направлен он не в ту сторону.

Вот из чего на самом деле собран тот дашборд с 74%: удовлетворённость из опросов, «сэкономленные часы» по собственным прикидкам, счётчики внедрения. Спросите людей — и вы измерите энтузиазм; результат в опрос вообще не попадает. А как только прокси-метрика становится целью, под которую выделяют бюджет, включается закон Гудхарта. Внедрение начинают нагонять. В «предотвращённые обращения» записывают тикеты, которые закрылись бы и сами. Использование делают обязательным. Рон Кохави за годы контролируемых экспериментов задал планку точнее всех: получить цифры легко; получить цифры, которым можно доверять, — трудно.

Если рандомизировать нельзя, контроль всё равно можно построить

Когда рандомизировать отдельного человека нельзя, контрфакт собирают из структуры.

Честному числу нужен дизайн эксперимента — дашборд его не заменит. Я мерил именно так. Программа Next-Best-Action, которую я вёл в топ-5 фармкомпании в СНГ, дала +7% приростных назначений (Rx), посчитанных как «визиты против отсутствия визитов», индекс 100 → 107.

RECEIPT
Scope
Программа Next-Best-Action, топ-5 фарма в СНГ
Baseline
индекс 100, визиты против отсутствия визитов
Role
AI-лид и разработчик
Result
+7% incremental Rx (100 → 107)

Структуру берут из географии, времени или уровня единиц — четыре типовых дизайна:

ДизайнКогда применятьНа что смотреть
Гео-холдаутможно разделить регионыпереток эффекта через границы
Ghost / PSA-холдаутвоздействие можно снять на уровне отдельной единицыстатистическая мощность и стоимость
Синтетический контрольпод воздействием одна единица, чистый предпериодплохая подгонка предпериода смещает оценку
Ступенчатое внедрение (stepped-wedge)насовсем оставить без воздействия нельзясмешение с фактором времени

Каждый из них строит то сравнение, которое дашборд пропускает. Google Meridian создан ровно под эту задачу — в его собственной документации так и написано: инструмент для причинного вывода, не для прогноза. Зато вы получаете число, которого ни одна модель атрибуции не даст. eBay провёл гео-холдаут на 68 медиарынках и обнаружил: его платная реклама по брендовым запросам сдвигала продажи на величину, статистически неотличимую от нуля.

Когда три ваших числа расходятся, спор решает холдаут

Атрибуция, маркетинг-микс-моделирование (MMM) и холдаут дадут по одной и той же программе три разных ответа. Этот разброс — карта того, где врут ваши некалиброванные модели. Усреднить его — значит спрятать враньё под средним.

Зрелые команды триангулируют, но не режут разницу пополам. Иерархия доверия жёсткая:

  1. Эксперимент — эталон.
  2. Его результат становится априорной оценкой, по которой калибруют микс-модель.
  3. Атрибуция остаётся для повседневной, относительной диагностики; строку ROI ей одной не доверяют никогда.

Когда трое спорят, решает холдаут; двое других — свидетели, показания которых перевзвешивают под него. И обходные методы ошибаются предсказуемо. На 663 рекламных экспериментах Гордон с коллегами обнаружили, что методы без рандомизированного контроля превращали настоящий прирост 29 / 18 / 5% в 83 / 58 / 24%. Каждый раз мимо — и каждый раз вверх.

// Возражение

Холдаут стоит денег и всё равно может ничего не сказать

Оба возражения справедливы. И снимаются оба на этапе дизайна: посчитать мощность заранее, оценить цену бездействия и откалиброваться один раз вместо вечных перепроверок.

Грамотный оппонент никогда не спросит, нужен ли контроль вообще. Он скажет иначе: придержанная часть рынка — это реальная недополученная выручка, а замер всё равно может выйти слишком шумным, чтобы на него опираться. Льюис и Рао на 25 полевых экспериментах обнаружили: медианный доверительный интервал для рекламного ROI шире 100 процентных пунктов.

Выход — в дизайне. Ghost-ads и гео-методы возвращают бóльшую часть точности на порядок дешевле лобового холдаута, так что «слишком дорого» обычно значит, что вы выбрали дорогой дизайн. Если насовсем оставить часть рынка без воздействия политически невозможно — рандомизируйте момент запуска и снимайте эффект со ступенчатого внедрения. И честно посчитайте цену бездействия. Uber отключил около $100 млн из рекламного бюджета в $150 млн — установки не шелохнулись. P&G срезала $200 млн цифровых расходов — продажи устояли, а охват вырос. Эти деньги жгли годами ровно потому, что никто никогда ничего не придерживал. Выручка, придержанная на время теста, — цена знания. Потери, которые тест вскрыл, — деньги, которые вы перестаёте жечь. А когда один чистый эксперимент станет для микс-модели якорем, перепроверять каждый квартал больше не нужно — дальше калибруетесь по нему.

Один вопрос, который отделяет настоящий ROI от дашборда

ИИ может окупаться. Но число становится ROI, только если за ним стоит контрфакт. Мои +7% держатся на контрольной группе — по той же причине, по которой «ноль» eBay заслуживает больше веры, чем 3,7× из спонсированного Microsoft опроса IDC, где контроля не было вовсе.

Так что, прежде чем поверить множителю, спросите одно: что осталось без воздействия? Если ответ — «ничего», вы читаете дашборд, а не число.

Вшить этот стандарт доказательства в то, как коммерческая команда планирует и тратит, — работа над операционной моделью, которой я занимаюсь; та же дисциплина стоит за программой Next-Best-Action в топ-5 фарма в СНГ. Если в вашем ИИ-портфеле много дашбордов и мало цифр, которые можно отстоять, — начните с холдаута.