ROI от ИИ: сдвинулось число — или только дашборд?
Про отдачу от ИИ ходят две цифры — и обе сразу верными быть не могут. В отчёте Google Cloud «The ROI of AI 2025» 74% руководителей ответили, что видят возврат инвестиций уже в первый год работы с генеративным ИИ. В исследовании MIT Project NANDA 95% корпоративных пилотов того же генеративного ИИ не дали никакого измеримого эффекта в P&L — при вложенных, по оценкам, $30–40 млрд. Получается, корпоративный мир в одном и том же квартале записывает себе и триумф, и погрешность округления.
Шумом опросов такой разрыв не объяснить. Я вёл программы по обе его стороны, и дело ни разу не было в модели. Одни меряют дашборд, другие — число. И честное измерение ROI от ИИ начинается с простого: разобраться, что именно намерили вы.
Атрибуция — про касания, ROI — про причину
Это не спор о терминах: в P&L попадает только причина.
Атрибуция распределяет заслугу между точками контакта, которые ей вообще видны на пути к результату. Инкрементальность задаёт другой вопрос: а что случилось бы и так, без вмешательства? Маркетинг прошёл эту войну десять лет назад. Компания Haus, которая как раз меряет инкрементальность, описывает типичную картину: многоканальная атрибуция насчитывает ретаргетингу, скажем, ROAS 3,8×, а гео-холдаут на той же кампании раз за разом показывает, что 40–60% этих конверсий случились бы всё равно. Айк Армстронг из Haus говорит об этом прямо: инструменты, построенные на корреляциях, всегда будут систематически перекармливать бюджетом то, что измеримо, и недокармливать то, что измерить нельзя.
Теперь перенесите это на ИИ. Ассистент открыт на экране в момент, когда закрывается сделка, — и сделку записывают на ассистента. Копайлот открыт в редакторе, когда фича уходит в релиз, — и фичу записывают на копайлота. Базовый спрос, квалификация самого продавца, десяток параллельных инициатив — всё уходит в зачёт ИИ, потому что ничего из этого не вычли. Присутствие — это атрибуция. Прироста оно не доказывает. Поэтому Андреа Сивьеро из IDC и пишет, что агентный ИИ ломает саму модель ROI: когда плавают и выгода, и стоимость системы, деление одного плавающего числа на другое уже ничего не описывает.
Число, которое сдвинулось, может оказаться вашим собственным ощущением
Почти всё, чем доказывают «ROI от ИИ», — самооценка. А самооценка смещена вверх, и смещена уверенно.
Самый резкий результат последних двух лет — не опрос про ROI. Это рандомизированный эксперимент METR 2025 года. Опытные open-source-разработчики работали в собственных репозиториях. До начала они ожидали, что ИИ сократит им время на 24%. После — считали, что он ускорил их на 20%. А рандомизированный контроль показал: с ИИ они стали на 19% медленнее. Между тем, что чувствовали эти эксперты, и тем, что показал секундомер, — разрыв примерно в 40 пунктов, и направлен он не в ту сторону.
Вот из чего на самом деле собран тот дашборд с 74%: удовлетворённость из опросов, «сэкономленные часы» по собственным прикидкам, счётчики внедрения. Спросите людей — и вы измерите энтузиазм; результат в опрос вообще не попадает. А как только прокси-метрика становится целью, под которую выделяют бюджет, включается закон Гудхарта. Внедрение начинают нагонять. В «предотвращённые обращения» записывают тикеты, которые закрылись бы и сами. Использование делают обязательным. Рон Кохави за годы контролируемых экспериментов задал планку точнее всех: получить цифры легко; получить цифры, которым можно доверять, — трудно.
Если рандомизировать нельзя, контроль всё равно можно построить
Когда рандомизировать отдельного человека нельзя, контрфакт собирают из структуры.
Честному числу нужен дизайн эксперимента — дашборд его не заменит. Я мерил именно так. Программа Next-Best-Action, которую я вёл в топ-5 фармкомпании в СНГ, дала +7% приростных назначений (Rx), посчитанных как «визиты против отсутствия визитов», индекс 100 → 107.
- Scope
- Программа Next-Best-Action, топ-5 фарма в СНГ
- Baseline
- индекс 100, визиты против отсутствия визитов
- Role
- AI-лид и разработчик
- Result
- +7% incremental Rx (100 → 107)
Структуру берут из географии, времени или уровня единиц — четыре типовых дизайна:
| Дизайн | Когда применять | На что смотреть |
|---|---|---|
| Гео-холдаут | можно разделить регионы | переток эффекта через границы |
| Ghost / PSA-холдаут | воздействие можно снять на уровне отдельной единицы | статистическая мощность и стоимость |
| Синтетический контроль | под воздействием одна единица, чистый предпериод | плохая подгонка предпериода смещает оценку |
| Ступенчатое внедрение (stepped-wedge) | насовсем оставить без воздействия нельзя | смешение с фактором времени |
Каждый из них строит то сравнение, которое дашборд пропускает. Google Meridian создан ровно под эту задачу — в его собственной документации так и написано: инструмент для причинного вывода, не для прогноза. Зато вы получаете число, которого ни одна модель атрибуции не даст. eBay провёл гео-холдаут на 68 медиарынках и обнаружил: его платная реклама по брендовым запросам сдвигала продажи на величину, статистически неотличимую от нуля.
Когда три ваших числа расходятся, спор решает холдаут
Атрибуция, маркетинг-микс-моделирование (MMM) и холдаут дадут по одной и той же программе три разных ответа. Этот разброс — карта того, где врут ваши некалиброванные модели. Усреднить его — значит спрятать враньё под средним.
Зрелые команды триангулируют, но не режут разницу пополам. Иерархия доверия жёсткая:
- Эксперимент — эталон.
- Его результат становится априорной оценкой, по которой калибруют микс-модель.
- Атрибуция остаётся для повседневной, относительной диагностики; строку ROI ей одной не доверяют никогда.
Когда трое спорят, решает холдаут; двое других — свидетели, показания которых перевзвешивают под него. И обходные методы ошибаются предсказуемо. На 663 рекламных экспериментах Гордон с коллегами обнаружили, что методы без рандомизированного контроля превращали настоящий прирост 29 / 18 / 5% в 83 / 58 / 24%. Каждый раз мимо — и каждый раз вверх.
Холдаут стоит денег и всё равно может ничего не сказать
Оба возражения справедливы. И снимаются оба на этапе дизайна: посчитать мощность заранее, оценить цену бездействия и откалиброваться один раз вместо вечных перепроверок.
Грамотный оппонент никогда не спросит, нужен ли контроль вообще. Он скажет иначе: придержанная часть рынка — это реальная недополученная выручка, а замер всё равно может выйти слишком шумным, чтобы на него опираться. Льюис и Рао на 25 полевых экспериментах обнаружили: медианный доверительный интервал для рекламного ROI шире 100 процентных пунктов.
Выход — в дизайне. Ghost-ads и гео-методы возвращают бóльшую часть точности на порядок дешевле лобового холдаута, так что «слишком дорого» обычно значит, что вы выбрали дорогой дизайн. Если насовсем оставить часть рынка без воздействия политически невозможно — рандомизируйте момент запуска и снимайте эффект со ступенчатого внедрения. И честно посчитайте цену бездействия. Uber отключил около $100 млн из рекламного бюджета в $150 млн — установки не шелохнулись. P&G срезала $200 млн цифровых расходов — продажи устояли, а охват вырос. Эти деньги жгли годами ровно потому, что никто никогда ничего не придерживал. Выручка, придержанная на время теста, — цена знания. Потери, которые тест вскрыл, — деньги, которые вы перестаёте жечь. А когда один чистый эксперимент станет для микс-модели якорем, перепроверять каждый квартал больше не нужно — дальше калибруетесь по нему.
Один вопрос, который отделяет настоящий ROI от дашборда
ИИ может окупаться. Но число становится ROI, только если за ним стоит контрфакт. Мои +7% держатся на контрольной группе — по той же причине, по которой «ноль» eBay заслуживает больше веры, чем 3,7× из спонсированного Microsoft опроса IDC, где контроля не было вовсе.
Так что, прежде чем поверить множителю, спросите одно: что осталось без воздействия? Если ответ — «ничего», вы читаете дашборд, а не число.
Вшить этот стандарт доказательства в то, как коммерческая команда планирует и тратит, — работа над операционной моделью, которой я занимаюсь; та же дисциплина стоит за программой Next-Best-Action в топ-5 фарма в СНГ. Если в вашем ИИ-портфеле много дашбордов и мало цифр, которые можно отстоять, — начните с холдаута.