Aleksei Ogarkov
← // Тексты
// ТЕКСТЫ

Байесовский MMM: приор — это мнение, а не эксперимент

В июле 2025 года EMARKETER и TransUnion опросили 196 маркетологов США: 46,9% собирались инвестировать в маркетинг-микс-моделирование (MMM) в ближайший год, а 27,6% назвали MMM самой надёжной из доступных им методологий измерения. Вместе с бюджетами изменился и язык рынка: Lifesight, Sellforte, Measured и Haus продают продукты, которые так и называются — «Causal MMM», а в документации Google Meridian MMM назван «инструментом каузального вывода».

Во многом эту уверенность подпитывает одно слово: байесовский. Логика проста: приоры (допущения о параметрах, заданные до того, как модель увидела данные) вместе с апостериорными распределениями (оценками тех же параметров после встречи с данными) дают строгий вывод, значит, ROI можно трактовать как причинный эффект. Я сам строил маркетинг-микс-модель внутри коммерческой программы и представлял её выводы на встречах по бюджетам, поэтому мне выгодно, чтобы MMM воспринимали всерьёз. Именно поэтому меня и задевает подмена: «байесовский» продают как «каузальный». Байесовский аппарат даёт две вещи: регуляризацию (удержание оценок в правдоподобных границах, когда данных мало) и честную оценку неопределённости. Идентификация — право читать коэффициент как ответ на вопрос «что будет, если мы изменим расходы». Её обеспечивает дизайн измерения, то есть само устройство сравнения; приор её не заменит.

Почему «каузальный MMM» вдруг оказался везде?

Потому что прежняя альтернатива рассыпалась, а успокаивающий ярлык уже был под рукой. Мульти-тач-атрибуция держалась на пользовательском трекинге, который годами подтачивали регулирование приватности, ATT от Apple и закрытые экосистемы платформ. Маркетингу понадобился метод для агрегированных данных, и MMM оказался готов: сорок лет истории плюс новые инструменты с открытым исходным кодом.

Ирония в том, что сторонние cookie всё же выжили. В июле 2024-го Google отказался от планов отменить сторонние cookie, а в октябре 2025-го закрыл большинство API Privacy Sandbox, сославшись на то, что рынок их так и не принял. Тем не менее возрождение MMM продолжилось: дело оказалось не только в cookie — измерительные системы в целом теряли сигнал. В отчёте IAB State of Data 2026 они описаны как системы «под нагрузкой» из-за регулирования приватности, потери сигнала, оптимизации внутри платформ и фрагментации данных.

46,9%
маркетологов США (бренды и агентства) собирались инвестировать в MMM в ближайший год, n=196; 27,6% считают MMM самой надёжной методологией измерения — EMARKETER / TransUnion, июль 2025 ↗

На этот спрос рынок и ответил словом «causal». В FAQ Measured вся формула помещается в одну строку: традиционный MMM — корреляция, «Causal MMM = причинность (доказательство того, что действительно обеспечивает рост)». В октябре 2025-го Haus запустил продукт под названием Causal MMM. Ту же тональность поддерживает разработчик инструмента: документация Meridian утверждает, что «все величины, оцениваемые MMM, подразумевают причинность». Для продаж формулировка удобна. Осталось понять, чем она обоснована.

Что байесовский аппарат даёт на самом деле?

Две практические вещи: регуляризацию и честную оценку неопределённости. MMM пытается извлечь многое из небольшого массива данных, и информативные приоры не дают шуму и коллинеарности каналов увести результат в абсурд. Коллинеарность здесь означает простую вещь: расходы каналов движутся синхронно, и модель не может разделить их вклады. Recast, байесовский MMM-вендор, прямо объясняет механику: «Из-за шума в данных и коллинеарности каналов модель без ограничений может показать отрицательный или неправдоподобно высокий ROI». Апостериорные распределения, в свою очередь, заменяют обманчиво точную цифру честным диапазоном. Оба преимущества реальны с инженерной точки зрения.

Сам Google описывает роль приоров так: они «позволяют интуитивно регуляризовать подгонку каждого параметра с учётом априорного знания и выбранной силы регуляризации». Регуляризовать — ключевое слово. Причинная логика методологии Meridian находится в другом месте: в предполагаемом каузальном графе (схеме «что на что влияет», заданной до оценки), «построенном на основе экспертного знания предметной области». Модель наследует все ошибки этой схемы. Приор формирует оценку. Возможность трактовать её как причинную зависит от того, насколько обоснован предполагаемый граф.

У формулы «байесовский — значит каузальный» есть неудобная деталь: Robyn от Meta, второй из стандартных open-source-инструментов MMM, вообще не байесовский — под капотом гребневая регрессия и эволюционный подбор гиперпараметров. Рынок по привычке окружает такие инструменты каузальным ореолом, хотя сама математика этого права не даёт.

Что такое идентификация и почему приором её не заменить?

Идентификация отвечает на вопрос, способны ли данные и дизайн в принципе выявить причинную величину — даже при бесконечной выборке. Оценивание показывает, насколько точно измерен параметр; идентификация — тот ли параметр вы вообще измеряете. Больше данных сужает апостериорное распределение, но не исправляет дизайн, который не различает два сценария: «расходы двинули продажи» и «прогноз продаж двинул расходы». Второй сценарий — не экзотика: бюджеты каналов обычно и планируют от ожидаемых продаж. Приор появляется уже на этапе оценивания, после этого вопроса, и исправить дизайн оттуда нельзя.

Статистик Дэвид Фридман сформулировал это прямо: «По данным о X и Y нельзя установить, состоятельна ли причинная интерпретация. Причинный вывод из системы регрессионных уравнений возможен, только если причинность заложена в неё изначально. Как говорит Картрайт (1989): „No causes in, no causes out“» — не заложишь причин на входе, не получишь их на выходе.

MMM — хрестоматийный случай. Исследователи самого Google писали в 2017 году, что типичные микс-модели «дают корреляционные, а не причинные результаты; лишь при узком наборе условий эти оценки можно считать причинными». Та же работа показывает масштаб задачи: около 156 недельных точек должны объяснить 20 с лишним каналов с несколькими параметрами у каждого. Статья Google 2024 года о калибровке указывает на более глубокое ограничение: «причинная интерпретация MMM опирается на непроверяемое допущение условной обмениваемости». За термином стоит допущение: после учёта всех включённых в модель факторов периоды с разными расходами больше ничем существенным не отличаются. Проверить это по данным нельзя — только принять. Приор добавляет к нему ещё одно допущение. Сильнее всего он сдвигает апостериорную оценку там, где данных недостаточно, чтобы его перевесить, — как раз там, где возникает вопрос о причинности. В терминах бюджета: там, где данные не могут ответить, цифрой ROI становится исходное мнение разработчика модели.

Может ли провал спрятаться за хорошим фитом?

Да. Это показано в опубликованной симуляции. В исследовании PyMC Labs Хуан Камило Ордуз построил байесовский MMM с разумными приорами на данных с одним ненаблюдаемым конфаундером (скрытым фактором, который влияет и на расходы, и на продажи). Модель сошлась (расчёт отработал штатно), хорошо описала данные и уверенно перепутала местами два канала: ROAS (возврат на рекламные расходы) слабого канала оказался примерно вдвое выше истинного.

Lift-тест — это контролируемый эксперимент, который напрямую измеряет инкрементальный прирост от одного канала. Когда в модель добавили по два таких теста на каждый канал, оценки вернулись к истинным значениям. Внутренняя диагностика модели проблему не выявила; сигнал дал эксперимент.

Устройство самих инструментов иногда усугубляет проблему, хотя выглядит разумной предосторожностью. Robyn отбирает модели-кандидаты в том числе по DECOMP.RSSD — критерию, который отдаёт предпочтение моделям, где оценённая доля эффекта каждого канала близка к его доле в расходах. В сопроводительной статье это сформулировано прямо: «При отборе моделей бизнес-правдоподобие имеет не меньший вес, чем статистическое качество». В итоге преимущество получает модель, согласная с прошлогодним бюджетом, — тем самым распределением, которое её наняли проверить.

Каждое доказательство, которое умеет предъявить MMM, отвечает на более узкий вопрос, чем тот, который задаёт бюджетная встреча:

ДоказательствоЧто оно показываетЧего оно показать не может
Фит на истории (точность подгонки; R², NRMSE)Модель воспроизводит прошлоеЕсть ли у декомпозиции причинный смысл
Точность прогноза вне выборкиПрогноз держится, пока расходы и рынок остаются в прежнем режимеЧто произойдёт при изменении расходов
Байесовские интервалыНеопределённость внутри принятой моделиВерны ли допущения модели
Калибровка на lift-тестЭффект канала там, где его проверилиКаналы и диапазоны без эксперимента

Откуда в MMM на самом деле берётся причинность?

Из спланированного эксперимента — через калибровку: так результат эксперимента записывают в модель в виде приора. Geo-эксперименты со случайным распределением рекламных расходов по регионам создают экзогенную вариацию (изменение расходов по причинам, не связанным со спросом), которой нет в наблюдаемых данных; этот метод формализовали исследователи Google в 2011 году. Затем результат эксперимента можно учесть в модели. Документация Meridian предлагает «распространённый подход»: задать «точечную оценку эксперимента как среднее приора, а её стандартную ошибку — как стандартное отклонение приора». То есть результат эксперимента становится отправной точкой модели, а его погрешность — мерой доверия к этой точке.

Robyn добавляет отклонение от эксперимента в свои целевые функции, а PyMC-Marketing реализует калибровку lift-тестами отдельной функцией. Статья Robyn идёт дальше всех и называет калибровку «методом идентификации».

Формула «калибровка = идентификация» верна только в одну сторону. Приор с результатом эксперимента приносит в модель доказательство; приор, основанный на мнении, приносит мнение — с тем же математическим весом. Так выглядит иерархия триангуляции в правильном порядке: эксперимент служит источником истины, а его результат становится приором для калибровки микс-модели.

При этом у калибровки есть понятные границы, и первоисточники их признают. Документация Meridian отмечает, что «ROI по результатам эксперимента редко в точности совпадает с ROI, который оценивает MMM»: тест длиной в недели и модель, учитывающая месяцы остаточного эффекта, измеряют две разные величины. Один эксперимент фиксирует оценку одного канала в одной точке его кривой отклика. Он удостоверяет отдачу при этом уровне расходов и ничего не говорит об отдаче при вдвое большем или меньшем. Aryma Labs, которые критикуют этот подход жёстче других, идут дальше: по их мнению, geo-тесты вообще не подходят для задания приоров, поскольку «ваши эксперименты, возможно, одномерны, а MMM — нет». Иными словами, эксперимент измеряет один канал при прочих равных, а модель оценивает все каналы одновременно. Разрешать этот спор необязательно. Достаточно принять общий вывод: причинного содержания в откалиброванном MMM ровно столько, сколько в стоящих за ним экспериментах, с поправкой на каждое несоответствие между ними.

Как это выглядело в реальной программе?

Я вёл параллельно два инструмента — микс-модель и контрольное сравнение, — и доверие к ним строилось по-разному. В программе для топ-5 фармкомпании в СНГ маркетинг-микс-модель «Sales-Impact Prediction» раскладывала продажи по каналам, прогнозировала эффект выбранного микса и считала ROI. Прогноз сходился с фактом — поэтому модель вошла в процесс планирования. Этим уровень доверия и ограничивался: модель показала, что умеет прогнозировать, — и только это.

Основание для причинного вывода дал другой дизайн измерения. Итог программы сравнивали с контрольной когортой: +7% инкрементальных назначений у охваченных визитами врачей по сравнению с неохваченными, индекс 100 → 107; моя роль — AI-лид и разработчик. Такое сравнение задано дизайном, но рандомизированным экспериментом оно не было. Поэтому число справедливо для этой когорты и этого дизайна — и не шире. Главная дисциплина заключалась в том, чтобы не переносить доверие с контрольного сравнения на декомпозицию MMM (ту самую раскладку продаж по каналам) и обратно.

RECEIPT
Scope
Программа Next-Best-Action + маркетинг-микс, топ-5 фарма, СНГ
Baseline
индекс 100, охваченные vs неохваченные визитами
Role
AI-лид и разработчик
Result
+7% инкрементальных Rx (100 → 107)

Прогноз, который сходится с фактом, заслуживает места в планировании. Право на причинный вывод приходится обосновывать отдельно — дизайном; шире этого дизайна вывод не работает.

Что аудируемый MMM показывает CFO?

Тот же пакет доказательств и контрольных процедур, который в банке служба управления модельным риском запросила бы у кредитной модели. Руководство ФРС SR 11-7 определяет модель как любой количественный подход, который «использует статистические, экономические, финансовые или математические теории, методы и допущения, чтобы преобразовать исходные данные в количественные оценки». MMM подходит под это определение без натяжки.

Это руководство требует и «эффективного оспаривания» (effective challenge): «критического анализа со стороны объективных, компетентных специалистов, способных выявить ограничения и допущения модели и добиться необходимых изменений». Суть проверки — независимость плюс полномочия: рецензенты, не заинтересованные в результате, с правом добиться изменений. Маркетинг перераспределяет реальные бюджеты по выводам MMM. Руководство IAB по лучшим практикам (декабрь 2025) уже говорит с финансами на том же языке и требует от разработчиков моделей «рекомендаций с доверительными интервалами, понятных CFO и привязанных к P&L», построенных на аудируемых входных данных и проверяемых прогнозах.

На практике аудируемый MMM — это пакет, в котором рецензент может проверить каждый уровень:

  1. Приоры с происхождением. Для каждого информативного приора указан источник: эксперимент, задокументированная экспертная оценка или решение с именем того, кто его принял. Нужна и дата, чтобы при следующем пересчёте результат можно было сопоставить с этим решением.
  2. Допущения в протоколе. В протоколе зафиксирована каузальная структура модели: какие конфаундеры учтены и почему, а также насколько итоговый ROI чувствителен к выбору adstock (кривой затухания эффекта рекламы во времени) и сатурации (кривой насыщения отклика при росте расходов).
  3. Доказательства калибровки по каналам. Видно, у каких каналов есть экспериментальные якоря, совпадающие по KPI, географии и окну измерения. Каналы без такого якоря явно помечены флагом «эксперимента нет».
  4. Проверка результатов. Прогноз вне выборки отслеживается постоянно, с явной оговоркой: хороший фит необходим, но недостаточен.
  5. Эффективное оспаривание. Ревью проводит специалист, чьё вознаграждение не зависит от выводов модели. SR 11-7 формулирует это прямо: на разработчика модели «нельзя полагаться как на объективный или единственный источник» суждения о её качестве.

Логика та же, что и в управлении ИИ, которое проходит закупку: защищаемая позиция начинается с реестра, который можно положить перед рецензентом. График декомпозиции превращается из заявления в доказательство, когда за ним есть аудиторский след.

// Возражение

Разве байесовская неопределённость — не та самая честность?

Байесовский интервал честно показывает только неопределённость внутри принятой модели и ничего не говорит о верности её допущений. В симуляции Ордуза перепутанный рейтинг каналов сопровождался вполне благополучными апостериорными распределениями. Даже точный интервал вокруг неидентифицированного параметра описывает величину, которую нельзя содержательно интерпретировать.

Есть и практическое возражение: lift-тесты стоят денег. Аналитик-практик Тим Хибенталь проводит жёсткую границу: «Если вы не можете проводить эксперименты для проверки своего MMM, строить его не стоит». Моя версия мягче, но ненамного: постройте модель, пометьте каждый канал без экспериментального якоря и проверяйте самые крупные решения о перераспределении в ближайшем тесте, прежде чем действовать. Апостериорным оценкам без экспериментального якоря не место на встрече по бюджету — тем более под ярлыком «каузальный».

Майкл Камински из Recast точно формулирует исходную позицию рецензента: «Следует исходить из того, что MMM в целом ошибаются». Для эффективного оспаривания это разумная презумпция. Именно так управление модельным риском выглядит на практике.

Определить, на какие утверждения имеет право измерительная модель, — часть работы над операционной моделью. Та же дисциплина помогла разделить прогноз и причинный вывод в программе, измеренной против контроля. Если следующее число из вашего MMM готовят к встрече по бюджету, сначала проверим его по этому чек-листу.