Synthetic control для оценки изменения кампании без случайного holdout

Как применять synthetic control к рекламной кампании: intervention, donor pool, pre-period fit, веса, placebo, spillover, uncertainty и честные ограничения вывода.

Оглавление22 разделов

Когда кампания, GEO или площадка изменены целиком, случайной контрольной группы может не быть. Сравнение «до и после» смешивает эффект с сезонностью, рынком и общим трендом. Synthetic control строит контрфактический ряд как взвешенную комбинацию незатронутых доноров, которая повторяет treatment до вмешательства. После изменения разрыв интерпретируется как кандидат на эффект, но только если доноры действительно не затронуты, pre-fit устойчив, а одновременно не произошло другого уникального события.

Прямой ответ

Определите единицу и точный момент вмешательства, соберите donor pool без spillover, выберите длинный pre-period и outcome, зафиксируйте алгоритм весов. Затем проведите placebo по единицам и времени, sensitivity к донорам и честно покажите диапазон выводов.

1. Когда метод уместен

Есть одна или несколько агрегированных treatment-единиц, длинная история до изменения и набор потенциальных контролей. Рандомизация отсутствует, а простой parallel trend сомнителен.

Если доноров нет или вмешательство затронуло весь рынок, synthetic control не создаст контроль из воздуха.

Метод подходит, когда вмешательство затронуло одну или несколько крупных единиц, рандомизация невозможна, а доступна длинная сопоставимая история. Он слабее при одновременном рыночном шоке, который по-разному влияет на treated и donor pool, или когда изменение заранее ожидалось и повлияло на поведение доноров.

До расчёта сформулируйте, какое предположение делает контроль правдоподобным: без вмешательства взвешенная комбинация доноров продолжила бы прежнюю динамику treated unit. Это утверждение нельзя доказать одним хорошим pre-fit, поэтому нужны предметные аргументы и проверки устойчивости.

2. Определите вмешательство

Запишите точное время, содержание, rollout и затронутую область. Постепенное внедрение требует treatment intensity или другого дизайна.

Одновременная смена оффера, цены и трекинга делает эффект составным.

Intervention record включает не только дату, но и intensity: долю бюджета, охват eligible единиц, версии креатива и продукта. Если rollout шёл три дня, единственная вертикальная линия упрощает реальность. Аналитик может исключить transition window или моделировать дозу, но правило выбирается до оценки post-gap.

3. Выберите outcome

Метрика должна быть стабильна по определению и доступна одинаково для treatment и donors. Изменение трекинга в treatment нарушает сопоставимость.

Лучше зрелый бизнес-outcome; ранний proxy используют только при калибровке.

Если outcome является ratio, отдельно проверьте числитель и знаменатель. Рост conversion rate может возникнуть из-за падения низкокачественного объёма, а не роста конверсий. Synthetic control для count с offset или несколько связанных outcomes иногда дают более понятный механизм. Primary metric остаётся одной, остальные служат диагностикой.

4. Определите единицу

Это может быть GEO, publisher, account или крупная кампания. Единицы должны иметь независимую интерпретацию и достаточную историю.

Слишком мелкие кампании с частыми паузами создают шумный donor pool.

5. Соберите donor pool

Исключите единицы с собственным вмешательством, spillover, другой продуктовой логикой или структурным разрывом. Правила исключения задают до post-period.

Большой пул не всегда лучше: нерелевантные доноры могут дать красивый случайный fit.

Donor eligibility проверяют по отрицательным и положительным критериям. Нужны похожий механизм outcome и независимость от treatment; одинаковый средний уровень не обязателен, потому что веса могут масштабировать комбинацию. Исключения по post-period результату запрещены: нельзя удалить донора только потому, что он делает эффект менее красивым.

6. Выберите pre-period

Период должен покрывать сезонность и стабильный режим, но не включать ранние эффекты вмешательства.

Если кампания недавно создана, данных для надёжного synthetic control может не хватить.

7. Предикторы и лаги outcome

Метод может подбирать веса по значениям outcome до вмешательства и устойчивым covariates. Признаки после начала treatment запрещены.

Слишком много гибкости повышает риск overfit pre-period.

Включайте предикторы, которые описывают исход и не затронуты вмешательством. Избыточное число случайных признаков позволяет слишком хорошо подогнать допериод, но ухудшить перенос в post-period. Набор и правила преобразования фиксируют до просмотра результата.

8. Оцените веса

Веса обычно ограничивают неотрицательностью и суммой, чтобы synthetic unit оставался интерпретируемой комбинацией доноров.

Покажите, какие единицы получили вес; контроль, состоящий почти из одного странного донора, требует внимания.

Покажите effective donor count и концентрацию весов. Если synthetic control на 95% состоит из одной единицы, анализ близок к парному сравнению и наследует её shocks. Регуляризация или ограничение веса могут улучшить устойчивость, но меняют estimand и должны проходить pre-period validation.

9. Проверяйте pre-fit

График и RMSPE показывают, насколько synthetic повторяет treatment до изменения. Хороший средний fit может скрывать систематический разрыв в нужном сезоне.

Если pre-fit плохой, post-gap нельзя убедительно приписывать вмешательству.

Кроме среднего RMSPE изучите график остатка во времени. Ошибки могут быть небольшими в среднем, но систематически расти перед вмешательством — это признак нестабильной связи. Отдельно проверьте, не держится ли fit на одном коротком участке при плохом совпадении остальной истории.

10. Проверьте стабильность

Обучите на первой части pre-period и проверьте на оставшейся до treatment. Это показывает переносимость весов без использования post data.

Модель, которая совпадает только на всём обучающем отрезке, может быть overfit.

11. Placebo по единицам

По очереди назначьте treatment каждому донору и постройте его synthetic control. Сравните post/pre discrepancy с реальным.

Если многие placebo дают такой же разрыв, эффект не выглядит исключительным.

Для справедливого placebo сравнивают относительное ухудшение post/pre fit, потому что единицы имеют разный pre-RMSPE. Placebo с очень плохим pre-fit исключают по заранее выбранному правилу. Распределение визуализируют полностью, не показывая только treatment и несколько удобных линий.

Примените ту же процедуру к каждому подходящему донору, временно считая его treated. Сравнение post/pre RMSPE показывает, насколько наблюдаемый разрыв необычен относительно единиц без известного воздействия. Доноры с крайне плохим pre-fit нельзя ставить в один ряд без оговорки.

12. Placebo по времени

Поставьте ложную дату внутри pre-period. Метод не должен регулярно находить эффект там, где вмешательства не было.

Это выявляет нестабильность и чувствительность к случайной точке.

13. Leave-one-out

Удаляйте по одному донору с большим весом и пересчитывайте. Если знак эффекта меняется от одного контроля, вывод хрупок.

Покажите диапазон, а не одну линию.

14. Spillover

Реклама в treatment GEO может влиять на соседние регионы, а изменение кампании — перераспределить аукцион среди donors. Тогда контроль заражён и gap занижен или искажён.

Карта путей воздействия важнее математического fit.

15. Anticipation

Пользователи или команда могут изменить поведение до официальной даты: prelaunch, обучение алгоритма, утечка креатива.

Сдвиньте границу или исключите transition window по заранее объяснённому правилу.

16. Другие одновременные события

Локальный праздник, outage, изменение платежей или конкурента может затронуть treatment уникально. Метод не умеет автоматически отделить их.

Событийный журнал обязателен для интерпретации.

Создайте event calendar из deploy, outages, изменений ставок, cap, платежей и крупных внешних событий. Для каждого отметьте, затронуты ли donors. Если уникальное событие совпало с treatment, synthetic control оценивает их совместный разрыв. Честный отчёт не присваивает весь gap одному изменению.

Synthetic control не устраняет неизвестные вмешательства, совпавшие по времени. Изменение учёта, политики источника, состава аудитории или доступности продукта может создать разрыв. Поэтому технический журнал и хронология бизнеса являются частью анализа, а не приложением после получения результата.

17. Масштаб и нормализация

Ряды могут отличаться объёмом. Используйте rate, per-capita или log только если преобразование соответствует вопросу.

После анализа переведите эффект обратно в понятные единицы и покажите исходный baseline.

18. Uncertainty

Классический synthetic control не всегда даёт простой стандартный интервал. Placebo distribution, conformal или другие процедуры выбирают заранее и проверяют симуляцией.

Не рисуйте узкую confidence band без обоснования.

Sensitivity analysis полезнее декоративной узкой полосы. Пересчитайте разные допустимые pre-period, donor rules, outcome transformations и leave-one-out. Если диапазон решений стабилен по знаку и бизнес-порогу, вывод сильнее. Если нет, итог формулируют как неопределённый и используют для планирования будущего holdout.

19. Multiple outcomes

Primary outcome выбирают до анализа. Дополнительные метрики проверяют механизм и guardrails, но не дают выбрать самую красивую.

Совпадающий паттерн по связанным outcomes усиливает интерпретацию, не превращая наблюдение в рандомизацию.

20. Экономическая интерпретация

Оцените cumulative incremental outcome, расходы на вмешательство, зрелость и диапазон. Не смешивайте attribution credit с causal gap.

Решение должно выдерживать консервативный сценарий, а не только точечную оценку.

Cumulative gap переводят в деньги только после проверки зрелости и расчётной базы. Затем вычитают стоимость вмешательства и добавляют sensitivity к неизвестным корректировкам. Если эффект существует только в первые дни и исчезает, отдельно обсуждают временный lift и устойчивый run-rate. Нельзя экстраполировать краткий post-period на год без механизма.

21. Воспроизводимость

Сохраните donor pool, exclusions, данные as-of, код, веса, дату, графики placebo и события. Изменение одной единицы создаёт новую версию анализа.

Рецензент должен получить тот же результат без ручного выбора линий.

Пакет анализа включает immutable input snapshot, код оптимизации, random seed при необходимости, версии библиотек и machine-readable weights. График без этих артефактов нельзя проверить. Отдельный reviewer повторяет fit и placebo до того, как бизнес увидит финансовую интерпретацию.

22. Вывод

Synthetic control лучше простого до/после, когда есть подходящие незатронутые доноры и устойчивый pre-fit. Но он остаётся наблюдательным: spillover, одновременные события и выбор пула могут изменить вывод.

Сильный отчёт показывает веса, pre-fit, placebo и sensitivity, а не только красивую контрфактическую линию.

Предпочитайте рандомизацию, когда она возможна

Synthetic control полезен после или вместо невозможного holdout, но заранее созданный рандомизированный контроль обычно требует меньше непроверяемых допущений для причинного вывода.

Станьте партнёром и начните работать

Перейдите в партнёрскую программу, изучите актуальные условия и выберите подходящий формат сотрудничества.

СТАТЬ ПАРТНЁРОМ

Связанные материалы

Все статьи
Аналитика

Бюджет первого теста: как рассчитать сумму, которой хватит для решения

Как рассчитать бюджет теста рекламы через частоту события, MDE, power, стоимость трафика, зрелость, технический этап, лимит потерь и оборотный капитал.

Аналитика

Витрина данных для арбитражной команды: схема от клика до выплаты

Как построить аналитическую витрину арбитража: grain, факты, измерения, click ID, статусы, валюты, ревизии, late events, тесты и воспроизводимые отчёты.

Аналитика

Statistical power и MDE: как планировать тест конверсии до запуска

Подробный разбор statistical power, MDE и размера выборки для конверсии: baseline, alpha, beta, абсолютный эффект, кластеры, лаг и симуляция дизайна.