최근 발표된 연구에 따르면, 기업들이 흔히 사용하는 고정된 A/B 테스트(A/B test) 데이터를 활용하여 개인화된 적응형 실험(adaptive experiment)이 과연 더 좋은 결과를 가져올지 미리 평가할 수 있는 실용적인 방법론이 제시되었습니다. 이는 기존 데이터만으로도 문맥형 밴딧(contextual bandit)과 같은 고급 실험 기법의 잠재력을 가늠하고, 어떤 조건에서 적응형 실험이 유효한지 판단하는 데 도움을 줍니다.
이 연구는 오프라인 정책 평가(Offline Policy Evaluation, OPE)와 통제된 웜 스타트(warm-start) 시뮬레이션을 결합한 접근 방식을 제안합니다. 이 방법은 이질적인 처리 효과(heterogeneous treatment effects)를 보이는 A/B 테스트 로그 데이터에서 핵심 구성 요소를 추정하고, 이를 바탕으로 다양한 적응형 및 비적응형 정책들의 성능을 평가합니다. 특히, 지상 진실(ground truth)이 알려진 시뮬레이션 환경에서 오프라인으로 훈련된 정책들을 재배포하여, 웜 스타트 조건에서 오프라인 학습이 온라인 환경으로 어떻게 전환되는지 안전하게 연구할 수 있게 합니다.
합성 데이터와 실제 벤치마크 데이터(Hillstrom, Criteo Uplift, LaLonde)를 활용한 실험 결과, 의미 있는 이질성이 존재할 때 적응형, 문맥 인지 정책(context-aware policies)이 고정된 할당 방식보다 성능을 개선하는 것으로 나타났습니다. 반면, 이질성이 거의 없을 때는 큰 이점이 없었습니다. 이는 적응형 실험 도입 여부를 결정하고, 여러 경쟁 정책 중 최적의 정책을 선택하는 데 있어 기존 A/B 테스트 데이터를 활용한 실용적인 의사결정 도구를 제공한다는 점에서 큰 의미가 있습니다. 기업들은 이 방법론을 통해 불필요한 위험 없이 개인화된 마케팅이나 제품 추천 시스템 도입의 효과를 미리 예측하고 최적화할 수 있을 것입니다.
