생성형 인공지능(AI) 에이전트가 실제 업무 환경에서 지속적으로 유용하려면 단순히 주어진 과제를 성공적으로 완료하는 것 이상이 필요하다는 연구 결과가 발표되었습니다. 아카이브(arXiv)에 게재된 논문은 AI 에이전트의 '운영 회복 탄력성(operational resilience)'과 '배려 깊은 참여(considerate participation)'라는 두 가지 보완적인 평가 기준을 제시하며, 기술적, 인적, 운영상의 어려움이 누적될 때 에이전트의 성능 변화를 분석했습니다.
연구팀은 120개의 시뮬레이션된 헬스케어 시나리오에서 두 가지 생성형 AI 모델과 12가지 이해관계자 중심 과제를 활용하여 에이전트의 행동을 관찰했습니다. 가벼움, 보통, 심각함의 세 가지 난이도에서 도전 과제가 누적될수록 에이전트의 행동과 내부 평가가 어떻게 변하는지 분석한 결과, 운영 회복 탄력성 측면에서 에이전트는 자율적인 복구에서 인간 의존도가 높아지는 경향을 보였습니다. 또한, 작업량과 부정적인 감정을 보고했지만, 텍스트 응답에서는 이러한 어려움을 거의 표현하지 않았습니다. 배려 깊은 참여 측면에서는 에이전트가 과제 중심의 적응을 넘어 과제 재구성, 타인에 대한 관심, 역할 경계 조정, 그리고 더 넓은 협업으로 확장되는 패턴을 보였습니다.
이러한 연구 결과는 AI 에이전트의 실제 배포 시 고려해야 할 다섯 가지 딜레마를 도출했습니다. 이는 지속성, 주의력, 역할 경계, 상태 공개, 그리고 에스컬레이션(문제 발생 시 상위 보고)과 관련된 것으로, 이해관계자의 명확한 지침이 필요함을 시사합니다. 이번 연구는 AI 에이전트가 단순히 작업을 수행하는 도구를 넘어, 변화무쌍한 실제 환경에서 사람과 효과적으로 협력하며 문제를 해결하는 '동료'로서 기능하기 위한 중요한 평가 프레임워크를 제공합니다. 이는 향후 AI 에이전트 학습, 상황별 평가, 그리고 체화된 적응(embodied adaptation) 기술 발전에 중요한 함의를 가집니다.
