인공지능(AI) 시스템이 점점 더 복잡하고 중요한 의사결정 환경에 배치되면서, AI가 인지하는 위험을 어떻게 행동으로 옮기는지에 대한 이해가 중요해지고 있습니다. 최근 아카이브(arXiv)에 발표된 논문에 따르면, 대규모 언어모델(LLM)이 불확실한 상황에서 체계적이고 일관된 위험 태도를 보이는 것으로 확인되었습니다. 이는 AI의 의사결정 방식에 대한 새로운 통찰을 제공하며, 향후 AI 시스템의 신뢰성과 안전성을 높이는 데 기여할 수 있습니다.
연구팀은 컨텍스트별 위험 신념과 최종 의사결정을 분리하는 교차 도메인 프레임워크를 도입했습니다. 이를 통해 6개의 대표적인 LLM과 100명의 인간 참가자를 대상으로 공간 탐색, 임상 분류, 재무 할당 등 세 가지 유형의 작업을 수행하게 했습니다. 회귀 모델을 사용하여 각 에이전트의 신념-의사결정 매핑을 분석한 결과, 대부분의 LLM은 특정 작업 내에서 컨텍스트 신념과 위험 결정 간의 안정적인 매핑을 보여주는 '작업 내 일관성'을 보였습니다. 또한, 다양한 작업 전반에 걸쳐 상대적인 위험 태도를 유지하는 '교차 도메인 순위 안정성'도 나타냈습니다. 흥미롭게도 LLM의 위험 태도 분포는 인간의 광범위한 분포에 비해 제한된 범위로 수렴하는 경향을 보였습니다.
이러한 결과는 위험 태도가 LLM 행동의 안정적이고 이전에 특성화되지 않은 차원임을 시사합니다. 이는 개방형 의사결정 환경에서 AI 시스템을 평가하고 인간의 가치와 일치시키는 데 중요한 기반을 마련합니다. LLM이 예측 가능한 위험 태도를 보인다는 것은, 특정 위험 수준을 가진 AI를 설계하고 배포할 수 있음을 의미하며, 이는 자율주행, 의료 진단, 금융 투자 등 고위험 분야에서 AI의 책임감 있는 활용을 위한 필수적인 요소입니다. 앞으로 이러한 내재된 행동 성향의 기원에 대한 추가 연구가 필요하며, 이를 통해 더욱 안전하고 신뢰할 수 있는 AI 시스템 개발이 가속화될 것으로 기대됩니다.