최근 한 개발자가 자신이 만든 코드 채점기의 오류를 대규모 언어모델(LLM) 기반 AI 채점관 '소네트(Sonnet)'를 통해 발견한 흥미로운 사례를 공유했습니다. 이는 기존의 규칙 기반 평가 시스템이 가진 한계를 AI가 보완하고, 나아가 시스템 자체의 신뢰도를 높일 수 있음을 시사합니다.
개발자는 주문 처리 AI를 검증하기 위해 29개의 테스트 문제와 자체 제작한 코드 채점기를 사용해왔습니다. 하지만 이 채점기는 미리 설정된 규칙만을 검사하기 때문에, 만약 규칙 자체가 잘못되었거나 누락된 부분이 있다면 이를 잡아내지 못하는 구조였습니다. 이에 개발자는 동일한 29개의 답안을 LLM 기반 AI 채점관에게도 평가하도록 하여, 두 채점 결과를 비교했습니다. 그 결과 27개 답안에서는 판정이 일치했지만, 나머지 2개 답안에서 의견이 갈렸습니다. 면밀히 분석해보니, AI 채점관의 판단이 옳았고 기존 코드 채점기에 오류가 있었음이 밝혀졌습니다. 구체적으로 코드 채점기는 질문에 대한 핵심 답변을 놓치거나, 답안지 정해진 칸 밖에 적힌 중요한 메모를 읽지 못하는 등의 실수를 저질렀습니다.
이러한 발견은 AI가 단순히 정해진 기준에 따라 답을 매기는 것을 넘어, 인간이 설계한 평가 시스템의 맹점을 찾아내고 개선하는 데 기여할 수 있음을 보여줍니다. 특히 규칙 기반 시스템이 놓칠 수 있는 맥락적 이해나 비정형 데이터 처리 능력에서 LLM의 강점이 두드러졌습니다. 이는 교육, 소프트웨어 개발, 품질 관리 등 다양한 분야에서 평가와 검증의 패러다임을 변화시킬 잠재력을 가집니다. 앞으로 AI는 인간의 실수를 보완하고, 더 공정하고 정확한 평가를 가능하게 하는 중요한 도구가 될 것으로 기대됩니다.