새로운 인공지능 모델인 '비전라야(VisionLaya)'가 공개되어 이미지와 선택적 텍스트 입력을 바탕으로 보정된(calibrated) 결정을 내릴 수 있게 되었습니다. 이 모델은 복잡한 텍스트 생성 과정 없이도 객관식(choice), 점수(score), 그리고 예/아니오 확률(noul) 질문에 대해 단 한 번의 순방향(forward pass) 연산으로 답변을 제공하는 것이 특징입니다. 이는 기존 라야(Laya) 모델의 텍스트 인코더를 스몰VLM-256M-인스트럭트(SmolVLM-256M-Instruct)로 대체하여 이미지 입력 기능을 추가함으로써 구현되었습니다.
비전라야는 허깅페이스(Hugging Face)에 공개된 'thaitea/laya-vision-smolvlm-256m' 모델로, 이미지와 텍스트를 동시에 처리하는 멀티모달(multimodal) 능력을 갖추고 있습니다. 예를 들어, 고객이 파손된 상품 사진과 함께 '상품이 파손된 것 같다'는 메모를 남기면, 모델은 해당 상품의 파손 여부와 카테고리를 즉시 판단하여 확률과 함께 제시할 수 있습니다. A-OKVQA, ScienceQA, VQAv2 등 다양한 시각 질의응답(VQA) 데이터셋에서 평균 75.2%의 정확도를 보였으며, 특히 보정된 결과의 오류율(ECE)이 크게 낮아 신뢰할 수 있는 답변을 제공합니다. 엔비디아 L4(NVIDIA L4) GPU 환경에서 이미지 한 장에 대한 질문 처리 지연 시간(latency)이 약 71밀리초(ms)에 불과할 정도로 빠른 속도를 자랑합니다.
이 모델은 텍스트 생성 없이 직접적인 결정을 내린다는 점에서 기존 대규모 언어모델(LLM) 기반의 시각 질의응답 시스템과 차별화됩니다. 이는 불필요한 텍스트 생성으로 인한 지연 시간을 줄이고, 답변의 일관성과 정확도를 높이는 데 기여합니다. 특히, 보정된 확률(calibrated probability)을 제공함으로써 모델의 불확실성을 사용자가 더 잘 이해하고 판단할 수 있도록 돕습니다. 비전라야는 고객 서비스 자동화, 품질 검사, 콘텐츠 분류 등 이미지 기반의 빠른 의사 결정이 필요한 다양한 산업 분야에서 효율성을 크게 향상시킬 잠재력을 가지고 있습니다.