오픈소스 프로젝트 '모델십(Modelship)'이 레이 서브(Ray Serve)를 기반으로 하는 AI 모델 클러스터를 선보이며, 개발자들이 자체 서버에서 대규모 언어모델(LLM)을 포함한 다양한 AI 모델을 효율적으로 배포하고 관리할 수 있는 솔루션을 제공합니다. 이 프로젝트는 여러 AI 모델을 하나의 GPU에서 구동하고, OpenAI API와 호환되는 추론(inference) API를 제공하여 에이전트(agent) 기반 AI 애플리케이션 개발을 간소화하는 데 초점을 맞추고 있습니다.
모델십은 vLLM, Llama.cpp, Diffusers, Sherpa_ONNX 등 다양한 로더(loader)를 통해 LLM뿐만 아니라 임베딩(embeddings), 음성(speech), 이미지(image) 모델까지 지원합니다. 특히, OpenAI의 응답 API(Responses API)와 완벽하게 호환되는 인터페이스를 제공하여, 개발자들이 기존 OpenAI API를 사용하던 에이전트 코드를 거의 수정 없이 자체 모델십 클러스터로 전환할 수 있습니다. 또한, 서버 측 대화 상태(conversation state)와 툴 호출(tool calling) 기능을 지원하여 복잡한 에이전트 워크플로우를 안정적으로 처리할 수 있습니다. 모델십은 무중단 모델 전환, 로드 기반 자동 확장, 엔진 충돌 복구, GPU 부분 할당 멀티테넌시 등 14가지 클러스터 안정성 기능을 보장합니다.
이러한 모델십의 등장은 AI 모델 배포 및 관리에 대한 접근성을 크게 높여줄 것으로 기대됩니다. 특히, OpenAI와 같은 외부 API에 의존하지 않고 자체 인프라에서 AI 모델을 운영하려는 기업이나 개발자들에게 강력한 대안이 될 수 있습니다. 비용 절감은 물론, 데이터 주권(data sovereignty)과 보안을 강화할 수 있으며, 특정 사용 사례에 최적화된 모델을 유연하게 배포할 수 있는 환경을 제공합니다. 이는 AI 기술의 민주화와 함께, AI 에이전트 개발 생태계의 확장에 기여할 잠재력을 가지고 있습니다.