블릭 비디오 언더스탠딩(Blyck Video Understanding)이 인공지능(AI) 에이전트가 영상을 더욱 깊이 있고 정확하게 이해할 수 있도록 돕는 새로운 MCP(Multi-modal Control Plane) 서버를 선보였습니다. 이 도구는 클로드 데스크톱(Claude Desktop), 클로드 코드(Claude Code), 코덱스(Codex), 챗GPT 데스크톱(ChatGPT Desktop) 등 다양한 AI 에이전트에 연결되어 유튜브(YouTube) 링크나 사용자가 직접 업로드한 영상 파일을 분석합니다. 분석된 결과는 시간순 타임라인 형태로 계정에 저장되며, AI 에이전트는 이 기록을 활용해 영상 요약, 특정 장면 찾기, 질문 답변, 프레임/클립 확인 등의 작업을 수행할 수 있습니다.
기존의 영상 분석 방식은 긴 영상의 경우 중요한 중간 내용이 누락되거나, AI가 제시한 답변의 시각적 근거를 직접 확인하기 어려웠다는 한계가 있었습니다. 블릭은 이러한 문제를 해결하기 위해 영상을 15초 단위로 나누고, 각 구간마다 초당 2프레임을 추출하여 구글 제미니(Google Gemini)에 개별적으로 분석하도록 합니다. 이 방식은 긴 영상에서도 중간 내용이 건너뛰어지지 않도록 보장하며, 각 구간의 장면, 행동, 음성, 화면 글자를 시각 정보와 함께 상세히 기록합니다. 특히 음성과 화면 글자는 번역이나 요약 없이 원문 그대로 받아 적어 정확성을 높였습니다. 분석 완료 여부도 영상 길이의 98% 이상이 커버되고 빈 구간이 2초 이하여야 '사용 가능(usable)'으로 표시하는 등 엄격하게 관리합니다.
이러한 정밀한 분석 덕분에 사용자는 '제품 가격을 말하는 부분'처럼 자연어로 질문하면 해당 시각을 정확히 찾아 유튜브 링크로 바로 이동하거나, 업로드 영상의 특정 프레임을 캡처하고 15초 이내의 클립으로 추출할 수 있습니다. 또한, 여러 영상에서 같은 주제를 한 번에 검색하는 기능도 제공하여 정보 탐색 효율을 극대화합니다. AI 에이전트는 저장된 기록을 시각과 함께 인용하여 답변하며, 관련 정보가 없을 경우 지어내지 않고 '찾지 못함'으로 응답하여 신뢰성을 확보합니다. 이는 AI가 단순한 텍스트 요약을 넘어, 영상 콘텐츠를 시각적 맥락과 함께 이해하고 활용하는 새로운 가능성을 열어주는 중요한 발전입니다.