AI 에이전트가 웹에서 정보를 수집하는 과정에서 발생하는 높은 비용과 환각(hallucination) 문제를 해결할 새로운 기술이 공개되었습니다. '레이아웃 메모이제이션(Layout Memoization)'이라는 이 접근 방식은 웹 페이지의 구조(레이아웃)를 기억하여, 매번 전체 HTML을 대규모 언어모델(LLM)의 컨텍스트 창에 넣는 대신 필요한 정보만 효율적으로 추출합니다. 이는 기존 방식 대비 10분의 1 수준으로 비용을 절감할 수 있다고 합니다.
기존 AI 웹 스크래핑은 주로 RAG(검색 증강 생성)나 긴 컨텍스트 LLM을 활용했습니다. 하지만 이 방식은 동적인 웹 페이지가 대다수인 환경에서 페이지당 비용이 선형적으로 증가하고, LLM의 한계로 인해 불필요한 정보(컨텍스트 오염)와 환각 현상이 발생할 수 있다는 단점이 있었습니다. 레이아웃 메모이제이션은 이러한 문제를 해결하기 위해 '지속 학습 브라우저 하네스(continual learning browser harness)'를 개발했습니다. 이는 브라우저 인스턴스를 실행하고 프록시를 설정한 후, 웹에서 구조화되거나 표 형식의 데이터를 추출합니다. 특히, 레이아웃이 한번 메모리에 저장되면 이후 데이터 추출 비용은 벡터 검색(vector search) 수준으로 낮아져 대규모 데이터셋 처리 시 비용 효율성이 극대화됩니다.
이 기술은 정보 수집(OSINT/SIGINT) 분야뿐만 아니라, 일반 기업의 시장 조사, 경쟁사 분석, 데이터 기반 의사결정 등 다양한 영역에서 AI 에이전트의 활용도를 높일 잠재력이 있습니다. 비용 절감과 정확도 향상은 AI 에이전트가 더 넓은 범위의 웹 데이터를 실시간으로 분석하고 활용할 수 있게 하여, 새로운 비즈니스 기회를 창출할 수 있습니다. 특히, 데이터 추출의 정확성을 높여 LLM의 환각 문제를 줄이는 것은 AI 시스템의 신뢰도를 향상시키는 데 크게 기여할 것입니다.
