대규모 텍스트 데이터에서 단어와 문서 간의 숨겨진 구조를 발견하는 데 스펙트럼 공동 클러스터링(Spectral Co-Clustering)은 강력한 도구로 활용됩니다. 그러나 이 기법은 핵심 과정에서 SVD(Singular Value Decomposition, 특이값 분해)에 크게 의존하는데, 데이터 차원이 높아질수록 SVD 계산 비용이 기하급수적으로 증가하여 실제 적용에 어려움이 있었습니다. 최근 Fateme Mazdarani와 Carlos Toxtli 연구팀은 이러한 고차원 데이터 문제를 해결하기 위한 두 가지 새로운 무작위 SVD 근사 방법을 제안했습니다.
연구팀은 문서 및 단어 클러스터의 수가 다를 수 있는 이분 그래프(bipartite graph) 형태의 텍스트 데이터에 적용할 수 있는 정규화된 스펙트럼 공동 클러스터링을 위한 근사법을 개발했습니다. 첫 번째 방법은 무작위 투영(random projection)을 통해 무작위 SVD를 활용하며, 두 번째 방법은 부분 SVD(partial SVD)와 요소별 무작위 샘플링(element-wise random sampling)을 결합합니다. 실제 데이터셋과 합성 데이터셋 모두에서 두 방법은 전체 SVD를 사용하는 기존 방식 대비 실행 시간을 단축하는 효과를 보였습니다. 특히, 무작위 투영 방식은 테스트된 환경 전반에서 더 안정적인 근사 성능을 보였고, 샘플링 기반 방식은 데이터 밀도가 높은(dense) 행렬에서 가장 유용하며, 이미 희소한(sparse) 텍스트 데이터에서는 이점이 제한적이었습니다.
이러한 결과는 스펙트럼 공동 클러스터링을 위한 무작위 근사법을 선택할 때 기반 데이터의 구조적 특성(예: 희소성 또는 밀도)을 고려해야 함을 시사합니다. 이는 대규모 텍스트 데이터 분석의 효율성을 크게 향상시킬 수 있는 중요한 진전이며, 자연어 처리(NLP), 정보 검색, 추천 시스템 등 다양한 분야에서 더 빠르고 경제적인 분석을 가능하게 할 것입니다. 연구팀의 방법론은 2026년 IEEE 국제 머신러닝 및 응용 컨퍼런스(ICMLA)에 채택되어 그 가치를 인정받았습니다.
