최근 발표된 연구에 따르면, 질량 분석/질량 분석(MS/MS) 스펙트럼 데이터를 활용해 분자 지문(molecular fingerprint)을 예측하는 과정에서, 기존 딥러닝(deep learning) 모델보다 '최근접 이웃(nearest-neighbour)' 검색 방식이 더 강력한 기준선(baseline)을 제공하며 심지어 성능을 능가하는 것으로 나타났습니다. 이는 복잡한 딥러닝 모델 대신 상대적으로 간단한 검색 기반 접근법이 특정 화학 정보학(chemoinformatics) 문제에서 뛰어난 효율성을 보일 수 있음을 시사합니다.
링 민 세레나 쿠(Ling Min Serena Khoo) 외 연구진이 2026년 9월 30일 arXiv에 제출한 이 논문은 최근접 이웃 방식이 추론(inference) 시 어떤 정보를 활용하는지에 따라 다양한 변형이 존재함을 강조합니다. 연구팀은 이러한 변형들이 분자 지문 예측 성능에 어떻게 영향을 미치는지 체계적으로 비교 분석했습니다. 목표는 이 분야의 연구 진행 상황을 보다 정확하게 측정하고 평가할 수 있는 엄격한 벤치마크 기준을 확립하는 것입니다. 예를 들어, 특정 분자 스펙트럼과 가장 유사한 기존 데이터베이스 내 분자를 찾아 그 분자의 지문을 예측하는 방식으로, 사용 가능한 데이터의 양과 질이 결과에 큰 영향을 미칩니다.
이러한 연구 결과는 신약 개발이나 신소재 탐색과 같이 분자 구조 예측이 필수적인 분야에 중요한 함의를 가집니다. 복잡하고 막대한 컴퓨팅 자원을 요구하는 딥러닝 모델 대신, 효율적인 최근접 이웃 기반 접근법이 더 빠르고 경제적인 대안이 될 수 있기 때문입니다. 이는 연구자들이 분자 예측 모델의 성능을 평가하고 개선하는 데 있어 새로운 관점을 제시하며, 궁극적으로는 화학 및 생명 과학 분야의 혁신을 가속화하는 데 기여할 것으로 보입니다.