천문학 분야에서 특정 망원경을 활용하거나 언급한 과학 논문을 식별하고 분류하는 작업은 천문대의 과학적 영향력을 평가하고 연구 재현성을 보장하는 데 매우 중요합니다. 하지만 이 과정은 대부분 수동으로 이루어져 막대한 시간과 인적 자원을 필요로 하는 비효율적인 작업으로 남아있었습니다.
최근 마두수다나 나이두(Madhusudhana Naidu) 연구원은 SciBERT 기반의 효율적인 접근 방식을 통해 이 문제를 해결할 가능성을 제시했습니다. WASP-2025 공유 태스크에서 이 모델은 과학(science), 장비(instrumentation), 언급(mention), 비망원경(not telescope)의 네 가지 범주로 과학 논문을 자동 분류하는 데 성공했습니다. 특히, 512 토큰(token)이라는 엄격한 문맥 길이 제약과 제한된 컴퓨팅 자원에도 불구하고 0.89의 매크로 F1 점수를 달성하며 WASP-2025 리더보드에서 1위를 차지했습니다. 이는 SciBERT가 과학 분야 텍스트에 특화된 언어 모델(domain-aligned language model)이기에 가능한 결과로, 입력 텍스트의 절반 이상이 토큰 제한을 초과했음에도 불구하고 강력한 분류 성능을 보였습니다.
이 연구는 방대한 과학 문헌을 효율적으로 관리하고 큐레이션(curation)하는 데 있어 인공지능(AI)의 잠재력을 명확히 보여줍니다. 수동 작업에 의존하던 기존 방식을 자동화함으로써 연구자들은 논문 분류에 드는 시간을 절약하고, 더 중요한 연구 활동에 집중할 수 있게 될 것입니다. 또한, 문헌 관리의 정확성과 일관성을 높여 천문학 연구의 질적 향상에도 기여할 수 있습니다. 이러한 AI 기반의 자동화는 과학 커뮤니티 전반에 걸쳐 정보 접근성을 개선하고, 새로운 연구 동향을 빠르게 파악하는 데 도움을 줄 것으로 기대됩니다.