최근 가상의 재생에너지 기업 시나비스(Sinabis)가 1천만 건이 넘는 합성 기업 이메일과 140만 건의 캘린더 파일을 29개 언어로 허깅페이스(Hugging Face)에 공개했습니다. 이 방대한 데이터셋은 실제 기업의 일상적인 업무 환경을 모방하여, 인공지능(AI) 모델 학습에 필요한 고품질의 현실적인 데이터를 제공합니다. 특히 개인 정보 침해 우려 없이 다양한 비즈니스 시나리오를 학습시킬 수 있다는 점에서 큰 의미를 가집니다.
'시나비스 그린 에너지(Sinabis Green Energy)'라는 이름의 이 데이터셋은 2015년 12월부터 2026년 7월까지 10년 반 동안의 가상 기업 활동을 담고 있습니다. 총 1,008만 8,914건의 이메일과 142만 492건의 캘린더 파일(.ics)로 구성되어 있으며, PDF, DOCX, XLSX, PNG 등 220만 개 이상의 실제 첨부 파일도 포함하고 있습니다. 영어(87.4%)와 스페인어(8.8%)가 대부분을 차지하지만, 일본어, 중국어 등 27개 언어가 고루 분포되어 있어 다국어 AI 모델 개발에 유용합니다. 데이터는 대규모 언어모델(LLM)이 콘텐츠를 생성하고, '메일젠(mailgen)'이라는 자체 생성기가 구조를 만들어 실제와 같은 이메일 흐름을 구현했습니다. 7,850명의 가상 직원과 9,663명의 외부 연락처, 832개의 가상 조직이 등장하며, 코로나19 팬데믹 관련 이메일도 58만 건 이상 포함되어 현실감을 더합니다.
이러한 합성 데이터셋의 출시는 AI 개발 분야에 중요한 함의를 가집니다. 실제 기업 데이터는 민감한 정보와 개인 정보 보호 문제로 인해 AI 학습에 활용하기 어렵지만, 시나비스의 데이터셋은 이러한 제약을 해결합니다. 텍스트 생성, 분류, 요약, 정보 추출 등 다양한 자연어 처리(NLP) 작업에 활용될 수 있으며, 특히 기업 환경에 특화된 AI 비서, 고객 서비스 챗봇, 내부 커뮤니케이션 분석 도구 개발에 큰 도움이 될 것입니다. 또한, 특정 산업(재생에너지)의 전문 용어와 비즈니스 프로세스를 학습시켜 도메인 특화 AI 모델의 성능을 향상시키는 데 기여할 것으로 기대됩니다.