yozm.tech
피드로 돌아가기
news.hada.ioHOTAI 재작성

StreamHub 확장: 하루 1,450억 이벤트 처리를 위해 Kinesis에서 Kafka로 전환

애틀라시안(Atlassian)의 스트림허브(StreamHub)가 하루 220억 건에서 1,500억 건 이상의 이벤트를 처리하는 규모로 성장하면서, 기존 아마존 키네시스(Amazon Kinesis)의 한계를 넘어 AWS MSK 기반 아파치 카프카(Apache Kafka)로 전환했습니다. 장기 보관 비용 절감, 소비자 확장성, 멀티클라우드 지원을 목표로 했으나, 대규모 트래픽에서 매니지드 서비스의 새로운 운영 과제에 직면했습니다.

7시간 전·2026.08.10·읽기 1·neo https://news.hada.io/user/neo

애틀라시안의 실시간 데이터 플랫폼 스트림허브(StreamHub)가 하루 220억 건에서 1,500억 건 이상의 이벤트를 처리하는 거대 시스템으로 성장하면서, 데이터 처리 아키텍처에 대대적인 변화를 줬습니다. 기존에 사용하던 아마존 키네시스(Amazon Kinesis)가 하루 200~300억 건 규모까지는 잘 작동했지만, 약 5배에 달하는 트래픽 증가를 앞두고 장기 보관 비용 효율성, 소비자 확장성, 멀티클라우드 지원을 위해 AWS MSK(Managed Streaming for Apache Kafka) 기반의 아파치 카프카(Apache Kafka)로 전환했습니다.

카프카 전환의 핵심은 티어드 스토리지(Tiered Storage) 도입이었습니다. 이는 실시간 데이터는 브로커(broker)의 로컬 디스크에 저장하고, 오래된 데이터는 아마존 S3로 비동기 복사하여 보관하는 방식입니다. 이를 통해 고성능 EBS에 데이터를 장기간 보관하는 비용을 크게 줄이고, 대규모 과거 데이터 조회가 실시간 소비자(consumer)의 IOPS(초당 입출력 연산)를 잠식하는 문제를 분리할 수 있었습니다. 하지만 하루 1,500억 건 규모의 트래픽에서는 매니지드 카프카도 무한히 확장되지 않았으며, 브로커 네트워크와 EBS의 한계, S3 요청 폭증, 티어드 스토리지 오프로드(offload) 지연, 스토리지 확장 쿨다운(cooldown), 가용 영역(AZ) 장애 시 컨트롤 플레인(control plane) 의존성 등 예상치 못한 운영 문제가 발생했습니다.

애틀라시안은 이러한 장애를 겪은 후 시스템 운영 전략을 재정비했습니다. 클러스터 평균 사용률 대신 가장 트래픽이 많은 브로커를 기준으로 용량을 계획하고, 네트워크와 로컬 디스크를 의도적으로 여유 있게 확보하는 '과잉 프로비저닝(over-provisioning)'을 도입했습니다. 또한, 레이트 리밋(rate limit), 카프카 쿼터(quota), 격리(quarantine) 기능을 활용해 특정 워크로드(workload)가 전체 클러스터를 마비시키지 않도록 방지했습니다. 대형 클러스터를 여러 샤드(shard)로 나누고 별도의 장애 조치(failover) 클러스터와 규정 준수(compliance)를 위한 보조 리전(companion region)을 마련하여, 매니지드 서비스의 컨트롤 플레인 자체에 의존하지 않고도 복구할 수 있는 경로를 구축했습니다. 이는 매니지드 서비스가 제공하는 편리함에도 불구하고, 대규모 미션 크리티컬 시스템에서는 여전히 세심한 설계와 운영 전략이 필요함을 보여주는 사례입니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

일반적인 대기업의 인프라 전환 사례로, 1인 창업자가 직접적인 제품/서비스 기회를 찾기 어렵습니다. 컨설팅 기회는 있으나 진입 장벽이 높습니다.

문제 / 미충족 수요

대규모 실시간 데이터 스트리밍 환경에서 매니지드 서비스의 한계와 복잡한 운영 최적화 요구사항이 존재합니다.

한국 시장
국내 있음한국에서도 대규모 데이터 스트리밍을 사용하는 기업들이 많아 유사한 운영 및 비용 최적화 니즈가 존재할 수 있습니다.
수익 모델

B2B 컨설팅, 매니지드 서비스 최적화 솔루션 · 돈 내는 주체: 대규모 데이터 스트리밍 인프라를 운영하는 기업의 CTO, 개발팀 리더, 인프라 운영팀

1인 실현 가능성
2/5

대규모 분산 시스템 운영은 복잡하며, 매니지드 서비스 최적화는 깊은 전문 지식과 경험을 요구하므로 1인이 시작하기에는 진입 장벽이 높습니다.

진입 지점 (Wedge)

특정 산업군 또는 특정 데이터 스트리밍 기술(예: 카프카 티어드 스토리지)에 특화된 운영 최적화 및 비용 절감 컨설팅 서비스

이번 주 첫 실험

대규모 카프카 운영 경험이 있는 기업의 담당자를 대상으로 인터뷰하여 현재 겪고 있는 가장 큰 운영 및 비용 문제를 파악한다.

Original source
이 글은 news.hada.io의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기