고병렬 데이터 스트림을 위한 분산 메시지 큐 시스템의 확장성 분석

Scalability Analysis of Distributed Messaging Queuing Systems for Highly Parallel Data Streams
  • 백승연
  • 이우경
  • 최원석
  • 이하얀
  • 신승민
  • ... 이은지

초록

최근 빅데이터 기반 서비스의 증가는 다수의 프로세스가 고용량의 데이터를 송수신하면서 협력하는 실행 구조의확산을 가져왔다. 프로세스 간 데이터를 비동기적으로 송수신하도록 도와주는 분산 메시지 큐 시스템은 상기 실행 환경에서 중요한 역할을 수행한다. 양 프로세스 간 동기적 데이터 송수신은 동기화 과정에서 상당한 비효율성을 지니기 때문에 데이터를 생산/소비하는 프로세스와 별개로 데이터를 풀링(Pooling)해주고, 상시로 데이터를 소비할수 있도록 해주기 때문에 데이터 공유가 용이해 지기 때문이다. 대표적인 분산 메시지 큐 시스템인 Apache Kafka는 단일 토픽(Topic)에 대해 유입되는 메시지를 다수의 파티션으로 분산하여 저장할 수 있도록 한다. 파티션은 데이터를 저장하는독립적인 플로우(Flow)에 대한 추상화 이상적으로는 그 수가 증가하면 메시지 큐의 처리량도 선형적으로 증가해야 한다. 본 논문에서는 파티션에 의존하는 현재의 Kafka 확장성(Scalability) 보장 방식이 실효성을 지니는지 다양한 실험을 통해 관찰한다. 실험 결과 파티션의 증가가 처리량을 개선시키는 데에 효과는 있으나 자원이 충분함에도 불구하고 선형적인 증가는 이끌어내지 못하는 것을 관찰하였다. 이것은 파티션이라는 독립적인 데이터 스트림을 나타내는 추상적 개념을구현할 때 그 독립성을 충분히 확보하지 못하는 것으로 판단된다. 향후 본 논문에서 분석한 실험 결과를 바탕으로 파티션을 통한 고병렬성 데이터 스트림 지원을 방해하는 요소를 구체적으로 분석하고 이를 개선하는 방안을 제안하고자 한다.

키워드

Cloud ComputingData StreamingDistributed Message QueuingData Systems
제목
고병렬 데이터 스트림을 위한 분산 메시지 큐 시스템의 확장성 분석
제목 (타언어)
Scalability Analysis of Distributed Messaging Queuing Systems for Highly Parallel Data Streams
저자
백승연이우경최원석이하얀신승민이은지
DOI
10.7236/JIIBC.2024.24.6.15
발행일
2024-12
저널명
한국인터넷방송통신학회 논문지
24
6
페이지
15 ~ 20