StreamSphere

StreamSphere(스트림스피어)는 데이터 수집만을 위한 기존 Stream과 달리, ShardSphere와 연계되어 고성능 처리 및 데이터 정제가 가능

StreamSphere란?
  • 수많은 IoT 장치와 인터넷 사용자는 엄청난 양의 연속적인 실시간 데이터를 생성
  • 이는 실시간 ETL(데이터 추출(Extraction), 변환(Transformation),적재(Loading)) 하여 고성능의 데이터 처리가 필요.
  • 동적 데이터 발생에 대해 요약 및 집계를 수집하여 시간별, 기능별 분석할 수 있는 데이터 추출 및 텍스트 검색 필터링, 알람 필터링 등에 사용 할 수 있음
StreamSphere
  1. 운영통합
    • 기존 제품군들은 따로 구축이 되어 있는 경우가 많음 (예: kafca + 시계열 + RDB …등)
    • StreamSphere는 하나의 제품으로 필요에 따라 Static data와 Stream Data를 동시에 접근 및 처리 가능

       

  2. 손쉬운 접근
    • 표준 SQL을 사용
    • 이해하기 쉬운 Stream용 DDL 제공
    • Continuous aggregation query 제공
    • Top-k, hyperloglog, t-digest등의 확률적 알고리즘 함수 제공
    • Restful API를 사용하여 호환이 용이함
StreamSphere 스트리밍 SQL
  • 표준 SQL 을 사용
  • continuous aggregation query 제공
  • Top-k, hyperloglog, t-digest 등의 확률적 알고리즘 함수 제공
SQL
StreamSphere 테스트

기상 데이터 테스트 사례

  • RDB 대신 StreamSphere으로 대체하여 내부 테스트를 진행, 실시간 결과 확인 사례
  • 기존 Query는 테이블의 데이터양에 비례해서 성능이 낮아지고, 리소스(Memory Temp) 사용량이 많아짐
  • CISPHERE Continuous Query는 데이터 증가에 대해 리소스 사용량 증가나 성능저하가 없음
  • 기존 Query는 RDBMS의 특성상 중간결과를 재사용하거나 여러 Query에서 사용할 수 없으며 매 Query마다 재 수행해야하기 때문에 비효율적이지만, CISPHERE Continuous Query는 여러 개의 Stream을 연결하는 구조로 중간 결과를 사용하여 효율성을 높임
  • 기존 Query는 중간 결과를 VIEW로 만들어가며 쿼리를 실행하기때문에, Query가 길어지고, 이해하기 어려우나 CISPHERE Continuous Query는 중간 결과를 Stream으로 만들어가며 최종 Stream을 작성하기 때문에 각각의 Stream은 보기 쉽고, 이해하기 용이함
테스트
위로 스크롤