StreamSphere
StreamSphere(스트림스피어)는 데이터 수집만을 위한 기존 Stream과 달리, ShardSphere와 연계되어 고성능 처리 및 데이터 정제가 가능
StreamSphere란?
- 수많은 IoT 장치와 인터넷 사용자는 엄청난 양의 연속적인 실시간 데이터를 생성
- 이는 실시간 ETL(데이터 추출(Extraction), 변환(Transformation),적재(Loading)) 하여 고성능의 데이터 처리가 필요.
- 동적 데이터 발생에 대해 요약 및 집계를 수집하여 시간별, 기능별 분석할 수 있는 데이터 추출 및 텍스트 검색 필터링, 알람 필터링 등에 사용 할 수 있음
StreamSphere
- 운영통합
- 기존 제품군들은 따로 구축이 되어 있는 경우가 많음 (예: kafca + 시계열 + RDB …등)
- StreamSphere는 하나의 제품으로 필요에 따라 Static data와 Stream Data를 동시에 접근 및 처리 가능
- 손쉬운 접근
- 표준 SQL을 사용
- 이해하기 쉬운 Stream용 DDL 제공
- Continuous aggregation query 제공
- Top-k, hyperloglog, t-digest등의 확률적 알고리즘 함수 제공
- Restful API를 사용하여 호환이 용이함
StreamSphere 스트리밍 SQL
- 표준 SQL 을 사용
- continuous aggregation query 제공
- Top-k, hyperloglog, t-digest 등의 확률적 알고리즘 함수 제공
StreamSphere 테스트
기상 데이터 테스트 사례
- RDB 대신 StreamSphere으로 대체하여 내부 테스트를 진행, 실시간 결과 확인 사례
- 기존 Query는 테이블의 데이터양에 비례해서 성능이 낮아지고, 리소스(Memory Temp) 사용량이 많아짐
- CISPHERE Continuous Query는 데이터 증가에 대해 리소스 사용량 증가나 성능저하가 없음
- 기존 Query는 RDBMS의 특성상 중간결과를 재사용하거나 여러 Query에서 사용할 수 없으며 매 Query마다 재 수행해야하기 때문에 비효율적이지만, CISPHERE Continuous Query는 여러 개의 Stream을 연결하는 구조로 중간 결과를 사용하여 효율성을 높임
- 기존 Query는 중간 결과를 VIEW로 만들어가며 쿼리를 실행하기때문에, Query가 길어지고, 이해하기 어려우나 CISPHERE Continuous Query는 중간 결과를 Stream으로 만들어가며 최종 Stream을 작성하기 때문에 각각의 Stream은 보기 쉽고, 이해하기 용이함
