1. 전사 데이터 탐색 및 실시간 분석을 위한 Agentic AI 플랫폼 구축
- 배경 및 과제: 데이터 분석가 수동 대응에 따른 리드타임 병목 해소 및 전사 비즈니스 구성원의 자율적 데이터 접근성 확보
- 해결 방안:
- Strands SDK(AWS Bedrock 기반) 채택 및 Tool Overload 방지를 위한 커스텀 MCP 도구 세트 최적화
- DataHub 메타데이터 및 Slack/Wiki 지식 베이스를 PostgreSQL(
pgvector)에 임베딩하여 통합 엔터프라이즈 RAG 구축
- 운영 DB 부하 방지를 위해 Agent 백엔드를 StarRocks 분석 엔진으로 격리 라우팅하여 초 단위 응답 보장
- LLM 프롬프트 인입 전 민감 정보를 실시간 감지·차단하는 PII 보안 가드레일 구현
- 운영 Query Digest 기반 실시간 평가(Evaluation) 파이프라인을 구축하고 피드백 루프를 통해 에이전트 답변 지속 개선
- 성과: 초기 정확도 0.69에서 0.91로 대폭 향상 (약 32% 개선), 단순 반복 데이터 추출 업무 100% 자동화 달성
- Claude Code CLI & MCP 기반 AI DBA 비서 에이전트 구축
- 배경 및 과제:
- 개발팀의 빈번한 DB 접근 권한 신청, 스키마/쿼리 컨벤션 문의, 인프라 트러블슈팅 요청 등 반복적인 인바운드 커뮤니케이션으로 인한 DBA 코어 업무 집중도 저하
- 터미널(CLI) 중심의 DBA 운영 환경에서 컨텍스트 스위칭 없이 즉각적인 의사결정 및 가이드를 제공할 수 있는 운영 도구 필요
- 해결 방안:
- Claude Code CLI 기반 워크플로우 구성: 엔지니어링 작업 공간인 터미널 환경에 직접 연동되는 대화형 운영 비서 파이프라인 설계
- 사내 도메인 MCP(Model Context Protocol) 연동:
- QueryPie 연동: DB 계정 권한 및 접근제어 정책 관련 가이드 자동화
- 커뮤니케이션 & 지식 베이스 통합: Slack의 과거 DBA 질의응답 히스토리 및 Confluence Wiki 아키텍처 문서를 벡터/검색 컨텍스트로 주입
- 지능형 가이드 자동화: 스키마/인덱스 컨벤션 검증, 접근제어 신청 절차 안내, 장애·이슈 대응 가이드를 일관된 기준으로 자동 서빙
- 성과 및 비즈니스 임팩트:
- DBA의 단순 반복 커뮤니케이션 및 1차 대응 리소스 최소화
- 개발팀에 표준화된 DB 운영 정책 및 인프라 가이드를 실시간으로 제공하여 개발 생산성 및 거버넌스 준수율 향상
- AI 코딩 에이전트(CLI)와 실무 도메인 지식을 유기적으로 결합한 차세대 DBRE 운영 모델 정립
- Amazon S3 Tables(Iceberg) 기반 차세대 실시간 데이터 레이크하우스 구축
- 배경 및 과제: 기존 EMR/Sqoop 기반 새벽 Full Refresh 배치의 운영 DB/S3 I/O 부하 및 OLTP(Reader DB) 리소스 경합으로 인한 서비스 지연 문제 해결 필요
- 해결 방안:
- Debezium + Amazon MSK + Amazon S3 Tables(관리형 Iceberg) 기반 실시간 CDC 파이프라인 설계
- S3 Tables 유지 관리 최적화: 512MB 기준 Auto Compaction 적용으로 Small File 해소 및 스토리지 Snapshot 보존 주기 차등 적용
- OLAP 분석 엔진을 EKS 기반 StarRocks로 전환하여 쿼리 백엔드 분리
- 성과:
- 데이터 동기화 주기 단축 (1일 단위 → 10분 단위 실시간)
- Presto 대비 vCPU 70%, Memory 85% 리소스 절감 및 동등 이상의 고성능 분석 지원
- AWS 공식 기술 블로그(2부작) 구축 사례 기고 및 전사 실시간 메시징 데이터의 핵심 처리 기반 안착
- ISMS-P 준수를 위한 TB급 운영 DB 리전 간 무중단 마이그레이션 (도쿄 → 서울)
- 배경 및 과제: ISMS-P 인증 취득을 위한 전체 인프라 이전 중, 기존 RDS 스냅샷 복제 방식은 최소 2시간 이상의 긴 다운타임으로 전체 서비스 배포 지연 리스크 발생
- 해결 방안:
- 다운타임 최소화를 위해 AWS DMS CDC 기반 실시간 스트리밍 마이그레이션 아키텍처 채택
- 고부하/대용량 테이블 대상 전용 CDC Task 및 복제 인스턴스 분리(Isolation) 구성으로 리소스 경합 및 Task 중단 방지
- 사전 데이터 정합성 검증(Validation) 병행을 통한 데이터 신뢰도 확보