본문/내용
1. 데이터 파이프라인 설계 경험이 있다면 어떤 프로젝트였는지 설명해주세요.
번개장터에서 데이터 파이프라인 설계 경험이 있으며, 이를 통해 사용자 행동 데이터를 실시간으로 수집하고 분석하는 시스템을 구축하였습니다. 오후 8시부터 새벽 2시까지 발생하는 주문 및 클릭 데이터를 Kafka를 이용하여 스트리밍 처리하였고, 매일 약 5억 건의 로그 데이터를 실시간으로 수집하고 저장하는 작업을 수행하였습니다. 수집된 데이터를 빠르게 가공하기 위해 Spark Structured Streaming을 활용하며, 10TB에 이르는 데이터를 30분 이내에 분석 가능하도록 최적화하였고, 데이터 품질 관리를 위해 검증 로직을 구현하였습니다. 이러한 시스템을 통해 고객 맞춤 추천 시스템의 정밀도를 15% 향상시키고, 일별 데이터 수집 실패율을 0. 5% 이하로 유지하여 분석 신뢰도를 높인 경험이 있습니다. 또한, Airflow 기반 워크플로우 자동화를 통해 일일 데이터 파이프라인 수행 시간을 40% 단축하면서 운영 효율성을 크게 개선하였으며, 전사 데이터 관리 정책을 준수하면서 안정적이고 확장 가능한 데이터 파이프라인을 설계하였습니다.
2. SQL을 이용한 데이터 추출 및 가공 …