본문/내용
1. 데이터 파이프라인 설계 경험이 있다면 어떤 프로젝트였고, 어떤 기술을 사용했는지 설명해 주세요.
지난 프로젝트에서는 고객 행동 데이터를 수집하고 분석하기 위한 데이터 파이프라인을 설계하였습니다. ETL 프로세스를 구축하여 일별 10만 건 이상의 로그 데이터를 수집, 정제, 저장하는 시스템을 개발하였습니다. Apache Kafka를 활용하여 실시간 데이터 스트리밍을 구현하고, Apache Spark를 이용해 대규모 데이터를 분산 처리하였으며, 데이터 정제와 변환 작업을 수행하였습니다. 데이터 저장은 Hadoop HDFS와 Amazon S3를 병행하여 안정성과 확장성을 높였으며, Airflow를 통해 워크플로우를 자동화하여 하루 3회 정기 작업이 원활히 수행되도록 구성하였습니다. 이로써 데이터 수집 사이클을 기존 24시간에서 1시간 이내로 단축하였으며, 시스템 안정성 확보를 위해 Prometheus와 Grafana로 모니터링 체계를 구축하여 장애 발생률을 20% 감소시켰습니다. 이러한 데이터 파이프라인 설계를 통해 데이터 분석률이 35% 향상되었으며, 실시간 의사결정 지원 시스템의 신뢰성을 크게 향상시켰습니다.
2. ETL 프로세스를 구축할 때 가장 중요하게 고려하는 점은…