본문/내용
1. 데이터 엔지니어링 프로젝트에서 가장 어려웠던 문제와 그 해결 방법에 대해 설명해 주세요.
데이터 엔지니어링 프로젝트에서 가장 어려웠던 문제는 대용량 데이터의 실시간 처리와 안정적인 파이프라인 구축이었습니다. 고객사 데이터는 일평균 10TB 이상으로 증가하는데, 기존 ETL 시스템은 처리 속도가 느리고 장애 발생 시 복구가 어렵다는 문제점이 있었습니다. 이를 해결하기 위해 Apache Kafka와 Spark Structured Streaming을 도입하여 실시간 데이터 수집과 처리 능력을 강화하였고, 데이터 정합성과 일관성을 유지하기 위해 데이터 스키마 검증과 버전 관리를 엄격히 실시하였습니다. 또한, 장애 발생 시 자동 복구 시스템을 구축하여 가동률을 9 9% 이상 유지하였으며, 데이터 처리 지연 시간을 기존 30분에서 2분 이내로 단축시킬 수 있었습니다. 이 과정에서 수차례 인프라 최적화와 모니터링 강화를 통해 시스템 안정성을 확보하였으며, 최종적으로 데이터 품질 향상과 분석 시간 단축에 기여하였습니다.
2. 빅데이터 처리에 사용했던 주요 기술과 도구에 대해 설명해 주세요.
GS네오텍에서 빅데이터 처리에 주로 사용한 기술로는 Apache Hadoop,…