본문/내용
1. 본인이 경험한 머신러닝 프로젝트 중 가장 도전적이었던 사례와 이를 해결하기 위해 어떤 방법을 사용했는지 설명해 주세요.
경험한 머신러닝 프로젝트 중 가장 도전적이었던 사례는 광고 클릭률 예측 모델의 성능을 극대화하기 위한 프로젝트입니다. 초기에는 기존에 사용하던 단일 모델 기법으로는 충분한 예측력을 확보하기 어려웠습니다. 클릭률 데이터는 비선형성과 희소성이 높아 기존의 선형 모델이나 단순 딥러닝 모델만으로는 한계가 있었습니다. 또한 데이터의 편향성과 불균형 문제로 인해 특정 사용자층이나 특정 광고 유형에 대해 과적합 현상이 자주 발생하였고, 실시간 예측 속도도 중요한 요구사항이었습니다. 이로 인해 프로젝트의 난이도는 높았고, 성능 개선이 중요한 과제로 떠오르게 되었습니다. 이 문제를 해결하기 위해 다양한 방법을 시도하였으며, 먼저 데이터 전처리와 피처 엔지니어링 단계에 많은 공을 들였습니다. 광고의 컨텐츠 정보, 사용자 행동 기록, 시간 정보 등을 다차원적 특징으로 수집하여 피처 엔지니어링을 진행했고, 희소성을 줄이기 위해 차원 축소 기법인 PCA와 특이값 분해(SVD)를 활용하였습니다. 이후에는 앙상블 기법…