본문/내용
1. 데이터 분석 프로젝트 경험에 대해 설명해 주세요. 어떤 문제를 해결했으며 어떤 방법을 사용했나요
지난 2년간 화학제품 생산 공정 최적화 프로젝트에 참여하여 대규모 설비 데이터를 분석하였으며, 이를 통해 불량률을 15% 낮추는 성과를 이뤄냈습니다. 생산라인의 센서 데이터를 수집하고 결측값 제거 및 정규화를 수행하였으며, EDA를 통해 주요 변수와 결합 관계를 파악하였습니다. 이후, 랜덤 포레스트 모델을 활용하여 불량품 예측 모델을 구축했고, 교차 검증 결과 정확도는 85% 이상으로 높았습니다. 또한, SHAP 값을 활용하여 주요 원인 변수와 영향을 분석함으로써 생산 공정을 개선하는 인사이트를 도출하였으며, 이를 바탕으로 설비 유지보수 일정 최적화와 작업 프로세스 개선을 추진하였다고 합니다. 이 과정에서 Python의 pandas, scikit-learn, XGBoost 라이브러리를 주로 사용하였으며, 데이터 시각화는 Tableau를 활용하여 이해관계자에게 쉽게 전달하였고, 실제 불량률 감소와 생산 효율 향상에 기여하였습니다.
2. 머신러닝 모델을 구축할 때 어떤 평가 지표를 선택하고, 왜 그 지표를 중요하게 생각하나요
머신러닝 모델 평가 시에는 주…