본문/내용
1. 데이터 전처리 과정에서 자주 사용하는 기법과 그 이유를 설명하세요.
데이터 전처리 과정에서 자주 사용하는 기법은 결측치 처리, 이상치 제거, 데이터 정규화, 스케일링, 범주형 변수 인코딩, 정제 및 표준화입니다. 결측치는 분석에 방해가 되므로 평균 또는 중앙값으로 대체하거나 삭제합니다. 이상치는 IQR 또는 표준편차 기준으로 제거하며, 이는 모델 성능 향상에 유리하다고 볼 수 있습니다. 정규화와 표준화는 다양한 특성들이 서로 다른 스케일을 가질 때 모델 학습 효율을 높이기 위해 필수적입니다. 예를 들어, 2022년 프로젝트에서는 데이터 정규화를 통해 RMSE를 15% 개선하였으며, 결측치 대체와 이상치 제거로 모델의 예측 정확도를 10% 이상 향상시킨 경험이 있습니다. 범주형 변수는 원-핫 인코딩이나 라벨 인코딩으로 변환하여 모델이 이해 가능하게 만들어줍니다. 이러한 전처리 과정을 통해 데이터의 품질을 향상시키고, 머신러닝 모델의 성능을 극대화하는 것이 핵심입니다.
2. 머신러닝 모델의 성능을 평가할 때 어떤 지표를 사용하며, 각각의 지표가 어떤 상황에 적합한지 설명하세요.
머신러닝 모델의 성능 평가 지표는 주로 정확도(A…