본문/내용
1. 데이터 전처리 과정에서 자주 사용하는 기법과 그 이유를 설명해 주세요.
데이터 전처리 과정에서 자주 사용하는 기법으로 결측치 처리, 이상치 제거, 정규화, 범주형 변환, 특징 선택이 있습니다. 결측치는 데이터의 분석 결과를 왜곡하므로 평균값, 중앙값 또는 예측 모델을 활용하여 채우는 것이 일반적입니다. 이상치는 박스플롯 상 IQR 범위 밖의 값을 제거하거나 변환하여 모델의 성능을 향상시킵니다. 정규화는 다양한 스케일의 데이터를 일관되게 만들어 학습 효율을 높이는데, 특히 딥러닝과 의사결정 트리 기반 알고리즘에서 중요합니다. 범주형 변수는 원-핫 인코딩 또는 레이블 인코딩을 통해 수치형 데이터로 변환하여 알고리즘이 인식 가능하게 합니다. 특징 선택은 불필요한 변수 제거와 모델의 복잡성 축소를 위해 중요하며, 예를 들어 상관관계 분석이나 LASSO 정규화 기법을 활용하여 20% 이상의 불필요한 속성을 제거하는 사례도 있습니다. 실무에서는 이러한 전처리 과정이 데이터의 품질을 높이고, 모델 예측 성능을 평균 15% 이상 향상시키는 데 결정적 역할을 합니다.
2. 머신러닝 모델의 성능을 평가하는 방법과 지표에 대해 설명해 주세요…