본문/내용
1. 데이터 전처리 과정에서 어떤 방법들을 사용하며, 그 이유는 무엇인가요
데이터 전처리 과정에서는 결측치 처리, 이상치 제거, 정규화, 표준화, 특성 선택, 데이터 인코딩을 주로 사용합니다. 결측치는 평균 또는 중위값 대체로 처리하며, 이를 통해 데이터 손실을 최소화하고 모델 성능을 높입니다. 이상치는 IQR(사분위 범위) 또는 Z-스코어를 활용하여 제거하거나 조정합니다. 정규화와 표준화는 데이터 분포를 통일하여 학습 안정성을 높이고, 특히 신경망 모델이 빠르게 수렴하도록 돕습니다. 범주형 변수는 원-핫 인코딩 또는 임베딩 기법으로 변환합니다. 예를 들어, 고객 행동 데이터 분석 시 결측치를 5%만 남기고 제거하면 모델 예측 정확도가 3% 향상된 경험이 있으며, 정규화 후 손실값이 20% 감소하는 것을 관찰했습니다. 이러한 방법들은 데이터의 잡음을 줄이고 모델이 더 일반화된 성능을 발휘하게 하여, 최적의 결과를 얻는 데 필수적입니다.
2. 머신러닝 모델의 성능을 평가할 때 어떤 지표들을 주로 사용하나요
머신러닝 모델의 성능 평가는 다양한 지표를 통해 이루어집니다. 분류 문제에서는 정확도(Accuracy), 정밀도(Precision), 재현율…