본문/내용
1. 데이터 전처리 과정에서 자주 사용하는 기법과 그 이유를 설명하세요.
데이터 전처리 과정에서 자주 사용하는 기법은 결측치 처리, 이상치 제거, 정규화, 표준화, 스케일링, 인코딩, 텍스트 데이터 전처리 등이 있습니다. 결측치는 분석 결과에 왜곡을 일으킬 수 있어 평균값 대체, 삭제 또는 예측모델 활용이 일반적입니다. 예를 들어, 고객 데이터에서 결측치를 평균값으로 대체하면 모델의 예측 정확도가 5% 향상된 사례가 있습니다. 이상치는 데이터의 분포를 왜곡시켜 분석을 어렵게 만들기 때문에 박스플롯과 IQR 방법으로 제거하거나 수정합니다. 정규화와 표준화는 서로 다른 스케일을 가진 변수들이 모델 학습에 방해되지 않도록 하며, 예를 들어 유클리드 거리 기반 알고리즘의 정확도를 10% 이상 향상시킨 사례도 존재합니다. 범주형 변수는 원-핫인코딩이나 레이블인코딩으로 처리하여 머신러닝 모델에 적합하게 만듭니다. 텍스트 데이터 전처리 시에는 토큰화, 정규화(소문자화, 불용어 제거, 표제어 추출 등)를 수행하여 텍스트 분석의 정밀도를 높입니다. 이러한 기법들은 데이터 분석의 신뢰성과 예측력을 높이기 위해 필수적이며, 실제 프로젝트에서 …