본문/내용
1. KNN 알고리즘의 기본 원리를 설명하세요.
KNN(K-최근접 이웃) 알고리즘은 분류와 회귀에 모두 사용되는 지도 학습 알고리즘입니다. 이 방법은 새로운 데이터 포인트의 예측 값을 결정할 때, 학습 데이터 내에서 가장 가까운 K개의 이웃을 찾는 것을 기본 원리로 합니다. 거리 측정 방법으로는 유클리드 거리, 맨하탄 거리 등을 사용하며, 특정 K값을 정하면 그 K개 이웃의 라벨 또는 값을 참고하여 분류 또는 회귀를 수행합니다. 예를 들어, 고객 분류 사례에서 1000명의 고객 데이터를 기반으로 새로운 고객의 특성에 대해 K=5로 선정하면, 이웃 5명의 고객 정보를 분석하여 구매 가능성을 70%, 80%, 75%, 60%, 85%로 예측하는 것과 유사합니다. K값이 적으면 노이즈에 민감해지고, 크면 계산량이 증가하는 단점이 있으며, 최적 K값은 교차 검증 등으로 찾습니다. KNN은 데이터 분포에 강하게 의존하는 방식이기 때문에, 높은 차원에서는 거리 계산이 어려워지고 차원의 저주 현상이 발생할 수 있습니다. 실제 적용 사례로 의료 분야의 암 진단에서 환자의 유전자 데이터를 100개 이상 특징으로 삼아 K=3 또는 5를 적용해 암 유무를 판별하는 데 사용되며, 이 방법이 …