본문/내용
1. 과제 1
과제 1은 데이터 과학의 기초를 다지는 데 중요한 역할을 했다. 이 과제는 데이터 전처리에 대한 깊은 이해를 요구했으며, 실제 데이터셋을 다루면서 다양한 기술과 기법을 적용해보는 기회를 제공했다. 내가 선택한 데이터셋은 공공기관에서 제공한 코로나19 확진자 데이터로, 매일 업데이트되는 정보를 바탕으로 진행했다. 우선 데이터셋을 탐색하면서 전체적인 구조와 주요 변수에 대해 분석했다. 데이터는 날짜, 지역, 확진자 수, 사망자 수 등 여러 변수로 구성되어 있었다. 각 변수의 의미를 명확히 이해하고, 결측치나 이상치를 확인하는 것이 중요했다. 데이터 전처리는 데이터 분석의 전 단계로, 이후의 분석 결과에 큰 영향을 미친다. 이를 위해 각 변수의 데이터 타입을 확인하고, 결측치가 있는 경우 적절한 방법으로 처리했다. 결측치는 보통 많은 경우 평균값, 중앙값 또는 최빈값으로 대체하거나, 경우에 따라 해당 행을 삭제하기도 한다. 이번 데이터셋에서는 확진자 수와 사망자 수의 결측치를 평균값으로 대체했다. 이러한 선택은 데이터의 흐름과 경향을 유지하는 데 도움을 줬다. 이상치에 대해서는 EDA(탐색적 데이터 분석)를 통해 시각적…