본문/내용
1. 빅데이터 프로젝트에서 데이터 수집과 정제 과정을 어떻게 진행하나요
빅데이터 프로젝트에서 데이터 수집은 다양한 채널에서 이루어집니다. 웹 크롤링, API 연동, 센서 데이터 수집, 데이터베이스 연계 등을 통해 수집하며, 예를 들어, 1개월에 약 100TB의 트위터 트윗 데이터를 크롤링하여 실시간 여론 분석에 활용한 사례가 있습니다. 이후 데이터 정제 과정은 수집된 원시 데이터의 노이즈를 제거하는 것으로 시작됩니다. 중복 제거는 필수적이며, 예를 들어 30% 이상 중복된 데이터를 삭제하여 데이터 효율성을 높였습니다. 결측 데이터는 평균값, 중앙값 또는 예측모델을 통해 보완하고, 이상치 탐지는 IQR, Z-스코어 방법 등 통계적 기법을 활용합니다. 텍스트의 경우 자연어 처리 기술을 이용하여 불필요한 태그, 특수문자 제거, 표준화 과정을 거칩니다. 이를 통해 정제된 데이터의 품질은 저장 공간 효율성과 분석 정확도를 크게 향상시키며, 프로젝트 성공률도 20% 이상 높아집니다. 데이터 정제 단계에서는 자동화된 스크립트와 병렬처리 방식을 도입해 작업 시간을 30% 감축하는 성과도 거두고 있습니다.
2. Hadoop 또는 Spark와 같은 빅데이터 처리 …