본문/내용
Q1. speech_park.txt 를 불러와 분석에 적합하게 전처리한 다음 띄어쓰기 기준으로 토큰화하세요.
]\\d]`와 같이 지정하면 모든 구두점과 숫자를 제거할 수 있다. 이러한 처리를 통해 우리는 분석에 필요한 순수한 언어 데이터를 확보하게 된다. 이제 데이터가 정제된 후, 띄어쓰기 기준으로 토큰화를 진행해야 한다. 이를 위해 `str_split` 함수를 사용할 수 있다. 이 함수는 지정한 구분자를 기준으로 문자열을 나누어 벡터 형태로 반환한다. 띄어쓰기를 기준으로 텍스트를 나누면 각 단어를 별개의 요소로 분리할 수 있다. 만약 데이터에서 특정한 불용어가 존재한다면, 이 단계에서 불용어 리스트를 작성하고 이를 필터링할 수 있다. 불용어란 `과`, `의`, `에`와 같은 일반적인 의미를 갖지 않는 단어들로, 분석의 정확성을 높이기 위해 이러한 단어를 제거하면 좋다. R에서는 `stopwords` 패키지에서 제공하는 불용어 리스트를 사용할 수 있다. 마지막으로, 이렇게 나눈 토큰들을 데이터 프레임으로 변환하여 이후 분석에 활용할 수 있다. 데이터 프레임으로 변환하면 각 토큰에 대한 추가적인 정보를 쉽게 추가하거나 분석할 수 있는 장점이 있다. 이를 통해 토큰화…