상세 보기
자연어처리 기계학습 기법을 이용한 공시문서의 자동분류: Confidential treatment를 가진 8-K 문서를 중심으로
Automatic Classification of Mandatory SEC Filings using NLP Techniques: Filtering Form 8-K Disclosures with Confidential Treatment Redactions
- 이경란;
- 강창묵
초록
기업에 대한 방대한 정보를 제공하는 공시자료는 기업간 거래 및 투자 결정에 있어 필수적인 정보 원천이며 기업 및 산업에 대한 중요 연구자료이다. 본 논문에서는 기계학습에 기반한 자연어처리 기법을 활용하여 공시자료의 분류를 자동화하는 방법에 대해 다룬다. 특히 비밀처리(confidential treatment, CT)를 가지는 미국 수시공시 회계문서 8-K 양식의 자동판별을 위한 자연어처리(natural language processing, NLP) 기계학습 모델을 제안한다. CT란 경쟁우위의 저하를 유발할 수 있는 배타적 정보를 공시자료에서 비공개 하도록 허용하는 제도를 말한다. 문서의 분류를 위해 의사결정나무 기반의 XGBoost 모형과 인공신경망 기반의 EmbedMixed, BERT 모형을 비교하였다. 그 결과 가장 우수한 성능을 보인 모형은 XGBoost 모형으로 재현율과 정밀도가 80%~90% 사이에서 서로 상쇄하는 수준을 보였다. 본 모델을 통해 비밀처리 문서 탐색의 효율성을 크게 높일 수 있으며 다른 유형의 공시문서 분류에도 유사한 접근법을 적용해 볼 수 있을 것으로 기대한다.
키워드
Natural Language Processing; Machine Learning; Document Classification; Form 8-K; Confidential Treatment; 자연어처리; 기계학습; 문서판별; 8-K양식; 비밀처리
- 제목
- 자연어처리 기계학습 기법을 이용한 공시문서의 자동분류: Confidential treatment를 가진 8-K 문서를 중심으로
- 제목 (타언어)
- Automatic Classification of Mandatory SEC Filings using NLP Techniques: Filtering Form 8-K Disclosures with Confidential Treatment Redactions
- 저자
- 이경란; 강창묵
- 발행일
- 2023-05
- 저널명
- 한국전자거래학회지
- 권
- 28
- 호
- 2
- 페이지
- 21 ~ 36