질의 기반 SciBERT 임베딩을 활용한 학술 논문 의미 탐색 및 클러스터링

Query-Aware SciBERT Embeddings for Semantic Exploration and Clustering of Scholarly Documents

초록

대규모 문서 집합에서 사용자가 찾고자 하는 정보를 효과적으로 탐색하고 문서 집합의 구성을 이해하는 것은 중요한 과제이다. 기존 문서 임베딩 모델은 고정된 의미 표현만을 생성해 다양한 탐색 의도나 관점을 반영하는 데 한계가 있다. 본 연구는 이를 해결하기 위해 사용자 질의(Query)에 따라 문서 의미 공간을 동적으로 재구성하는 새로운 프레임워크를 제안한다. 사전 학습 언어 모델(SciBERT)을 활용해 질의와 문서의 관계를 모델링하는 질의 인식 동적 임베딩(Query-Aware Dynamic Embedding)을 생성하며, 이를 UMAP 기반 차원 축소와 HDBSCAN 군집화에 적용하여 다각적이고 심층적인 문서 탐색을 지원한다. 이 파이프라인은 사용자가 질의를 통해 분석 범위(Scope)를 능동적으로 조절하며 문서 집합에 대한 통찰력을 얻는 효과적인 탐색 환경을 제공한다.

키워드

Natural Language ProcessingSciBERTQuery-Aware Dynamic EmbeddingDocument ClusteringDocument VisualizationExploratory Data Analysis자연어 처리SciBERT질의 인식 동적 임베딩문서 군집화문서 시각화탐색적 데이터 분석
제목
질의 기반 SciBERT 임베딩을 활용한 학술 논문 의미 탐색 및 클러스터링
제목 (타언어)
Query-Aware SciBERT Embeddings for Semantic Exploration and Clustering of Scholarly Documents
저자
이우주송현주
DOI
10.23019/kingpc.21.5.202510.011
발행일
2025-10
유형
Y
저널명
한국차세대컴퓨팅학회 논문지
21
5
페이지
147 ~ 159