전역-국소-문맥 정보의 어텐션 기반 게이팅 융합을 통한 멀티모달 유해 밈 탐지 모델

Multimodal Hateful Meme Detection Model Exploiting Attention-Based Gating Fusion of Global-Local-Context Information

초록

멀티모달 밈의 유해성은 이미지-텍스트의 암시적 결합을 통해 드러나 단일 모달로는 탐지가 어렵다. 본 논문은 멀티모달 밈의 유해성 탐지를 위해 전역-국소-문맥 정보를 단계적으로 정제하고 경량 게이팅으로 통합하는 멀티모달 유해 밈 탐지 모델을 제안한다. 모델 평가를 위해 COVID-19 도메인을 가진 Harm-C와 모달 간 결합으로만 유해성 드러나는 Hateful Mems 데이터셋을 사용했으며, 비교 모델로는 이미지 단일(ResNet-50, EfficientNet-B3, ViT-b/16), 텍스트 단일(BERT-base, RoBERTa-base), 멀티모달(Late-Fusion, CLIP-Linear/MLP)을 채택하였다. 실험 결과, Harm-C는 Acc 0.8430±0.0071/F1 0.8349±0.0066, Hateful Memes는 Acc 0.7208±0.0124/F1 0.6706±0.0279로 모든 베이스라인을 상회했고, 모듈 제거 실험에서 MultiAttention과 ContextGen이 핵심 기여 모듈로 확인되었다.

키워드

blockchainhybrid blockchaintransactionstransaction feature analysisbusiness transaction analysis멀티모달유해 밈 탐지self-attentiongating mechanism
제목
전역-국소-문맥 정보의 어텐션 기반 게이팅 융합을 통한 멀티모달 유해 밈 탐지 모델
제목 (타언어)
Multimodal Hateful Meme Detection Model Exploiting Attention-Based Gating Fusion of Global-Local-Context Information
저자
박수진김건우
발행일
2026-07
유형
Y
저널명
정보과학회논문지
53
7
페이지
621 ~ 630