상세 보기
전역-국소-문맥 정보의 어텐션 기반 게이팅 융합을 통한 멀티모달 유해 밈 탐지 모델
Multimodal Hateful Meme Detection Model Exploiting Attention-Based Gating Fusion of Global-Local-Context Information
- 박수진;
- 김건우
초록
멀티모달 밈의 유해성은 이미지-텍스트의 암시적 결합을 통해 드러나 단일 모달로는 탐지가 어렵다. 본 논문은 멀티모달 밈의 유해성 탐지를 위해 전역-국소-문맥 정보를 단계적으로 정제하고 경량 게이팅으로 통합하는 멀티모달 유해 밈 탐지 모델을 제안한다. 모델 평가를 위해 COVID-19 도메인을 가진 Harm-C와 모달 간 결합으로만 유해성 드러나는 Hateful Mems 데이터셋을 사용했으며, 비교 모델로는 이미지 단일(ResNet-50, EfficientNet-B3, ViT-b/16), 텍스트 단일(BERT-base, RoBERTa-base), 멀티모달(Late-Fusion, CLIP-Linear/MLP)을 채택하였다. 실험 결과, Harm-C는 Acc 0.8430±0.0071/F1 0.8349±0.0066, Hateful Memes는 Acc 0.7208±0.0124/F1 0.6706±0.0279로 모든 베이스라인을 상회했고, 모듈 제거 실험에서 MultiAttention과 ContextGen이 핵심 기여 모듈로 확인되었다.
키워드
blockchain; hybrid blockchain; transactions; transaction feature analysis; business transaction analysis; 멀티모달; 유해 밈 탐지; self-attention; gating mechanism
- 제목
- 전역-국소-문맥 정보의 어텐션 기반 게이팅 융합을 통한 멀티모달 유해 밈 탐지 모델
- 제목 (타언어)
- Multimodal Hateful Meme Detection Model Exploiting Attention-Based Gating Fusion of Global-Local-Context Information
- 저자
- 박수진; 김건우
- 발행일
- 2026-07
- 유형
- Y
- 저널명
- 정보과학회논문지
- 권
- 53
- 호
- 7
- 페이지
- 621 ~ 630