검색 증강 생성

마지막 검증 2026-08-19

이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준

개요

검색 증강 생성은 외부 문서를 검색해 언어 모델의 생성에 근거를 제공하지만, 공격자가 악성 문서를 주입하면 생성 결과가 조작될 수 있다. 출력의 퍼플렉시티나 일관성만 검사하는 방식은 오염된 출력이 오히려 높은 확신을 보일 수 있어 탐지에 실패할 수 있다.

어텐션 붕괴

D-SCAN은 정상 생성에서 여러 문서로 분산되는 어텐션과 달리, 공격받은 생성에서는 어텐션이 오염 문서에 집중되며 엔트로피가 감소하는 현상을 이용한다. 이 문서 수준 신호를 관찰하면 공격이 최종 답을 바꾸지 못한 경우에도 공격 시도를 탐지할 수 있다.

링크된 엔티티

  • D-SCAN
  • When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse

최근 변경