AI 안전

마지막 검증 2026-08-22

이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준

절차 수준의 에이전트 안전

고객 서비스 LLM 에이전트의 정책 위반은 금지된 행동을 수행하는 경우뿐 아니라 신원 확인이나 사용자 확인과 같은 필수 절차를 빠뜨릴 때도 발생한다. 개별 행동만 검사하는 안전장치는 여러 단계로 이어지는 절차 전체를 안내하기 어렵다.

정책 워크플로와 선제적 검증

PolicyGuide는 도메인 정책을 워크플로 그래프로 변환하고 사용자 턴의 경계에서 선제적 검증기를 호출한다. 검증기는 저장된 그래프 상태를 바탕으로 진행 중인 요청을 조정하고, 정책을 준수하는 경로에 맞춘 단계별 교정 지침을 반환한다.

평가

항공·소매·통신 도메인에서 GPT-5.4 에이전트와 검증기를 평가한 결과 평균 Pass^4는 0.42에서 0.62로 상승했다. 절차 구조가 가장 강한 통신 도메인에서는 0.19에서 0.61로 개선됐다. 동일한 워크플로는 Claude Sonnet 4.6과 Gemini 2.5 Pro 에이전트에도 이전됐으며, 보완 평가에서는 적대적 사용자에 대한 낮은 공격 성공률과 강한 절차 준수가 관찰됐다.

링크된 엔티티

  • PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

최근 변경