멀티모달 모델
마지막 검증 2026-08-22
이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준
개요
멀티모달 이미지 생성에서는 여러 참조 인물을 한 장면에 배치할 때 각 정체성을 서로 다른 사람과 위치에 정확히 연결하는 문제가 중요하다. WithEveryone은 최대 10명의 참조 정체성이 포함된 단체 이미지 생성을 위해 정체성 표현과 레이아웃 계획을 하나의 프레임워크로 결합한다.
정체성과 레이아웃의 결합
WithEveryone은 선택된 각 정체성을 주소화된 토큰으로 주입하고, 구조화된 정체성-레이아웃 계획을 예측한 뒤 이를 시각적 조건으로 렌더링한다. Layout-Grounded ID Loss는 주석이 달린 얼굴 영역을 이용해 의도한 정체성을 직접 감독하며, ID Representation Forcing은 이미지 합성 전에 각 정체성에 대한 예측을 학습한다.
평가 결과
정체성이 겹치지 않는 벤치마크에서 WithEveryone은 대상 문맥 정체성 유사도 0.499를 기록해 GPT-Image-2의 0.462보다 높았다. 복사·붙여넣기 형태의 아티팩트는 0.169에서 0.055로 감소했으며, 요청된 정체성의 97.3%를 포함하고 중복률은 2.8%를 기록했다.
링크된 엔티티
- WithEveryone
- WithEveryone: Unified Planning and Identity Grounding for Group Image Generation