AI 인프라
마지막 검증 2026-08-22
이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준
개요
AI 인프라는 대형 언어 모델의 학습과 추론을 뒷받침하는 런타임과 최적화 기술을 포함한다. 장문맥 추론에서는 프리필 단계의 어텐션 연산량이 문맥 길이에 따라 제곱으로 증가해 병목이 된다.
희소 프리필 어텐션
FlashPrefill V2는 블록 희소 어텐션을 실용적인 장문맥 서빙에 적용한다. 평균 보정항으로 높은 희소도에서의 근사 오차를 억제하고, PackGQA 메모리 접근과 워프 특화, 핑퐁 파이프라이닝을 사용한다. FP8 추론과 페이지드 KV 캐시, 연속 배칭을 지원하며 SGLang 같은 현대적 추론 프레임워크의 어텐션 백엔드로 통합할 수 있도록 설계됐다.
성능
NVIDIA H20 GPU의 128K 문맥 평가에서 FlashPrefill V2는 FlashAttention-2 대비 FP8에서 최대 47.26배, BF16에서 최대 27.19배의 속도 향상을 보고했다. FP8에서는 FlashAttention-3/4에 맞춘 밀집 기준선과 비교해도 30.49배의 속도 향상을 기록했다.
링크된 엔티티
- 플래시프리필 V2
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving