벤치마크와 평가

마지막 검증 2026-08-22

이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준

개요

AI 에이전트 벤치마크는 단순한 데이터 수집이나 하이퍼파라미터 조정을 넘어, 에이전트가 학습 알고리즘 자체를 재설계할 수 있는지 분리해 측정할 수 있다. AI4AI-Bench는 서로 다른 10개 학습 알고리즘 계열을 대표하는 동결 연구 저장소 10개로 구성된다.

평가 절차

각 과제에서 에이전트는 제한된 시간과 계산 자원 안에서 학습 알고리즘을 다시 작성한다. 제출 코드는 처음부터 재실행되며, 에이전트에게 공개되지 않은 고정 평가기로 원래 저장소의 알고리즘과 같은 절차 아래 비교된다. 서로 단위가 다른 10개 지표는 무정보 모델을 0, 저장소의 원래 알고리즘을 0.1, 과제 최적값을 1.0으로 두는 공통 척도로 변환된다.

보고된 결과

6개 시스템의 29개 구성을 10개 과제에서 평가한 평균 점수는 0.166이었고 최고 시스템은 0.250을 기록했다. 학습 방식을 실제로 변경한 제출은 그렇지 않은 제출보다 높은 평균 점수를 보였으며, 추론 노력을 늘리면 이러한 변경을 시도하는 제출의 비율도 증가했다.

링크된 엔티티

  • AI4AI-Bench
  • AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

최근 변경