과학 AI
마지막 검증 2026-08-22
이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준
과학 소프트웨어 평가
SWE-bench Science는 과학 소프트웨어 엔지니어링을 위한 저장소 수준 벤치마크다. 20개 과학 분야에 걸친 GitHub 저장소 98곳에서 119개 과제를 구성하고, 과제를 이슈 기반·전문가 탐색·엔지니어링 통합의 세 유형으로 나눈다.
에이전트의 실패 원인
평가된 최고 성능 에이전트도 pass@1 50%에 미치지 못했다. 분석에서는 과학 지식이나 추상화의 부족, 잘못된 탐색 또는 표면적인 수리, 불완전한 수리 범위와 시스템 통합, 관찰 사례를 넘어 과학 지식을 일반화하지 못하는 문제가 반복적으로 나타났다.
과학 지식의 효과
명시적인 과학 지침을 제거한 대응 실험에서는 과학 지식이 항상 유익하지는 않은 것으로 나타났다. 근거가 잘 맞는 정보는 수리 범위를 제약하면서 평균 성능과 토큰 효율을 높일 수 있지만, 과제와 맞지 않는 지침은 고착을 일으키며 정확한 수리 성공을 반드시 높이지는 않았다.
링크된 엔티티
- SWE-bench Science
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?