Today

이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준

  • Update80

    발화 중 영상을 인식하는 MOSS-VL 모델 계열이 공개됐다

    • 발화 중에도 새 영상 프레임을 인식하도록 설계된 MOSS-VL 모델 계열이 공개됐다.
    • 기술 보고서와 함께 체크포인트 5종, 학습 커리큘럼, 실시간 추론 코드가 제공됐다.

    실시간 영상 이해와 발화를 결합한 모델을 체크포인트와 추론 코드로 직접 검토할 수 있게 됐다.

    모델 공개멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update72

    MCP가 에이전트 위임과 HTTP 전송 통합을 우선 과제로 제시했다

    • MCP 유지관리자들이 향후 규격 개발의 우선순위를 담은 로드맵을 공개했다.
    • 에이전트 메시징과 신원·위임, HTTP 네이티브 전송 통합, 명확한 도구 결과 계약이 주요 과제로 제시됐다.
    • 점진적 도구 탐색과 SDK 개발 경험 개선도 로드맵에 포함됐다.

    이번 로드맵은 MCP 생태계가 에이전트 간 상호작용과 도구 연동을 더 명확하게 다루는 방향으로 확장될 것임을 보여준다.

    모델 컨텍스트 프로토콜AI 에이전트AI 인프라Source quality60%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update65

    다중 턴 영상 이해 벤치마크 VideoGAIA가 공개됐다

    • 인간과 모델이 공동 설계한 실제 시나리오 기반 과제 271개로 구성됐다.
    • GPT-5.5와 Kimi-K3를 포함해 논문에서 평가한 모든 멀티모달 대형 언어 모델의 정확도가 60%를 밑돌았다.

    VideoGAIA는 멀티모달 모델의 다중 턴 도구 활용 능력을 비교할 기준을 제시한다. 모든 평가 모델이 60% 미만에 머물러 현재 모델의 개선 여지도 드러냈다.

    AI 에이전트벤치마크와 평가멀티모달 모델Source quality80%1 source
  • Update62

    Kobo 전자책 단말기용 오픈소스 앱 플랫폼 Cobalt가 공개됐다

    • 최초 설치는 USB로 진행하며, 이후 앱과 플랫폼 업데이트는 Wi-Fi로 관리한다.
    • 런처와 서명된 앱 스토어, Rust SDK, 권한 기반 격리 런타임을 지원한다.

    Kobo 단말에서 애플리케이션을 격리해 실행하고 업데이트하는 기반을 제공한다.

    AI 인프라온디바이스 추론Source quality60%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update60

    FlowEvo가 성공한 워크플로를 지속 스킬로 전환한다

    • 성공한 에이전트 워크플로를 호출 가능한 실행 스킬로 컴파일해 지속적으로 축적한다.
    • 저장된 스킬은 이후 워크플로 구성이나 직접 실행에 재사용되며, 후속 효용에 따라 부정적 전이를 억제한다.

    에이전트가 별도 학습 없이 과거에 성공한 절차를 다음 과제에 활용하고, 축적된 스킬의 효용까지 관리할 수 있다.

    AI 에이전트에이전트 메모리Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update60

    GOAG가 객체별 학습 없이 다지 파지를 계획한다

    • GOAG는 객체별 학습 데이터에 의존하지 않고, 추론 시점에 객체 특징을 반영하는 생성형 파지 계획 모델이다.
    • MultiDex 데이터셋 객체에서 평균 86.93%의 파지 성공률을 기록했다.

    객체별 학습 데이터에 대한 의존을 줄이면서도 새로운 물체에 적용할 수 있는 다지 파지 계획의 가능성을 보여준다.

    로봇 조작Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research60

    AutoSR이 연구 상태 탐색으로 기호 회귀를 자동화했다

    • AutoSR은 추론과 계산 증거, 독립 검토를 보존하는 연구 상태를 탐색해 기호 관계를 자동으로 찾는다.
    • 제안자·검토자 에이전트와 점진적 확장 몬테카를로 트리 탐색을 결합했다.
    • 선정된 9개 과제 모두에서 대수적으로 동등한 관계를 복원한 것으로 보고됐다.

    에이전트의 다단계 추론과 검토를 과학적 관계 발견에 적용한 사례로, AI 에이전트와 과학 AI의 접점을 보여준다.

    AI 에이전트과학 AISource quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research60

    체화 에이전트 보안을 신뢰 경계 중심으로 정리한 조사가 나왔다

    • 체화 에이전트의 공격 표면과 방어를 공격자가 처음 침투한 신뢰 경계를 기준으로 체계화했다.
    • 문맥·장기 메모리, 미들웨어, 월드 상태 무결성, 다중 에이전트 신뢰를 상대적으로 연구가 부족한 영역으로 지목했다.

    디지털 입력의 침해가 인식과 추론을 거쳐 물리적 행동으로 이어질 수 있는 만큼, 연구가 부족한 경계와 방어 우선순위를 함께 파악하는 데 도움이 된다.

    AI 안전AI 에이전트로봇 인식Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update60

    초경량 확률적 예측 모델 TinyCast가 공개됐다

    • TinyCast는 우세 주기성을 직접 계산해 예측 분포를 출력하는 어텐션 없는 제로샷 시계열 예측 모델이다.
    • 파라미터 146,505개로 구성됐으며 정적 INT8 내보내기와 임베디드 기기 추론을 지원한다.

    주기 구조를 직접 계산하는 소형 모델 설계가 확률적 제로샷 예측과 온디바이스 배포를 함께 겨냥할 수 있음을 보여준다.

    예측과 보정모델 공개온디바이스 추론Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update60

    3D 오픈 월드 구축 에이전트를 평가·훈련하는 VibeWorlding이 제시됐다

    • 대화형 3D 오픈 월드를 처음부터 구축하는 멀티모달 에이전트용 평가 체계가 제시됐다.
    • VWE-BENCH와 강화학습 기반 훈련 프레임워크를 함께 공개했다.

    멀티모달 에이전트의 역량을 대화형 3D 환경 구축이라는 복합 과제로 평가하고, 같은 영역의 훈련까지 연결할 수 있는 틀을 제공한다.

    AI 에이전트벤치마크와 평가멀티모달 모델강화학습Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update60

    일본어 장편 영상 이해를 평가하는 NARU 벤치마크가 나왔다

    • 일본어 장편 영상의 서사 전개와 문화적 맥락 이해를 평가하는 NARU 벤치마크가 제시됐다.
    • NARU는 총 146.8시간의 영상 155개를 바탕으로 한 질문 1,481개로 구성된다.
    • 구축 과정에는 원어민 주석자 68명이 참여한 두 단계의 검증이 포함됐다.

    멀티모달 모델 평가 범위를 개별 품질이나 일반 과제 성능에서 장편 영상의 서사 및 문화 이해로 넓힌다.

    벤치마크와 평가멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update56

    영상·오디오 생성을 인간 선호로 평가하는 VA-Judger가 공개됐다

    • 영상·오디오 공동 생성 결과를 인간 선호에 맞춰 평가하는 통합 보상 모델 VA-Judger가 제안됐다.
    • 도메인 내·외 비교를 지원하는 VA-Judger-Bench와 인간 선호 데이터셋 VAPref-10K가 함께 공개됐다.
    • 보고된 실험에서 VA-Judger는 개별 지표를 결합한 기준선보다 인간 선호를 더 잘 예측했다.

    개별 품질 지표가 놓칠 수 있는 프롬프트 충실도와 영상·오디오의 의미적·시간적 일관성을 인간 선호에 맞춰 평가할 기반이 마련됐다.

    벤치마크와 평가멀티모달 모델강화학습Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update55

    단안 영상에서 4D 인체를 복원하는 4DAnyone이 공개됐다

    • 보정되지 않은 일상 단안 영상에서 사람의 4D 모습을 복원하는 프레임워크가 소개됐다.
    • 다중 시점에서 일관된 영상을 생성한 뒤 4D 가우시안 스플래팅으로 변환한다.
    • 참조 문맥 패킹과 목표 문맥 라우팅으로 다중 시점 일관성을 구현한다.

    멀티모달 모델의 활용 범위가 생성 결과 평가를 넘어 일상 영상 기반의 4D 인체 복원으로 확장됐다는 점에서 의미가 있다.

    멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update55

    WithEveryone이 최대 10명의 정체성을 계획해 단체 이미지를 생성한다

    • 최대 10명의 참조 인물을 한 장의 단체 이미지에 생성하는 통합 프레임워크를 제시했다.
    • 정체성 토큰과 구조화된 정체성-레이아웃 계획, 레이아웃 기반 감독으로 각 인물의 배치와 정체성을 연결한다.

    멀티모달 이미지 생성의 초점이 결과 평가를 넘어, 여러 참조 인물의 정체성과 배치를 명시적으로 계획하는 방식으로 확장됐다.

    모델 공개멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update55

    동결된 LLM의 에이전트 하네스를 세 계층에서 진화시키는 HSI가 공개됐다

    • 동결된 LLM 주변의 작업별 에이전트 하네스를 지속적으로 개선하는 프레임워크를 제시했다.
    • 하네스, 이를 재작성하는 진화기, 진화 전략을 바꾸는 메타 진화기의 세 계층으로 구성된다.
    • 여러 중간 난도 BALROG 과제에서 성능 향상을 보고했다.

    기반 LLM을 변경하지 않고도 작업별 에이전트의 동작 구조와 개선 전략을 함께 발전시키는 접근을 제시한다.

    AI 에이전트강화학습Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research52

    수술 영상과 기구 궤적을 함께 예측하는 모델이 제시됐다

    • 미래 수술 영상과 기구 궤적을 함께 예측하는 초기 월드-액션 모델이 제시됐다.
    • 분할 자기회귀 롤아웃은 일괄 예측보다 첫 구간 PSNR을 18.86에서 23.11dB로 높이고 ADE를 45.77에서 22.22픽셀로 줄였다.

    영상과 궤적을 함께 예측하는 접근은 멀티모달 예측과 로봇 인식을 하나의 모델에서 연결한다.

    예측과 보정멀티모달 모델로봇 인식Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    컴퓨터 사용 기록에서 과제 모델을 복원하는 Task Model Induction이 발표됐다

    • 제약 없는 컴퓨터 사용 기록에서 서로 뒤섞인 잠재 과제를 발견하는 방법을 제시했다.
    • 발견한 과제로부터 재사용 가능한 계층적 목표 모델과 절차 모델을 복원한다.

    에이전트의 자연스러운 사용 기록을 구조화되고 재사용 가능한 과제 모델로 바꾸는 접근을 제공한다.

    AI 에이전트Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    AI4AI-Bench가 에이전트의 학습 알고리즘 설계 능력을 평가한다

    • 10개의 고정 연구 저장소에서 LLM 에이전트의 학습 알고리즘 재설계 능력을 평가한다.
    • 6개 시스템의 29개 구성을 10개 알고리즘 설계 과제에서 비교했다.

    에이전트 평가 범위가 도구 사용과 행동 관찰을 넘어 학습 알고리즘 자체를 설계하는 능력으로 확장된다.

    AI 에이전트벤치마크와 평가강화학습Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    MidTool이 범용 에이전트 도구 사용을 위한 중간 학습 데이터 파이프라인을 제시했다

    • 실제 도구 API, MCP 스킬, 문서 기반 워크플로를 활용해 범용 에이전트의 도구 사용 중간 학습 코퍼스를 구축하는 파이프라인을 제시했다.
    • MidTool-Mix는 BFCL, tau2-Bench, MCP Universe에서 지도 미세조정과 강화학습 모두의 후속 도구 사용 성능을 일관되게 개선했다.

    도구 사용 데이터를 중간 학습에 활용하면 지도 미세조정과 강화학습 모두에서 후속 도구 사용 성능을 개선할 수 있음을 보여준다.

    AI 에이전트모델 컨텍스트 프로토콜Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    자기 개선 성과를 측정된 귀무 기준으로 감사하는 방법이 제안됐다

    • 자기 개선의 문제별 전이 결과가 측정 실패로 인해 반대로 해석될 수 있다고 보고했다.
    • 각 통계량을 별도로 측정한 귀무 기준과 대조하는 감사 방법을 제안했다.

    자기 개선 벤치마크의 결과가 실제 향상인지 측정 인공물인지 구분하려면 평가 통계량과 귀무 기준을 함께 점검해야 한다.

    벤치마크와 평가대형 언어 모델Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    수술 장면과 기구 궤적을 함께 예측하는 모델이 제시됐다

    • 수술 장면의 시각 상태와 기구 궤적을 함께 예측하는 구조가 제시됐다.
    • 청크 단위 자기회귀 예측은 일괄 예측 대비 첫 구간 PSNR을 18.86에서 23.11dB로 높이고 ADE를 45.77에서 22.22픽셀로 줄였다.

    시각 상태와 기구 움직임을 함께 예측하면 수술 동작 계획에 필요한 장면 변화와 궤적을 하나의 구조에서 다룰 수 있다.

    예측과 보정멀티모달 모델로봇 인식로봇 조작Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    문서 지식을 검색 없이 내재화하는 3단계 사후학습 방법이 발표됐다

    • 한정된 문서 집합의 지식을 모델에 내재화해 검색 없이 질의응답하는 단계적 사후학습 방법이 제시됐다.
    • 프레임워크는 문서 지식 주입, 질의응답 행동 정렬, 일반 능력 회복의 세 단계로 구성된다.

    외부 문서 검색에 의존하는 RAG와 달리, 한정된 문서 지식을 모델 내부에 담아 질의응답하는 접근을 제시했다.

    대형 언어 모델검색 증강 생성Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    FlashPrefill V2가 장문맥 LLM 프리필 가속 성능을 공개했다

    • 블록 희소 프리필 어텐션에 FP8 추론, 페이지드 KV 캐시, 연속 배칭 지원을 결합했다.
    • NVIDIA H20의 128K 문맥 평가에서 FlashAttention-2 대비 FP8 기준 최대 47.26배, BF16 기준 최대 27.19배의 속도 향상을 보고했다.

    장문맥 LLM 서빙의 프리필 병목을 줄이면서 페이지드 KV 캐시와 연속 배칭을 함께 지원해, 현대적 추론 프레임워크의 어텐션 백엔드로 활용할 가능성을 보여준다.

    AI 인프라대형 언어 모델Source quality80%1 source
  • Update50

    ASR 모델의 벤치마크 조건화 행동을 정량화한 연구가 발표됐다

    • 주요 오픈소스 ASR 모델이 음성이 모순되거나 가려지거나 모호한 상황에서도 벤치마크 참조 전사의 일부를 재현하는 행동이 관찰됐다.
    • 연구진은 행동적·기계론적 프로브를 통해 이러한 벤치마크 조건화 행동을 탐지하고 인과적으로 변화시킬 수 있다고 보고했다.

    높은 벤치마크 점수가 실제 환경에서의 범용 전사 능력 향상을 그대로 뜻하는지 평가할 때, 음향 증거보다 참조 문구를 우선하는 행동도 함께 점검해야 한다.

    벤치마크와 평가해석가능성Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    접촉 위상으로 다지 그립을 생성하는 CoToGrasp가 발표됐다

    • 접촉 위상을 조건으로 다양하고 안정적인 다지 그립을 생성하는 CoToGrasp가 발표됐다.
    • 물체별 주석 없이 학습하고, 보지 못한 물체에 제로샷 일반화하는 방식을 제시했다.
    • 생성한 그립의 물리적·운동학적 실행 가능성을 실제 로봇에서 검증했다.

    기능적 의도와 물체 형상을 분리해 학습함으로써, 새로운 물체에도 적용할 수 있는 다지 그립 생성의 가능성을 보여준다.

    로봇 조작Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    정적 에이전트 학습 환경을 재구성하는 EnvHarness가 공개됐다

    • EnvHarness는 기존 검증기를 유지하면서 정적인 에이전트 학습 환경을 재구성하는 프로그래밍 가능 계층을 제시했다.
    • EnvRigger는 환경 재구성에 필요한 구성요소를 자동으로 합성한다.

    에이전트 학습의 개선 범위를 추론과 보상 최적화뿐 아니라 환경 구성 자체로 확장한다.

    AI 에이전트강화학습Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    다음 패치 임베딩 예측 기반 오디오 학습법 NAPE가 공개됐다

    • 앞선 로그 멜 스펙트로그램 패치로 다음 패치 임베딩을 예측해 오디오 표현을 학습한다.
    • 인과적 트랜스포머를 활용한 간결한 자기지도 학습 방식으로 NAPE를 제시했다.

    멀티모달 모델의 논의 범위를 이미지 생성에서 자기지도 오디오 표현 학습으로 넓힌다.

    멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    MemTrapBench가 LLM 기억의 인지적 함정을 평가했다

    • MemTrapBench는 검색된 기억이 LLM의 추론 고착과 믿음 왜곡을 유발하는지를 평가한다.
    • 두 모델 계열과 다섯 기억 프레임워크에서 모든 기억 전략이 무기억 설정보다 낮은 성능을 보였으며, 가장 강한 방법도 10% 넘게 하락했다.
    • 논문은 이러한 인지적 함정을 줄이기 위한 추론 시점 기법 AdaptiveMem도 제시했다.

    기억의 재사용이 항상 추론 성능을 높이는 것은 아니므로, 에이전트 메모리는 저장·검색뿐 아니라 기억이 판단을 왜곡하는지도 함께 평가해야 한다.

    에이전트 메모리벤치마크와 평가대형 언어 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    PolicyGuide가 에이전트 안전장치를 전체 워크플로로 확장했다

    • PolicyGuide는 도메인 정책을 워크플로 그래프로 바꾸고, 사용자 턴 경계에서 선제적 검증을 수행한다.
    • 항공·소매·통신 평가에서 GPT-5.4 에이전트의 평균 Pass^4가 0.42에서 0.62로 상승했다.
    • 같은 워크플로를 Claude Sonnet 4.6과 Gemini 2.5 Pro 에이전트에도 적용했다.

    다단계 고객 서비스에서는 금지된 행동뿐 아니라 신원 확인이나 사용자 확인 같은 필수 절차의 누락도 정책 위반이 될 수 있다.

    AI 에이전트AI 안전벤치마크와 평가Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    과학 소프트웨어 코딩 에이전트를 평가하는 SWE-bench Science가 공개됐다

    • 20개 과학 분야의 GitHub 저장소 98곳에서 수집한 119개 과제로 과학 소프트웨어 엔지니어링 역량을 평가한다.
    • 평가된 최고 성능 조합인 Claude Code와 Opus-5(max)도 pass@1 50%를 넘지 못했다.

    최고 성능 에이전트도 절반 이상의 과제를 해결하지 못해, 과학 지식과 저장소 수준 통합을 함께 다루는 코딩 에이전트의 한계를 보여준다.

    AI 에이전트벤치마크와 평가과학 AISource quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    FACET이 실행 가능한 터미널 에이전트 과제 합성 프레임워크를 제시했다

    • FACET은 공유 컨테이너 상태를 바탕으로 터미널 에이전트 학습 과제를 구성한다.
    • 실행 검증과 표적 수리를 통해 지시문·환경·해답·검증기 사이의 일관성을 유지한다.

    에이전트 평가 과제를 확장할 때 과제 설명과 실제 실행 환경 사이의 불일치를 줄이는 데 의미가 있다.

    AI 에이전트벤치마크와 평가Source quality80%1 source
  • Update50

    구조화 사전 지식으로 실시간 객체 탐지기의 분포 밖 객체를 판별했다

    • 사전학습 객체 탐지기의 잠재 사전 지식을 해석 가능한 5차원 표현으로 구성해 분포 밖 객체를 탐지한다.
    • 평가된 객체 탐지기 구조와 벤치마크에서 최고 수준의 분포 밖 탐지 성능을 달성했다.

    로봇 인식 시스템이 학습 분포에서 벗어난 객체를 식별하는 능력을 높이면서, 그 판단에 쓰인 사전 지식을 해석할 수 있게 한다.

    AI 안전해석가능성멀티모달 모델로봇 인식Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    음악 편집의 문맥 보존을 평가하는 MuseCPEval이 제안됐다

    • 음악 편집 시스템이 유지해야 할 음악적 요소를 보존하는지 평가하는 다면 프레임워크를 제시했다.
    • 음악 문맥의 여러 측면을 측정하도록 맞춤형 지표를 구성했다.

    벤치마크의 평가 범위를 성능 비교뿐 아니라 음악 편집 과정의 문맥 보존 여부까지 구체적으로 측정하는 방향으로 넓힌다.

    벤치마크와 평가멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    BATON이 하위 과제 탐색과 전환 인식 메모리로 장기 로봇 조작을 구성했다

    • BATON은 장기 로봇 조작을 하위 과제로 나눠 각각 짧은 지평에서 탐색하고 해결책을 메모리에 저장한다.
    • 전환 인식 메모리가 하위 과제 내부의 모델 호출 시점과 과제 사이의 상태 인계를 관리한다.
    • 개별 해결책을 조합해 전체 과제의 탐색 비용을 단계 수에 대해 곱셈적 증가에서 덧셈적 증가로 바꾼다.

    하위 과제별 해결책을 재사용하고 실패를 특정 단계에 귀속할 수 있어 장기 로봇 조작의 탐색과 문제 진단을 더 체계적으로 구성할 수 있다.

    에이전트 메모리AI 에이전트로봇 조작Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    생성 텍스트에 내부 상태의 출처 증거를 담는 개념증명이 나왔다

    • 인증된 인과적 내부 상태의 증거를 답을 바꾸지 않고 생성 텍스트의 통계적 패턴에 담는 개념증명이 제시됐다.
    • 두 통제 아키텍처는 공개 평가와 별도로 봉인된 보호 평가에서 각각 128개 대응 쌍을 모두 통과했다.

    내부 상태의 출처를 생성 결과에서 확인할 가능성을 보여줘, 상태 출처 추적과 내부 동작 해석 연구에 근거를 보탠다.

    해석가능성AI 안전Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    규정 준수 탐지기의 ‘규칙 맹목성’이 확인됐다

    • 규정 준수 가드와 활성화 프로브를 감사한 연구가 적용 규칙을 바꿔도 판정이 거의 달라지지 않는 ‘규칙 맹목성’을 보고했다.
    • 연구진은 탐지기가 실제 규칙을 반영하는지 검증하기 위한 반사실적 시험 프로토콜을 공개했다.

    규정 준수 여부를 판정하는 시스템이 실제 적용 규칙을 읽는지 별도로 검증해야 함을 보여준다.

    AI 안전벤치마크와 평가해석가능성Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    프로테우스, 긴 문맥에 맞춰 신경망 메모리를 점진적으로 확장

    • 문맥이 길어질수록 신경망 메모리의 유효 용량을 점진적으로 확장하는 증분 메모리 활성화를 제안했다.
    • 여러 신경망 메모리 아키텍처에서 일관된 성능 개선을 보고했으며, 긴 문맥에서 개선 폭이 특히 컸다.

    긴 문맥에서 메모리 용량을 한꺼번에 제공하지 않고 점진적으로 활성화하는 새로운 접근을 제시했다.

    에이전트 메모리대형 언어 모델Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Research50

    범용 VLA를 휴머노이드 전신 제어에 적응시키는 HAF가 발표됐다

    • HAF는 계층적 행동 흐름 생성으로 이동·허리 자세·양팔 조작의 운동학적 의존성을 유지한다.
    • 기반 VLA를 고정하고 DCT로 축소한 잠재 공간에서 강화학습해 실제 휴머노이드 전신 이동·조작에 적응한다.
    • 일곱 가지 실제 과제에서 단일 단계 VLA 기준선보다 전신 협응과 과제 성능을 개선했다.

    서로 강하게 연결된 휴머노이드의 이동과 조작을 더 일관되게 조정하고, 범용 VLA를 실제 전신 과제에 적응시키는 접근을 제시한다.

    로봇 조작강화학습Source quality95%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    SA-MRPO가 다중 보상 최적화의 포화 목표 비중을 낮췄다

    • SA-MRPO는 보상 목표를 각각 표준화하고, 추정된 포화도에 따라 목표별 기여도를 조절한다.
    • GDPO와 비교한 수학 추론 15개 조건 중 12개에서 더 어려운 정확성 목표가 개선됐으며, 적응형 추론 5개 벤치마크와 코딩 벤치마크에서도 성능 향상이 보고됐다.

    이미 만족된 목표의 성능을 대체로 유지하면서, 개선 여지가 큰 목표에 학습 노력을 집중하는 다중 보상 최적화 방법을 제시했다.

    강화학습벤치마크와 평가Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    TRACE-Bench가 다중 참조 이미지 생성 능력을 연산자별로 진단한다

    • 다중 참조 이미지 생성을 Anchor, Disentangle, Apply, Compose의 네 연산자로 정식화했다.
    • 631개 수식 템플릿과 약 4,000개 참조 이미지로 약 1,600개 평가 사례를 구성했다.
    • 아홉 모델 평가에서 장면 수준 합성보다 분리와 속성 결합이 주요 병목으로 나타났다.

    단일 종합 점수를 넘어 다중 참조 이미지 생성 모델이 어느 연산 단계에서 실패하는지 구분해 비교할 수 있다.

    벤치마크와 평가멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    미래 장면 예측을 학습에 내재화한 영상 추론 방식이 제시됐다

    • 학습 단계에서 부분 영상으로 미래 프레임의 잠재 표현과 텍스트 답변을 함께 예측한다.
    • 추론 단계에서는 미래 프레임을 생성하거나 재인코딩하지 않고 답을 직접 출력한다.
    • 보고된 여섯 평가 조건에서 직접 답변 파인튜닝을 개선하고, 명시적 Visual CoT보다 평균 종단 지연을 5배 넘게 줄였다.

    미래 장면을 활용하는 선제적 영상 추론에서 직접 답변 경로를 유지해 정확도와 지연 사이의 부담을 줄일 수 있다.

    멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    UI-Mate가 오픈 웨이트 GUI 에이전트의 새 성능 기준을 제시했다

    • UI-Mate는 환경 기반 학습과 문맥 내 시연을 결합한 오픈 웨이트 GUI 에이전트다.
    • UI-Mate-27B는 OSWorld-Verified 77.0%, WindowsAgentArena 66.2%를 기록했다.
    • OSWorkerBench에서는 엄격 성공률 41.0%, 진행률 76.9%로 기반 모델을 각각 17.7점, 24.5점 앞섰다.

    오픈 웨이트 GUI 에이전트가 일반 컴퓨터 사용과 장기 사무 작업에서 어느 수준까지 도달했는지 비교할 근거를 제공한다.

    AI 에이전트벤치마크와 평가문맥 내 학습멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    StateM이 실행 하네스 확장에 따른 장기 에이전트 성능 향상을 보고했다

    • StateM은 모델 가중치를 바꾸지 않고 실행 하네스를 확장하는 접근을 제시했다.
    • 지속 실행 상태, 검증된 전환, 재사용 가능한 런북이 여러 모델 계열의 장기 지평 에이전트 성능을 높였다고 보고했다.

    장기 과제의 성능을 높이는 수단이 모델 자체뿐 아니라 실행 상태와 전환, 절차를 관리하는 하네스 설계에도 있음을 보여준다.

    AI 에이전트에이전트 메모리벤치마크와 평가Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    ForgeWM이 소수 단계 행동 조건부 비디오 생성을 제시했다

    • ForgeWM은 행동 조건부 비디오 월드 모델을 1·2·4회 디노이징 단계로 구동하는 점진적 프레임워크다.
    • 점진적 인과 학습과 증류를 결합해 제어 가능한 저지연 비디오 생성을 지향한다.

    멀티모달 비디오 모델에서 증류를 활용해 생성 단계를 줄이면서도 행동에 따른 제어 가능성을 다루는 새로운 접근이다.

    증류멀티모달 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    자율 연구 에이전트의 실패를 전 과정에서 진단하는 AutoResearchEval이 공개됐다

    • 7개 과학 분야의 실제 연구 과제 100개로 자율 연구 에이전트의 전 과정을 평가한다.
    • 8개 하네스-모델 조합에서 수집한 에이전트 궤적 800개를 45개 실패 양상으로 분석했다.
    • 실패 양상은 연구 결과와 경로를 점검·수정·의심하는 메타인지 루프의 부재로 수렴했다.

    최종 성과만 재는 평가를 넘어, 자율 연구 에이전트가 어느 과정에서 실패하는지 진단할 수 있다. 반복된 메타인지 루프의 부재는 향후 에이전트 개선에서 점검·수정 능력이 핵심 과제임을 보여준다.

    AI 에이전트벤치마크와 평가과학 AISource quality80%1 source
  • Update50

    시계열 기반모델의 예측 붕괴와 CalibRank가 제시됐다

    • 연구진은 예측 가능성이 낮은 다수의 시계열을 함께 다룰 때 점 예측이 평평해지고 횡단면 순위 성능이 저하되는 ‘예측 붕괴’를 분석했다.
    • 보정된 예측 진폭과 횡단면 순위 성능의 균형을 맞추는 목적함수 CalibRank를 제안했다.
    • Finance1K 평가에서 CalibRank는 예측 진폭을 목표에 가깝게 유지하면서 시험된 모든 모델의 횡단면 상관을 개선했다.

    시계열 모델은 평균 오차만으로 평가할 경우 횡단면의 상대적 순위를 구별하는 능력을 놓칠 수 있다. CalibRank는 보정과 순위 성능을 함께 평가하고 최적화할 수 있는 방향을 제시한다.

    예측과 보정벤치마크와 평가Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    SimpleOPD가 토크나이저 비종속 온-정책 증류를 제시했다

    • 서로 다른 토크나이저를 쓰는 교사·학생 모델을 공유 텍스트 범위로 정렬하는 온-정책 증류 기법을 제안했다.
    • Qwen3·Qwen3.5·Intern-S2·GLM-4.7·Gemma-4 계열에서 수학 추론 성능이 일관되게 향상됐고 과학 벤치마크에서도 개선이 관찰됐다.

    교사와 학생의 토크나이저가 달라도 증류할 수 있어, 서로 다른 모델 계열 사이에서 추론 능력을 이전하는 데 활용될 수 있다.

    증류대형 언어 모델Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    에이전트의 대기 시간을 병렬 추론에 쓰는 Second Thought가 발표됐다

    • ReAct 에이전트가 행동과 관찰을 기다리는 동안 네 개의 보조 추론 분기를 병렬로 실행한다.
    • 세 벤치마크와 세 추론 모델을 조합한 아홉 조건 모두에서 평균 턴 수가 감소했다.
    • 일곱 조건에서는 Pass@1의 유의미한 변화가 없었고, 나머지 두 조건에서는 각각 12.4점과 10.2점 상승했다.

    환경 응답을 기다리는 시간을 미래 턴의 추론에 활용해 에이전트의 순차 디코딩과 평균 턴 수를 줄일 가능성을 보여준다.

    AI 에이전트Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    법률 인용 검증에서 특정 인용면 탐지의 취약성이 확인됐다

    • 통제된 평가에서 모델은 잘못된 판례를 찾는 데 비해 근거가 맞지 않는 특정 인용면을 탐지하는 데 더 취약했다.
    • 법률 인용 검증 성능은 판례 식별과 명제 수준의 인용면 검증을 구분해 평가할 필요가 있음을 보여준다.

    최종 답변의 정확도만으로는 드러나지 않는 인용 근거의 세부 오류를 별도로 측정해야 한다는 평가 과제를 제시한다.

    벤치마크와 평가AI 안전Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문
  • Update50

    D-SCAN이 문서 수준 어텐션 붕괴로 RAG 오염을 탐지했다

    • D-SCAN은 공격받은 RAG 생성에서 어텐션이 오염 문서에 집중되고 엔트로피가 낮아지는 현상을 탐지 신호로 활용한다.
    • 최종 답을 바꾸지 못한 공격 시도도 문서 수준 어텐션 동역학을 통해 탐지할 수 있다고 보고했다.

    출력만 검사해서 놓칠 수 있는 RAG 오염 시도를 모델 내부의 문서 수준 신호로 포착할 수 있다는 점에서 의미가 있다.

    검색 증강 생성AI 안전해석가능성Source quality80%1 source

    브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.

    원문

PolicyGuide가 에이전트 안전장치를 전체 워크플로로 확장했다 선택됨