발화 중 영상을 인식하는 MOSS-VL 모델 계열이 공개됐다
- 발화 중에도 새 영상 프레임을 인식하도록 설계된 MOSS-VL 모델 계열이 공개됐다.
- 기술 보고서와 함께 체크포인트 5종, 학습 커리큘럼, 실시간 추론 코드가 제공됐다.
실시간 영상 이해와 발화를 결합한 모델을 체크포인트와 추론 코드로 직접 검토할 수 있게 됐다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준
실시간 영상 이해와 발화를 결합한 모델을 체크포인트와 추론 코드로 직접 검토할 수 있게 됐다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문이번 로드맵은 MCP 생태계가 에이전트 간 상호작용과 도구 연동을 더 명확하게 다루는 방향으로 확장될 것임을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문VideoGAIA는 멀티모달 모델의 다중 턴 도구 활용 능력을 비교할 기준을 제시한다. 모든 평가 모델이 60% 미만에 머물러 현재 모델의 개선 여지도 드러냈다.
Kobo 단말에서 애플리케이션을 격리해 실행하고 업데이트하는 기반을 제공한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트가 별도 학습 없이 과거에 성공한 절차를 다음 과제에 활용하고, 축적된 스킬의 효용까지 관리할 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문객체별 학습 데이터에 대한 의존을 줄이면서도 새로운 물체에 적용할 수 있는 다지 파지 계획의 가능성을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트의 다단계 추론과 검토를 과학적 관계 발견에 적용한 사례로, AI 에이전트와 과학 AI의 접점을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문디지털 입력의 침해가 인식과 추론을 거쳐 물리적 행동으로 이어질 수 있는 만큼, 연구가 부족한 경계와 방어 우선순위를 함께 파악하는 데 도움이 된다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문주기 구조를 직접 계산하는 소형 모델 설계가 확률적 제로샷 예측과 온디바이스 배포를 함께 겨냥할 수 있음을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 에이전트의 역량을 대화형 3D 환경 구축이라는 복합 과제로 평가하고, 같은 영역의 훈련까지 연결할 수 있는 틀을 제공한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 모델 평가 범위를 개별 품질이나 일반 과제 성능에서 장편 영상의 서사 및 문화 이해로 넓힌다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문개별 품질 지표가 놓칠 수 있는 프롬프트 충실도와 영상·오디오의 의미적·시간적 일관성을 인간 선호에 맞춰 평가할 기반이 마련됐다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 모델의 활용 범위가 생성 결과 평가를 넘어 일상 영상 기반의 4D 인체 복원으로 확장됐다는 점에서 의미가 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 이미지 생성의 초점이 결과 평가를 넘어, 여러 참조 인물의 정체성과 배치를 명시적으로 계획하는 방식으로 확장됐다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문기반 LLM을 변경하지 않고도 작업별 에이전트의 동작 구조와 개선 전략을 함께 발전시키는 접근을 제시한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문영상과 궤적을 함께 예측하는 접근은 멀티모달 예측과 로봇 인식을 하나의 모델에서 연결한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트의 자연스러운 사용 기록을 구조화되고 재사용 가능한 과제 모델로 바꾸는 접근을 제공한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트 평가 범위가 도구 사용과 행동 관찰을 넘어 학습 알고리즘 자체를 설계하는 능력으로 확장된다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문도구 사용 데이터를 중간 학습에 활용하면 지도 미세조정과 강화학습 모두에서 후속 도구 사용 성능을 개선할 수 있음을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문자기 개선 벤치마크의 결과가 실제 향상인지 측정 인공물인지 구분하려면 평가 통계량과 귀무 기준을 함께 점검해야 한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문시각 상태와 기구 움직임을 함께 예측하면 수술 동작 계획에 필요한 장면 변화와 궤적을 하나의 구조에서 다룰 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문외부 문서 검색에 의존하는 RAG와 달리, 한정된 문서 지식을 모델 내부에 담아 질의응답하는 접근을 제시했다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문장문맥 LLM 서빙의 프리필 병목을 줄이면서 페이지드 KV 캐시와 연속 배칭을 함께 지원해, 현대적 추론 프레임워크의 어텐션 백엔드로 활용할 가능성을 보여준다.
높은 벤치마크 점수가 실제 환경에서의 범용 전사 능력 향상을 그대로 뜻하는지 평가할 때, 음향 증거보다 참조 문구를 우선하는 행동도 함께 점검해야 한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문기능적 의도와 물체 형상을 분리해 학습함으로써, 새로운 물체에도 적용할 수 있는 다지 그립 생성의 가능성을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트 학습의 개선 범위를 추론과 보상 최적화뿐 아니라 환경 구성 자체로 확장한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 모델의 논의 범위를 이미지 생성에서 자기지도 오디오 표현 학습으로 넓힌다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문기억의 재사용이 항상 추론 성능을 높이는 것은 아니므로, 에이전트 메모리는 저장·검색뿐 아니라 기억이 판단을 왜곡하는지도 함께 평가해야 한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문다단계 고객 서비스에서는 금지된 행동뿐 아니라 신원 확인이나 사용자 확인 같은 필수 절차의 누락도 정책 위반이 될 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문최고 성능 에이전트도 절반 이상의 과제를 해결하지 못해, 과학 지식과 저장소 수준 통합을 함께 다루는 코딩 에이전트의 한계를 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문에이전트 평가 과제를 확장할 때 과제 설명과 실제 실행 환경 사이의 불일치를 줄이는 데 의미가 있다.
로봇 인식 시스템이 학습 분포에서 벗어난 객체를 식별하는 능력을 높이면서, 그 판단에 쓰인 사전 지식을 해석할 수 있게 한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문벤치마크의 평가 범위를 성능 비교뿐 아니라 음악 편집 과정의 문맥 보존 여부까지 구체적으로 측정하는 방향으로 넓힌다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문하위 과제별 해결책을 재사용하고 실패를 특정 단계에 귀속할 수 있어 장기 로봇 조작의 탐색과 문제 진단을 더 체계적으로 구성할 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문내부 상태의 출처를 생성 결과에서 확인할 가능성을 보여줘, 상태 출처 추적과 내부 동작 해석 연구에 근거를 보탠다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문규정 준수 여부를 판정하는 시스템이 실제 적용 규칙을 읽는지 별도로 검증해야 함을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문긴 문맥에서 메모리 용량을 한꺼번에 제공하지 않고 점진적으로 활성화하는 새로운 접근을 제시했다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문서로 강하게 연결된 휴머노이드의 이동과 조작을 더 일관되게 조정하고, 범용 VLA를 실제 전신 과제에 적응시키는 접근을 제시한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문이미 만족된 목표의 성능을 대체로 유지하면서, 개선 여지가 큰 목표에 학습 노력을 집중하는 다중 보상 최적화 방법을 제시했다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문단일 종합 점수를 넘어 다중 참조 이미지 생성 모델이 어느 연산 단계에서 실패하는지 구분해 비교할 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문미래 장면을 활용하는 선제적 영상 추론에서 직접 답변 경로를 유지해 정확도와 지연 사이의 부담을 줄일 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문오픈 웨이트 GUI 에이전트가 일반 컴퓨터 사용과 장기 사무 작업에서 어느 수준까지 도달했는지 비교할 근거를 제공한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문장기 과제의 성능을 높이는 수단이 모델 자체뿐 아니라 실행 상태와 전환, 절차를 관리하는 하네스 설계에도 있음을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문멀티모달 비디오 모델에서 증류를 활용해 생성 단계를 줄이면서도 행동에 따른 제어 가능성을 다루는 새로운 접근이다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문최종 성과만 재는 평가를 넘어, 자율 연구 에이전트가 어느 과정에서 실패하는지 진단할 수 있다. 반복된 메타인지 루프의 부재는 향후 에이전트 개선에서 점검·수정 능력이 핵심 과제임을 보여준다.
시계열 모델은 평균 오차만으로 평가할 경우 횡단면의 상대적 순위를 구별하는 능력을 놓칠 수 있다. CalibRank는 보정과 순위 성능을 함께 평가하고 최적화할 수 있는 방향을 제시한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문교사와 학생의 토크나이저가 달라도 증류할 수 있어, 서로 다른 모델 계열 사이에서 추론 능력을 이전하는 데 활용될 수 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문환경 응답을 기다리는 시간을 미래 턴의 추론에 활용해 에이전트의 순차 디코딩과 평균 턴 수를 줄일 가능성을 보여준다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문최종 답변의 정확도만으로는 드러나지 않는 인용 근거의 세부 오류를 별도로 측정해야 한다는 평가 과제를 제시한다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문출력만 검사해서 놓칠 수 있는 RAG 오염 시도를 모델 내부의 문서 수준 신호로 포착할 수 있다는 점에서 의미가 있다.
브리핑 열기 — 이 항목은 브리핑으로 작성되지 않았습니다.
원문과학 소프트웨어 코딩 에이전트를 평가하는 SWE-bench Science가 공개됐다 선택됨