강화학습

마지막 검증 2026-08-22

이 화면은 mesh:global · revision revision:77cbb9519ffe1fa521b51d5cbda2398631803079421dd345774b4abe9b5c3099 기준

개요

강화학습은 로봇 정책의 미세조정과 언어 모델의 행동 교정에 활용된다. 이번 연구들은 강화학습의 효과가 적용 단계와 평가 방식에 따라 달라짐을 보여준다.

로봇 정책 최적화

EXIMO는 비전-언어-행동 정책을 탐색, 모방, 최적화의 세 단계로 미세조정한다. 탐색 단계에서는 비전 언어 모델이 긴 과제를 짧은 문제로 나누는 계획자 역할을 하고, 모방 단계에서는 이렇게 수집한 데이터로 정책을 미세조정한다. 마지막 단계에서는 잔차 오프폴리시 강화학습으로 정책을 추가 최적화한다. 실험에서는 세 단계를 절제 평가했으며, 기존 접근법보다 표본 효율성과 최종 성능이 높았다고 보고했다.

저자원 언어 행동 교정

그리스어 추론 연구에서는 지도 미세조정이 질문의 언어로 추론하는 습관을 형성했지만, 요청 형식 누락과 추론 채널로의 답변 유출 같은 결함은 남았다. 검증 가능한 보상을 사용한 강화학습은 형식 누락을 24%에서 2.5%로 줄이고 유출을 3.5%에서 0%로 낮췄다. 이는 종합 정확도만으로는 학습에 따른 행동 변화를 충분히 포착하기 어렵다는 점을 보여준다.

링크된 엔티티

  • EXIMO: VLM Guided Exploration of VLA Policies
  • EXIMO
  • Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

최근 변경