[연구] 우홍욱 교수 연구실(CSI연구실), IROS 2026 과 ECCV 2026 논문 게재 승인
- 소프트웨어융합대학
- 조회수970
- 2026-06-23
CSI연구실(지도교수: 우홍욱,https://csiagentgroup.com)의 논문이 로봇공학 분야 우수학회인 IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)과 인공지능 분야 우수학회인 ECCV 2026 (The 19th European Conference on Computer Vision)에 게재 승인(Accept) 되었습니다.
IROS 논문은 26년 9월 미국 펜실베이니아주 피츠버그의 David L. Lawrence Convention Center에서 발표될 예정이며, ECCV 논문은 26년 9월 스웨덴 말뫼의 Malmö Arena와 Malmömässan에서 발표될 예정입니다.
1. [IROS] 논문 “ROBOBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents”는 소프트웨어학과 윤시형(석박통합과정), 유민종(삼성리서치, 박사), 안상현(석사과정) 연구원이 저자로 참여했습니다.

본 연구에서는 Vision-Language-Action(VLA) 모델과 같은 행동 생성 정책을 실제 로봇 환경에서 강건한 에이전트로 확장하는 ROBOBRIDGE 프레임워크를 제안합니다. 기존 VLA 모델은 행동 예측에는 효과적이지만 실패 복구, 장기 작업 수행, 관측·작업·로봇 변화에 대한 강건성 측면에서 한계를 가지고 있습니다. ROBOBRIDGE는 정책 모델을 재학습하지 않고 외부 orchestration 계층으로 감싸 이러한 한계를 보완합니다.
ROBOBRIDGE는 Monitor, Perceptor, Planner, Controller, Robot Interface의 다섯 개 모듈로 이루어져 있습니다. Perceptor는 관찰을 객체 중심 상태로 변환하고, Planner는 현재 장면과 언어 지시를 바탕으로 primitive plan을 생성합니다. Controller는 VLA, IK solver, scripted policy 등 실제 동작을 생성하는 정책이 들어가는 부분이며, Robot Interface는 Franka Research 3, UR7e와 같은 서로 다른 로봇 플랫폼의 API와 좌표계를 추상화합니다. Monitor는 실행 결과를 확인하고 retry, regenerate, replan, re-perceive 등 계층적 복구 전략을 선택합니다.
핵심적으로 ROBOBRIDGE는 실패 복구를 위한 two-phase monitoring과 장기 작업 수행을 위한 reactive planning with asynchronous perception을 결합합니다. 실패가 감지되면 원인을 진단해 필요한 복구 단계를 선택하고, 환경이 바뀌면 최신 객체 상태를 반영해 이후 primitive를 다시 생성합니다. VLA를 Controller로 사용할 때에는 primitive skill별 LoRA adapter를 적용하는 primitive skill fine-tuning을 통해 domain shift에 대한 민감도를 완화합니다.
LIBERO 및 RoboCasa 시뮬레이션 환경과 실제 Franka Research 3, UR7e 로봇 플랫폼에서의 실험 결과, ROBOBRIDGE는 standalone VLA 및 기존 augmented VLA deployment 대비 일관된 성능 향상을 보였습니다. 이러한 결과는 안정적인 로봇 에이전트가 단순한 action predictor가 아니라 perception, planning, monitoring, recovery가 결합된 실행 구조를 통해 구현될 수 있음을 보여 줍니다.
2. [ECCV]논문 “Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments”은 소프트웨어학과 장진우(석박통합과정), 윤시형(석박통합과정) 연구원과 인공지능학과 노정호(석사과정), 조현석(석박통합과정) 연구원이 저자로 참여했습니다.

본 연구에서는 체화형 에이전트(embodied agents)가 지속적으로 변하는 환경에서 관찰 데이터만으로 적응할 수 있게 하는 MuSix(Multi-Scale Mixture of World Models) 프레임워크를 제안합니다. 이 프레임워크는 기존 월드 모델에 MoE 구조를 접목하면서 물리적 스케일의 월드 모델과 추상적 스케일의 월드 모델 등 다양한 스케일의 월드 모델을 혼합하는 방법과 이들이 유기적으로 진화하도록 지식을 주입하는 방법을 제안합니다.
MuSix는 월드 모델 혼합 부분과 월드 모델 진화 부분으로 이루어져 있습니다. 월드 모델 혼합 부분은 스케일에 따라 라우팅 방식을 조절하는 meta-router와 실제 월드 모델을 라우팅하는 라우터의 2단계 구조로 이루어져 있습니다. 월드 모델 진화 부분에서는 새로운 지식이 스케일 단위로 그룹화된 월드 모델 그룹 각각에 주입되면서 필요하지 않은 기존 지식을 제거하는 intra-scale evolution이 일어나고, 동시에 스케일 간에 지식을 전이하는 inter-scale evolution이 발생합니다.
EmbodiedBench 및 실제 Franka 로봇 조작 환경에서의 실험 결과 MuSix는 기존 SayCanPay 대비 평균 14.51% 높은 작업 성공률을 달성했습니다. 이러한 결과는 MuSix가 지속적으로 변하는 환경에서 체화형 에이전트가 스케일 단위로 월드 모델을 혼합하고 진화하게 하여 실시간으로 적응할 수 있게 하며, 이를 통해 지속적인 환경 변화에도 강건하게 추론할 수 있음을 보여 줍니다.
CSI 연구실은 Embodied AI, Vision-Language-Action Model, Reinforcement Learning 기술을 활용하여 범용 인공지능 에이전트 연구와 로봇 지능 연구 등을 수행하고 있습니다.
우홍욱 | hwoo@skku.edu | CSI Lab | https://csiagentgroup.com







