Gorio Tech Blog search

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 요약 설명

|

목차

이번 글에서는 Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 논문의 핵심 포인트만 간단히 정리한다.

  • 2026년 8월 27일(Arxiv), arXiv (MirroS Technical Report)
  • Wang, Hanyang, Cai, Yimo, Chen, Weiliang, Chi, Jiawei, Sun, Haowen, Dai, Qiyu, Hung, Yi-Hsin, Guo, Xingzhuo, Ren, Jinshan, Yao, Runmao, et al.
  • MirroS, Tsinghua University, Peking University, Nanyang Technological University
  • 논문 링크
  • Github
  • Project Page

요약

  • 현대 비전-언어 모델은 물리 현상을 인식하고 설명할 수 있지만, 물체 상태·물리 파라미터·동역학처럼 관측을 만들어 내는 기제를 명시적으로 표현하기 어렵다. 이 논문은 물리적 구성, 동적 진화, 시각적 외관을 실행 가능한 코드로 기술하는 Code-as-World를 제안한다. 텍스트 또는 실제 비디오를 입력받은 에이전트는 세계 가설을 제안하고, 시뮬레이터에서 실행·렌더링·검증·수정하여 증거와 부합하는 실행 가능한 세계 표현을 탐색한다. 저자들은 검증된 세계에서 얻은 정확한 상태와 궤적으로 비전-언어 모델을 학습했으며, Code-as-World-VL-27B (Reasoning)가 QuantiPhy-validation에서 평균 MRA 58.6을 기록해 논문에서 비교한 모델 가운데 가장 높은 성능을 보였다고 보고한다.

In Search of Physical World Representations

  • 논문은 물리 세계 표현을 픽셀, 3D 재구성, 자연어의 세 계열로 구분한다. 픽셀 기반 미래 예측은 사실적인 영상을 생성할 수 있지만, 카메라 이동과 물체 이동 또는 가림과 소실처럼 서로 다른 원인이 유사한 관측을 만들 수 있으므로 물리적 기제를 명시하지 않는다. 3D 재구성은 기하와 시점 정보를 보존하지만 낙하와 충돌의 원인을 설명하지 않으며, 자연어는 의미적이고 조합적인 추상화에는 적합하지만 연속적인 위치·속도·접촉 관계·물리 파라미터를 정밀하게 표현하기 어렵다. 저자들은 물리 지능을 위해 의미, 구조, 시간적 변화 및 생성 기제를 함께 나타내는 표현이 필요하다고 주장한다.

이 그림은 물리 세계를 표현하는 네 가지 방식을 비교합니다. 픽셀과 3D 재구성은 관측이나 기하를 보존하지만 물리적 생성 과정을 직접 드러내기 어렵고, 자연어는 의미 관계를 표현하는 대신 연속적인 상태와 파라미터를 정밀하게 다루기 어렵습니다. Code-as-World는 물체와 환경의 구성, 시간에 따른 변화, 관측 방식을 실행 코드로 함께 기술하려는 접근입니다.

픽셀·3D·자연어·실행 코드 기반 물리 세계 표현의 비교
픽셀·3D·자연어·실행 코드 기반 물리 세계 표현의 비교

Code as Worlds: Executable World Representations

  • Code-as-World의 실행 가능한 세계 표현(EWR)은 p=(C,E,A)로 정의된다. C는 물체, 기하, 크기, 질량, 마찰, 중력과 바닥·벽 같은 환경 구조를 담는 물리적 구성을 뜻한다. E는 초기 상태, 시간에 따른 변화, 힘, 접촉·충돌 사건, 시뮬레이션 시간을 기술하는 동적 진화이고, A는 카메라, 조명, 재질, 배경, 해상도, 프레임레이트처럼 관측 방식을 정하는 시각적 외관이다. 이 분리는 물리 조건이나 초기 속도만 변경해 반사실적 상황을 재시뮬레이션하거나, 동일한 물리 궤적을 다른 시점에서 렌더링할 수 있게 한다. 이 표현은 원본 영상을 픽셀 수준에서 복제하기보다 세계의 구성·제약·진화가 일관되는 물리적 동등성을 목표로 한다.

Agentic Discovery of World Representations

  • 저자들은 세계 표현 복원을 일회성 예측이 아닌 가설 탐색 문제로 다룬다. 텍스트 입력에서는 엔티티, 공간 관계, 물리 사건, 의도한 결과를 의미 증거로 구조화하고, 비디오 입력에서는 깊이 지도, 인스턴스 마스크, 객체 추적 결과와 3D 메시를 이용해 물체의 위치·스케일·운동 상태를 제약한다. 에이전트는 증거와 이전 검증 피드백을 바탕으로 EWR을 제안 또는 수정하고, 이를 시뮬레이터용 파라미터로 변환해 상태 궤적을 실행·렌더링한다. 검증 단계는 텍스트에서 의미·물리 제약을, 비디오에서 RGB·깊이·마스크·이미지 평면 궤적을 비교하며, 프레임별 불일치를 다음 수정에 반영한다. 가설이 증거를 충분히 설명하면서 간결하다고 판단되면 채택하고, 반복 예산 안에 조건을 만족하지 못하면 거부한다.

텍스트 입력에서는 엔티티와 공간 관계, 물리 사건을 구조화하고, 비디오 입력에서는 깊이·마스크·추적·메시를 이용해 세계 가설을 제약합니다. 에이전트는 실행 가능한 세계 표현을 시뮬레이터에서 실행하고 렌더링한 뒤, 입력 증거와의 불일치를 다음 수정에 반영합니다. 이 반복은 충분히 설명력 있고 간결한 가설을 채택하거나 반복 예산 안에 맞지 않는 가설을 거부할 때까지 이어집니다.

텍스트 및 비디오 증거로부터 실행 세계를 반복적으로 발견하는 과정
텍스트 및 비디오 증거로부터 실행 세계를 반복적으로 발견하는 과정

반복 발견 방식은 이전 라운드의 검증 피드백을 다음 세계 가설에 반영하는 반면, Best-of-5 비교는 같은 평가 예산으로 독립적인 후보를 선택합니다. 그림은 라운드가 진행될수록 시각 정렬과 객체·궤적 관련 지표가 어떻게 달라지는지 보여 주며, 저자들은 피드백을 누적하는 폐루프가 독립 표본 선택보다 재구성 충실도에서 유리하다고 보고합니다.

반복 발견 라운드와 독립 표본 선택의 재구성 충실도 비교
반복 발견 라운드와 독립 표본 선택의 재구성 충실도 비교

텍스트로 주어진 장면 명세를 물체·환경·동역학·카메라 설정을 포함한 실행 가능한 세계로 바꾼 뒤, 시뮬레이션 상태를 렌더링한 예시입니다. 같은 물리적 구성과 시간적 진화를 기반으로 시뮬레이션 영상과 더 사실적인 외관의 영상을 만들 수 있어, 물리 추론에 필요한 상태와 관측을 분리해 다룰 수 있습니다.

텍스트 명세에서 시뮬레이션과 사실적 영상을 생성한 사례
텍스트 명세에서 시뮬레이션과 사실적 영상을 생성한 사례

실제 비디오에서는 깊이, 인스턴스 마스크, 추적 결과와 3D 메시를 이용해 관측된 장면을 물리적으로 실행할 수 있는 형태로 추상화합니다. 그림의 각 열은 입력 영상의 관측과 그로부터 얻은 시뮬레이션·렌더링 결과를 대응시켜, 픽셀 복제가 아니라 물체의 상태와 운동을 설명하는 표현을 구성하는 과정을 보여 줍니다.

실제 비디오를 실행 가능한 시뮬레이션으로 추상화한 사례
실제 비디오를 실행 가능한 시뮬레이션으로 추상화한 사례

Application: Learning Quantitative Physical Reasoning

  • 정량 물리 추론에서는 단안 비디오의 픽셀 관측으로 실제 단위의 크기, 변위, 속도, 가속도를 추정해야 한다. 저자들은 먼저 RefCOCO 계열과 GOT-10K의 경계 상자, 마스크, 추적 정보를 질의응답으로 변환해 물체 위치와 픽셀 단위 측정을 지도 미세 조정한다. 다음으로 텍스트 기반 및 비디오 기반의 검증된 EWR에서 동기화된 영상과 세계 상태를 얻고, 물체·시점·물리량·단위를 선택해 세계 단위 질의응답을 구성한다. 이 단계에서는 수치 정확도, 단위 정확성, 응답 형식으로 구성한 보상을 이용해 GRPO로 학습한다. 텍스트 기반 세계는 완전히 관측되는 시뮬레이터 상태로 정확한 물리 라벨을 제공하고, 비디오 기반 세계는 실제 영상의 외관과 운동 분포에 가까운 감독 신호를 제공하도록 설계되었다.

이 예시는 단안 비디오의 픽셀 관측과 물리 사전지식을 결합해 실제 단위의 크기, 변위, 속도 또는 가속도를 묻는 정량 문제를 구성하는 방식을 나타냅니다. 영상의 물체·시점·물리량·단위를 세계 표현의 상태와 연결해, 이미지 공간의 측정값을 세계 단위의 답으로 변환합니다.

단안 비디오와 물리 사전지식을 이용한 정량 물리 추론 문제 예시
단안 비디오와 물리 사전지식을 이용한 정량 물리 추론 문제 예시
  • QuantiPhy-validation의 평균 MRA는 Code-as-World-VL-4B가 50.6, 직접 답변 모델인 9B가 55.4, 추론 과정을 출력하는 27B가 58.6이다. 9B 모델은 표에 제시된 Gemini-3.1 Flash의 54.8보다 높은 평균 점수를 기록했으며, 27B 모델은 비교 대상 중 가장 높은 평균 점수를 기록했다. 다만 27B는 모델 규모와 응답 방식이 4B·9B 직접 답변 모델과 함께 달라졌으므로, 저자들도 이를 추론 과정만의 효과를 통제해 측정한 결과로 해석하지 않는다. Table 4에서는 9B Image-Space Only의 평균이 50.9이고 Full Code-as-World-VL이 55.4로 확인되지만, 바로 아래 본문은 50.9에서 56.8로 향상되었다고 서술해 수치가 충돌한다. 이 글에서는 Table 4의 하위 범주 평균으로 직접 계산할 수 있고 시각자료에서 확인되는 55.4를 채택한다. 데이터 원천 절제에서는 이미지 공간 데이터에 텍스트 또는 비디오 기반 세계 데이터를 각각 추가했을 때 성능이 개선되었고, 두 원천을 함께 사용한 4B와 9B 모델이 각각 50.6과 55.4로 가장 높은 평균 성능을 보였다. 전체 모델은 이미지 공간 측정 벤치마크에서도 1단계 Image-Space 모델보다 높은 점수를 보여, 저자들은 세계 단위 감독이 픽셀 단위 측정 능력도 강화한다고 보고한다.

표는 QuantiPhy-validation의 하위 범주별 평균 성능을 모델 변형과 데이터 원천에 따라 비교합니다. Code-as-World-VL의 텍스트·비디오 세계 감독을 추가한 조건과 이미지 공간 감독만 사용한 조건을 함께 놓아, 세계 단위의 상태와 궤적을 학습한 모델이 정량 물리 추론에서 어떤 차이를 보이는지 확인하게 합니다.

QuantiPhy 하위 범주별 정량 물리 추론 성능 비교
QuantiPhy 하위 범주별 정량 물리 추론 성능 비교

사례의 앞 단계는 영상에서 보이는 픽셀 거리나 위치를 측정하고, 뒤 단계는 실행 가능한 세계 표현의 물리 단위와 상태를 이용해 그 측정값을 보정합니다. 따라서 모델은 화면에 나타난 길이만 보고 답하는 대신 물체의 크기와 운동을 세계 좌표와 단위로 해석합니다.

이미지 공간 측정과 세계 단위 보정을 거친 정량 물리 추론 사례
이미지 공간 측정과 세계 단위 보정을 거친 정량 물리 추론 사례

한계와 확장 가능성

  • 현재 구현은 주로 강체 운동을 다루며, 실제 환경의 미세한 지형 변화, 접촉 기하, 재질 특성, 관측되지 않은 요인까지 시뮬레이터가 충실히 모델링하지는 못한다. 따라서 관측과 렌더링이 국소적으로 잘 맞는 EWR이 실제 물리 기제를 정확히 복원했다는 보장은 없다. 또한 Code-as-World-VL은 에이전트가 발견하고 검증한 결과를 감독 신호로 사용하지만, 가설 구성·시뮬레이션·진단·수정으로 이루어진 발견 절차 자체를 모델 내부 능력으로 학습하지는 않는다. 논문은 향후 유체, 천, 변형체, 연소 등으로 시뮬레이터 인터페이스를 확장하고, 실행 가능한 세계 표현을 물리적으로 일관된 비디오 생성과 숙고형 embodied interaction에 활용하는 방향을 제시한다.

부록

  • 부록은 이미지 공간 감독 데이터와 텍스트·비디오 기반 실행 세계 데이터의 구성 내용을 설명한다. 또한 실행 세계의 관측 정합도와 궤적 충실도, 영상 사실성, 이미지 공간 측정, QuantiPhy 평가, 추론 모델 응답 처리에 관한 실험 프로토콜을 정리한다. 마지막으로 텍스트 기반 sim-to-real 영상 생성, 물리 엔진에서의 반복 발견, 이미지 공간 측정 결과, 여러 데이터 원천의 절제 실험을 추가로 제공한다.

짧은 생각

반복 발견 실험에서 에이전트는 후보를 다섯 번 독립 표본 추출해 고르는 Best-of-5보다 같은 다섯 번의 평가 예산으로 시각 정렬, 객체 IoU, 궤적 오차, 정확도 대부분에서 더 좋은 결과를 보였다. 이는 코드 표현의 유용성이 편집 가능성뿐 아니라, 실행 결과를 관측 증거와 대조하고 수정하는 폐루프에도 있음을 뒷받침한다. 다만 검증이 RGB, 깊이, 마스크, 궤적 정합에 주로 의존하므로, 서로 다른 질량·마찰·반발계수 조합이 유사한 운동을 만드는 식별 불가능성이 얼마나 남는지는 이 실험만으로 판단하기 어렵다. 동일한 관측 정합도를 가진 복수 EWR에 물리 파라미터 개입을 가하고 실제 후속 운동 예측을 비교한다면, 이 방법이 관측 재현을 넘어 기제를 복원하는지 더 직접적으로 평가할 수 있을 것이다.