Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale 요약 설명
30 Jul 2026 | Paper Review Computer-Use Agents Agent Learning Reinforcement Learning Supervised Fine-TuningContents
- 요약
- 1 Introduction
- 2 Related work
- 3 Problem setting: environments, tasks and grounded grading
- 4 Echoverse: the factory and the co-evolution loop
- 5 The environment suite
- 6 Supervised experiments
- 7 Reinforcement learning on the worlds
- 8 Conclusion
- 부록
- 짧은 생각
이번 글에서는 Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale 논문의 핵심 포인트만 간단히 정리한다.
- 2026년 7월 30일(Arxiv), arXiv
- Pandya, Yash, Gupta, Sahil, Harne, Sarthak, Yadav, Archana, Chourasia, Kavyansh, Mozannar, Hussein, Vineet, Vibhav, Abdali, Sara, Rosset, Corby, Lara, Yash, et al.
- Microsoft Research
- 논문 링크
요약
- Echoverse는 computer-use agent 학습을 위해 상태를 보유한 synthetic application을 구축하고, 학습 가능한 world를 environment, task corpus, database-grounded verifier로 정의한다. 논문은 단순한 environment 수보다 행동적 깊이, 목표 capability의 변이, 모델과 world의 공동 진화가 더 중요하다고 주장한다. 12개 world에서 검증한 21,009개 trajectory로 학습한 Qwen3.5-9B 모델은 14개 split 평균이 36.5%에서 67.1%로 향상했으며, 5개 world에서의 RL은 held-out grounded score를 58.8%에서 68.0%로 높였다.
1 Introduction
논문은 중요한 computer use가 대규모 학습 상호작용을 안전하게 지원할 수 없는 로그인 제한 상태형 application에서 발생한다고 주장한다. 따라서 database를 reset하고 검사할 수 있는 통제된 clone을 제안하며, 각 채점 rollout을 모델 실패 또는 environment, task, verifier 결함의 증거로 취급하는 loop를 구성한다.
도식은 1개 graded rollout이 낳는 2개 결과를 분리한다. World 결함은 repair로 전달되고, triage 뒤에도 남은 failure는 모델 학습으로 전달된다. 이것이 핵심 공동 진화 mechanism이다.
2 Related work
Echoverse는 live-web benchmark와 달리 쓰기 가능한 state, 정확한 reset, screenshot 기반 판단 대신 backend data에서 도출한 outcome check를 제공한다. Environment 수를 늘리는 synthetic suite를 보완하되, 특히 workflow 완결성과 같은 내부 품질을 변화시키며, RL 이전에 verifier-filtered rejection-sampled distillation을 사용한다.
3 Problem setting: environments, tasks and grounded grading
문제 설정은 application environment와 world를 구분하며, world에는 task corpus와 verifier가 추가된다. Database state를 진실의 원천으로 삼아 재현 가능한 reset, grounded grading, reward 구성을 가능하게 한다.
3.1 Environments, tasks and worlds
Environment는 E = (S, A, T, O, D0)로 명세하며, 각각 database state, browser action, backend transition function, observation mapping, seeded database를 뜻한다. Task는 자연어 goal g, database-derived reference r, kind κ ∈ {READ, WRITE, READ_WRITE}를 포함하는 τ = (g, r, κ)이고, world는 W = (E, T, V)이다.
3.2 Grounded grading
WRITE task는 pristine D0에서 최종 DT까지의 sqldiff로 필요한 state change를 비교한다. READ task는 보고한 answer와 database-derived reference를 비교하고, READ_WRITE는 2개 score 중 낮은 값을 사용한다. LLM은 screenshot이나 trajectory를 보지 않고 observed output 또는 SQL diff를 reference와 제한적으로 의미 비교만 수행한다.
3.3 Depth, defined operationally
깊이는 feature 수나 시각적 사실성이 아니라 task corpus가 요구하는 모든 workflow를 지원하는 능력으로 조작적으로 정의한다. 필요한 속성은 behavioural fidelity, coherent state, workflow dependency, authoritative state-based verification, domain value이며, machine-checkable claim과 interface-executed task로 지원 여부를 확립한다.
표는 깊이를 시각적 판단이나 feature 수가 아니라 5개 구체적 요구 사항으로 정의한다. 앞의 4개는 workflow의 구조적 지원과 검증을 다루고, domain value는 그러한 작업을 정당화하는 workflow를 결정한다.
4 Echoverse: the factory and the co-evolution loop
Echoverse는 연결된 2개 phase로 구성된다. 먼저 사람이 작성한 seed를 검증된 application으로 compile하고, 이어서 live database에 기반한 grounded task corpus를 생성하고 수정한다. 출시에 이른 뒤에도 graded rollout이 모델 capability gap 또는 결합된 world stack의 결함을 드러낼 수 있으므로, failure는 loop에 남는다.
Factory 그림은 corpus 구축이 task edit에 그치지 않고 environment fix를 유발할 수 있음을 보여준다. 2개 phase 모두 진행 전에 database-grounded check로 반복 검증한다.
4.1 An agent workforce
GitHub Copilot SDK agent는 terminal, Playwright, database tool을 사용하여 builder, verifier, triager, layer-specific fixer 역할을 맡는다. 구축과 검증을 분리해 self-judging을 줄이고, triage는 공통 원인을 찾아 1개 repair가 여러 task를 해결할 수 있게 한다. 사람의 감독과 QA도 추가적인 oversight를 제공한다.
4.2 Phase 1: building the environment
Phase 1은 seed scenario를 specification과 machine-checkable claim으로 확장한 뒤, React interface와 FastAPI 및 SQLite backend를 생성한다. Claim의 최소 95%가 통과하고 hard blocker가 없을 때 world가 다음 단계로 진행한다. Claim은 target workflow에 필요한 route, state, behaviour를 다룬다.
4.3 Phase 2: growing the corpus
Phase 2는 live database에 존재하는 entity에 맞추어 task goal을 2개 item으로 reground하고, entity 존재 여부, 개연성, 난이도, UI 실행 가능성을 검사한다. White-box verifier agent는 UI를 조작하면서 source와 database state를 검사한다. 실패는 database, backend, frontend, task text, verifier에 배정하며, 남은 corpus의 최소 95%가 통과할 때까지 수정한다.
4.4 Seeding
ECHOSTAY는 InsideAirbnb data를 사용하고, ECHOFORUM은 2.55 million comments의 public corpus를 사용한다. Mail, calendar, banking, health record 등 적합한 public data가 없는 domain은 placeholder row가 아니라 조밀하고 내부적으로 일관된 state를 만들도록 제약 아래 seed한다.
4.5 Determinism, isolation and reset
모든 rollout은 task별로 격리된 database copy를 사용하므로 task 간 오염을 막고 정확한 재현을 가능하게 한다. Seed-data 변경은 grounding database의 재생성, 재검증, 재배포를 유발하므로 corpus와 배포 artefact가 서로 어긋나지 않는다.
4.6 One rollout, two signals
각 failure는 모델 또는 world stack에 귀속한다. 도달할 수 없는 goal, 고장 난 interface, 잘못된 verifier를 supervision으로 취급하면 environment noise가 capability target이 되므로, system은 모호한 경우를 수정한다.
4.7 Repair before training, and why one fix clears many tasks
학습 전에 repair를 수행하며, pass rate를 높이기 위해 goal을 약화하는 일은 금지한다. Triage는 공통 원인을 우선시한다. 예를 들어 고장 난 interaction control은 겉보기에는 다른 여러 task를 막을 수 있으므로, 이를 고치면 corpus validity와 supervision quality를 함께 높일 수 있다.
4.8 From tasks to trajectories
검증 뒤 GPT-5.4가 live world에서 task를 해결하고, grounded verifier를 통과한 trajectory만 supervised data가 된다. 이는 verifier-filtered rejection-sampled distillation이다. Factory feasibility check는 teacher의 성공이 아니라 task 존재 여부를 결정하지만, 결과 모델은 여전히 teacher의 성공 demonstration 범위에 제한된다.
5 The environment suite
Suite는 10개 깊이 있는 full-domain world와 2개 capability world로 구성된다. Full domain은 communication, technical operation, regulated transaction, community, media, travel의 상태형 workflow를 모델링한다. Capability world는 단일 application에서 변이를 얻기 어려운 control을 분리한다.
5.1 Ten deep domains
10개 domain은 ECHOMAIL, ECHOCALENDAR, ECHOCHAT, ECHOML, ECHOFORGE, ECHOBANK, ECHOCARE, ECHOFORUM, ECHOTUNES, ECHOSTAY이다. 이들의 workflow는 흔히 5~30개 action을 거치며, screen, user, permission, history, backend state 전반에서 지속되는 효과를 요구한다.
Suite는 4개 workflow category를 포괄하고, 각 category가 보존해야 할 상태형 구조를 식별한다. 이는 domain이 product replica가 아니라 workflow 중심으로 구성된다는 주장을 뒷받침한다.
처음 10개 panel은 full-domain application을, 마지막 2개 panel은 capability world의 held-out rendering을 나타낸다. 이 배치는 workflow depth와 control-level variation의 의도된 구분을 보여준다.
배포된 database row count는 수천에서 수백만 row에 이르는 비자명한 grounded state를 보여준다. ECHOFORUM은 4.0M row, ECHOSTAY는 180K row이며, 표는 domain별 entity도 기록한다.
5.2 Two capability worlds
Datepicker world는 10개 context, 100개 frontend, 6개 visual style에 걸쳐 6개 core widget을 사용한다. 36개 scenario, 80개 frontend, 9개 style에서 보지 못한 10개 widget type을 hold out한다. Nested-filter world는 200개 frontend에서 20개 training widget family를 사용하고, 100개 frontend에서 9개 compound panel family를 hold out하며, 반환 결과가 요청한 condition을 만족하는지 채점한다.
분포는 capability-world control이 여러 vertical에 걸쳐 재테마되어 단일 익숙한 layout에 의존하지 않음을 보여준다. Nested filter는 6개 vertical, date picker는 10개 context를 포괄한다.
5.3 Twelve training worlds, fourteen evaluation splits
학습은 10개 full domain과 2개 capability world를 포함한 12개 world를 사용한다. 평가는 capability world마다 in-distribution split과 held-out split을 추가한 14개 split을 사용하며, 보고한 평균은 이 14개 split에 대한 unweighted 평균이다.
6 Supervised experiments
Supervised experiment는 browser action에 정렬한 Qwen3.5-9B base policy, 검증된 21,009개 trajectory로 fine-tuning한 같은 9B 모델, 그리고 허용된 demonstration을 생성한 GPT-5.4를 비교한다. Rollout은 100개 action으로 제한한다. Synthetic task는 database-grounded scoring을 사용하고, live-web transfer는 공개된 WebVoyager와 Online-Mind2Web judge를 사용한다.
6.1 Setup
Supervised corpus는 12개 world와 총 404,814개 action을 포함한다. Policy는 vLLM으로 serving하며, bot blocking과 rate limit이 raw live-site performance를 낮추므로 hosted-browser와 datacentre live-web condition을 모두 보고한다.
6.2 Deep worlds transfer; shallow worlds set the model back
동일 domain 및 비슷한 규모의 ablation에서 shallow-world 학습은 Allrecipes success를 80.0%에서 75.0%로 낮추고 Hugging Face는 48.0%에 머문다. 반면 deep-world 학습은 각각 85.0%와 65.0%에 도달한다. Deep model은 Hugging Face에서 step budget을 모두 소진하는 task도 37개 중 15개에서 9개로 줄인다. 다만 저자는 이 2개 domain 결과를 깊이의 일반적 가치 추정치가 아니라 shallow world가 transfer를 해칠 수 있다는 증거로 해석한다.
막대는 직접적인 deep-versus-shallow 대비를 보여준다. Deep training은 2개 live WebVoyager domain 모두를 향상하지만, shallow training은 Allrecipes를 해치고 Hugging Face를 개선하지 못한다.
6.3 The full scorecard: base, our model and a frontier reference
14개 synthetic split에서 πSFT는 9B base 평균을 36.5%에서 67.1%로 높였고, GPT-5.4는 80.7%이다. ECHOBANK, ECHOMAIL, 2개 nested-filter split에서는 frontier reference와 같거나 더 높지만, held-out datepicker에서는 52.0% 대 94.7%, ECHOSTAY에서는 37.6% 대 50.4%로 여전히 크게 약하다.
주요 supervised scorecard는 πSFT가 base model보다 폭넓게 향상했지만 GPT-5.4와 격차가 남았음을 보여준다. 9B 모델이 teacher reference와 같거나 더 높은 split도 식별한다.
Plot은 각 split에서 base model에서 πSFT까지의 진전과 GPT-5.4까지 남은 거리를 분해한다. 특히 held-out datepicker와 여러 deep-domain world에서 고르지 않은 잔여 격차를 드러낸다.
6.4 Precision about one skill
Capability-only 학습은 layout과 skill 사이에서 transfer된다. Datepicker와 nested-filter를 함께 학습하면 datepicker success는 in-distribution에서 83.5%, held-out에서 57.3%이며, nested filter에서는 각각 88.0%와 84.8%이다. Held-out gain은 control-level generalization을 뒷받침하지만, held-out datepicker의 GPT-5.4 격차는 여전히 크다.
Ablation은 각 capability-world training regime가 2개 control type 모두를 향상하며, joint training이 4개 split 모두에서 가장 좋음을 보여준다. Held-out value는 학습에서 제외한 widget family에 대한 generalization을 수량화한다.
Grouped bar는 gain이 학습한 layout이나 control에만 한정되지 않음을 보여준다. Joint training은 모든 datepicker 및 nested-filter split에서 가장 높은 score를 보인다.
6.5 Transfer to the live web
Live-web 학습 data 없이 πSFT는 WebVoyager를 hosted condition에서 66.5%에서 71.5%로, datacentre condition에서 50.9%에서 55.6%로 높인다. Online-Mind2Web은 hosted에서 40.5%에서 43.4%로, datacentre에서 29.5%에서 37.2%로 오른다. 논문은 synthetic world가 로그인 제한 및 write-heavy workflow를 강조하는 반면 benchmark는 대체로 public 및 read-oriented이므로 이를 완만한 transfer gain으로 설명한다.
6.6 What scaling buys, and what it does not
고정된 world mixture 내에서 trajectory를 추가하면 synthetic performance는 계속 향상하지만 live-web transfer 이점은 거의 없다. 6,400개에서 20,000개 trajectory로 늘리면 WebVoyager는 54.8%에서 55.6%로만 변하고 Online-Mind2Web은 40.1%에서 37.2%로 하락한다. 반대로 서로 다른 environment를 추가하면 synthetic average와 WebVoyager가 모두 계속 상승하므로, transfer의 핵심은 raw trajectory volume보다 breadth임을 뒷받침한다.
6.7 The model is not the only thing that learns
공동 진화는 일반 QA가 놓칠 수 있는 environment 측 failure를 찾아낸다. ECHOSTAY에서 guest-count control을 고친 뒤 완료 가능한 영향을 받은 booking 비율은 48%에서 78%로 상승했고, 2개 loop round에 걸쳐 해당 world corpus로 학습한 모델은 16.2%에서 38.5%로 향상했다. Environment, corpus, verifier가 함께 바뀌었으므로, 논문은 개별 repair의 고립된 인과 기여를 주장하지 않는다.
Chart는 2개 ECHOSTAY 공동 진화 round의 end-to-end 효과를 보고한다. World-specific model score는 16.2%에서 38.5%로 22.3 point 상승한다. GPT-5.4의 50.4%까지 남은 격차도 보여준다.
7 Reinforcement learning on the worlds
RL 단계는 imitation의 한계를 다룬다. 허용된 teacher trajectory는 student가 자신의 실수를 알아차리고 복구하거나 중단하는 방법을 보여주지 않는다. 통제된 world는 실제 website가 안전하게 제공할 수 없는 reset 가능한 high-throughput state-grounded episode를 제공한다.
7.1 Imitation carries a ceiling
Verifier-filtered demonstration corpus는 깨끗하지만 teacher의 성공 행동과 recovery pattern만 가르칠 수 있다. 반면 RL은 policy 자신의 trajectory를 평가하므로, 반복되는 오류를 optimization에 활용할 수 있다.
7.2 Why the live web is not an RL environment
논문은 실제 web이 정확한 reset, throughput, 신뢰할 수 있는 reward, stationarity, 안전한 destructive action이라는 RL 요구 사항을 충족하지 못한다고 주장한다. Echoverse는 task별 snapshot, 병렬 self-contained application, 고정 seed data, grounded outcome check를 제공한다.
비교는 저자가 실제 web이 아니라 synthetic world를 RL substrate로 취급하는 이유를 설명한다. Echoverse는 database ownership과 isolation을 통해 reset, episode volume, reward, stationarity, safety 요구를 충족한다.
7.3 Method
πSFT에서 시작해 fixed reference에 대한 low-variance KL penalty를 포함한 group-relative policy gradient를 사용한다. 각 row는 Rrow = Rtraj + λRstep을 받으며 λ = 1이고 Rstep ∈ {0, 1}이다. Database-grounded trajectory outcome에 action이 실제로 효과를 냈는지 보상하는 GPT-4.1 vision per-step judge를 결합한다. Advantage는 같은 prompt를 공유하는 모든 step row에서 Arow = Rrow − mean(Rgroup)로 중심화하며, group standard deviation으로 나누지 않는다.
7.4 Setup
RL은 32개 GPU를 사용해 ECHOBANK, ECHOFORGE, ECHOFORUM, ECHOSTAY, ECHOTUNES에서 학습한다. 시작 policy sample 4개에서 1~3회 해결한 task를 유지해 353개 unique training task와 125개 disjoint validation task를 얻는다. 각 update는 16개 prompt와 group size 8을 사용하며 rollout length는 50 turn으로 제한한다.
Pool은 5개 world에 걸쳐 균형을 이루며 train-validation overlap은 0이다. ECHOTUNES와 ECHOBANK만 target range의 training row에 도달하도록 upsampling한다.
Configuration은 16개 prompt, group size 8, 50-turn rollout, 1 × 10−7 learning rate, trajectory 및 step reward를 사용하는 group-relative policy-gradient training을 명시한다. Dense judged shaping은 학습에만 사용하므로 평가 구분이 중요하다.
7.5 Results
2 epoch를 조금 넘긴 step 50에서 held-out grounded trajectory score는 world당 25개 validation task에 걸쳐 58.8%에서 68.0%로 상승한다. Training reward도 상승 추세이지만 dense per-step judgment를 포함하므로 held-out outcome score와 직접 비교할 수 없다.
Held-out grounded validation score는 step 50에서 68.0%까지 상승한다. Training reward는 dense step signal을 포함하므로 더 noisy하다. 분리된 panel은 2개 quantity를 같은 metric으로 취급하지 않게 한다.
8 Conclusion
결론은 깊고 repair 가능하며 state-grounded한 world를 학습 infrastructure와 benchmark substrate로 제시한다. Release에는 ECHOSTAY, ECHOFORGE, 2개 capability world의 code와 graded evaluation task가 포함되며, benchmark contamination을 줄이기 위해 training task는 공개하지 않는다. Code는 https://aka.ms/echoverse 에서 제공한다.
Catalogue는 20개 nested-filter training widget family와 9개 held-out compound family를 식별해 held-out generalization 설정을 구체화한다. 학습과 평가는 단순 task instance가 아니라 widget family가 다르다.
Datepicker catalogue는 heatmap, scroll wheel, ISO-week picker, fiscal-year picker를 포함해 6개 training family와 10개 특이한 held-out type을 명시한다. 이는 시각적·구조적으로 다른 control 간 interaction transfer를 뒷받침한다.
부록
- Appendix B는 31개 task set, 21,009개 passing GPT-5.4 trajectory, 404,814개 step을 보고한다. ECHOSTAY trajectory는 평균 33.80개 action으로 가장 길고 nested-filter trajectory는 평균 4.70개이다. Verifier prompt는 semantic equivalence와 무해한 추가 write를 허용하며, widget catalogue는 held-out family가 evaluation 전용임을 명시한다.
짧은 생각
논문의 가장 강한 근거는 deep world와 shallow world의 통제된 대비, grounded evaluation 설계, 공동 진화가 여러 결합된 component를 한 번에 바꾼다는 명시적 인정이다. 외적 타당성 근거는 고무적이지만 제한적이다. Live-web gain은 완만하고 supervised data는 GPT-5.4의 한계를 물려받으며 RL은 학습 중 신뢰할 수 있는 terminal verification과 model-judged shaping signal을 결합한다.