Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale 요약 설명
30 Jul 2026 | Paper Review Weekly Papers목차
- 요약
- 3 Problem setting: environments, tasks and grounded grading
- 4 Echoverse: the factory and the co-evolution loop
- 5 The environment suite
- 6 Supervised experiments
- 7 Reinforcement learning on the worlds
- 짧은 생각
이번 글에서는 Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale 논문의 핵심 포인트만 간단히 정리한다.
- 2026년 7월 30일(Arxiv), arXiv
- Pandya, Yash, Gupta, Sahil, Harne, Sarthak, Yadav, Archana, Chourasia, Kavyansh, Mozannar, Hussein, Vineet, Vibhav, Abdali, Sara, Rosset, Corby, Lara, Yash, et al.
- Microsoft Research
- 논문 링크
요약
- 이 논문은 컴퓨터 사용 에이전트 학습에서 환경의 개수보다 환경 내부의 행동적 깊이, 실패한 상호작용을 겨냥하는 능력, 그리고 환경·과제·검증기를 함께 개선하는 공진화가 더 중요하다고 주장한다. 저자들은 명세로부터 상태 보유형 웹 애플리케이션을 생성하고, 데이터베이스 상태를 기준으로 결과를 채점하는 Echoverse를 제안한다.
- 환경은 로그인 뒤의 쓰기 작업, 공유 상태, 권한, 이력처럼 실제 웹에서 안전하게 대량 학습하기 어려운 워크플로를 재현한다.
- 12개 월드의 검증된 궤적 21,009개로 Qwen3.5-9B를 지도 미세조정했을 때, 14개 평가 분할 평균 성공률이 36.5%에서 67.1%로 상승했다. GPT-5.4의 평균 80.7%와는 13.6%포인트 차이였다.
- 얕은 환경으로 학습한 모델은 Allrecipes에서 기본 모델보다 낮은 75.0%를 기록한 반면, 깊은 환경 학습은 Allrecipes 85.0%, Hugging Face 65.0%를 기록했다.
- 동일한 월드는 강화학습에도 사용된다. 5개 월드에서 데이터베이스 기반 종단 보상과 단계별 조밀 보상을 결합한 결과, 보류 검증 점수가 58.8%에서 68.0%로 상승했다.

채점된 롤아웃을 환경 수리와 모델 학습에 함께 사용하는 공진화 루프
3 Problem setting: environments, tasks and grounded grading
- 논문은 환경을 데이터베이스 상태 공간, 브라우저 행동 공간, 애플리케이션 전이 함수, 관측 함수, 초기 시드 데이터베이스로 정의한다. 과제는 자연어 목표, 읽기·쓰기·읽기/쓰기 유형, 그리고 초기 데이터베이스에서 생성한 참조값으로 구성된다. 환경·과제 집합·검증기를 합친 단위를 월드라고 부른다.
- 쓰기 과제는 초기 데이터베이스와 최종 데이터베이스의 SQL 차이에 필요한 상태 변화가 포함되는지로 채점한다. 따라서 이미 존재하던 상태만으로 과제가 통과하는 일을 막는다.
- 읽기 과제는 데이터베이스에서 읽어 생성한 참조 답과 에이전트 답의 의미적 동등성을 비교한다. 읽기와 쓰기를 함께 요구하는 과제는 두 점수의 최솟값을 사용한다.
- 최종 비교에는 LLM을 쓰지만, 궤적·스크린샷·에이전트의 자기 보고를 제공하지 않는다. 관찰된 답 또는 SQL 차이와 데이터베이스 유래 참조값만 비교하게 하여 판정 범위를 좁힌다.
- 깊이는 기능 수가 아니라 목표 워크플로 집합을 화면을 통해 처음부터 끝까지 수행하고, 그 결과를 상태로 정확히 검증할 수 있는 완전성으로 정의한다. 이를 행동 충실성, 일관된 상태, 워크플로 깊이, 권위 있는 검증, 도메인 가치의 다섯 속성으로 분해한다.

목표 워크플로 지원에 필요한 환경 깊이의 다섯 속성
4 Echoverse: the factory and the co-evolution loop
- Echoverse 팩토리는 두 단계로 작동한다. 1단계에서는 사람이 작성한 시나리오·기능·역량 시드를 구조화된 명세와 기계 검증 가능한 주장으로 확장한 뒤, 프런트엔드·백엔드·데이터베이스를 포함한 애플리케이션을 생성하고 수리한다. 2단계에서는 실행 중인 데이터베이스에 근거해 과제를 생성하고, 품질·실현 가능성·검증 정확성을 확인해 코퍼스로 내보낸다.
- 빌더, 검증기, 트리아지 에이전트, 계층별 수정 에이전트가 역할을 나눠 수행한다. 검증과 생성을 분리하고, 트리아지가 공통 원인의 실패를 묶어 수정 항목으로 만들도록 설계했다.
- 1단계는 경로·상태·행동에 관한 주장이 95% 이상 통과할 때 환경을 진행시키며, 해결되지 않은 차단 문제가 있으면 진행시키지 않는다.
- 2단계의 실현 가능성 검증은 Playwright로 실제 화면을 조작하면서 소스와 데이터베이스도 조회하는 화이트박스 방식이다. 이후 학습·평가할 모델의 성공 여부로 과제 존재를 정하지 않는다.
- 각 롤아웃 실패는 먼저 환경·과제·검증기의 결함인지 재검토한다. 유효하고 풀 수 있으며 올바르게 검증되는 과제에서 남은 실패만 모델의 역량 격차로 간주해 학습 신호로 쓴다. 통과율을 높이기 위해 과제 목표를 약화하는 수정은 회귀로 취급한다.
- 각 롤아웃은 과제별로 분리된 데이터베이스 사본에서 실행한다. 따라서 과제 간 오염을 막고 정확한 재설정과 재현을 지원한다.

명세 기반 환경 구축과 데이터베이스 기반 과제 코퍼스 생성 절차
5 The environment suite
- 환경 모음은 10개 심층 도메인 월드와 2개 역량 월드로 구성된다. 심층 도메인은 메일, 일정, 채팅, 기계학습 플랫폼, 개발 협업, 은행, 의료 기록, 포럼, 음악 스트리밍, 숙박 예약을 다루며, 공유 상태와 권한, 이력, 다단계 쓰기 작업을 포함한다.
- ECHOSTAY는 검색·매물·가용성·결제를 거치는 예약 흐름을 약 87개 경로와 23개 테이블에 걸쳐 구현한다. ECHOFORGE에는 프로젝트, 이슈, 병합 요청을 포함한 대규모 시드 상태가 들어 있다.
- 날짜 선택기 월드는 10개 맥락과 6개 핵심 위젯 유형, 100개 프런트엔드로 구성되며, 학습에 없는 10개 위젯 유형과 80개 프런트엔드를 별도로 보류한다.
- 중첩 필터 월드는 20개 위젯 계열, 200개 프런트엔드, 15개 스타일을 학습에 사용하고, 9개 복합 패널 계열과 100개 프런트엔드를 보류한다. 목표는 한 화면 배치를 외우는 대신 필터링 규칙을 익히게 하는 것이다.
- 학습에는 12개 월드를 쓰고, 평가는 10개 도메인 분할과 두 역량 월드의 분포 내·보류 분할을 합친 14개 분할에서 수행한다. 논문의 평균은 이 14개 분할의 비가중 평균이다.

열 개 심층 도메인 월드의 업무 범주와 요구되는 상태 구조

심층 도메인별 시드 데이터베이스 규모와 주요 엔터티

날짜 선택기와 중첩 필터 역량 월드의 주제별 프런트엔드 분포
6 Supervised experiments
- 지도학습에서는 브라우저 행동 형식에만 정렬한 Qwen3.5-9B 기본 모델과, 12개 월드의 통과 궤적 21,009개로 학습한 동일 규모 모델을 비교한다. 교사는 GPT-5.4이며, 데이터베이스 기반 검증기를 통과한 교사 궤적만 학습 코퍼스에 포함한다.
- 전체 14개 분할에서 기본 모델은 36.5%, 지도학습 모델은 67.1%, GPT-5.4는 80.7%의 평균 성공률을 기록했다. 지도학습 모델은 ECHOBANK, ECHOMAIL, 중첩 필터의 분포 내·보류 분할에서 GPT-5.4와 같거나 더 높은 점수를 기록했다.
- 깊이 비교에서 얕은 월드 학습 모델은 Allrecipes 점수가 80.0%에서 75.0%로 하락하고 Hugging Face에서는 48.0%에 머물렀다. 깊은 월드 학습 모델은 각각 85.0%, 65.0%를 기록했으며, Hugging Face에서 행동 예산을 소진한 과제 수는 37개 중 15개에서 9개로 줄었다.
- 역량별 절제 실험에서 날짜 선택기와 중첩 필터를 함께 학습한 모델은 보류 날짜 선택기에서 34.0%에서 57.3%로, 보류 필터 패널에서 62.8%에서 84.8%로 상승했다. 한 역량만 학습해도 다른 역량에 일부 전이가 관찰되었다.
- 학습하지 않은 실제 웹 평가에서도 지도학습 모델은 WebVoyager의 호스팅 조건에서 66.5%에서 71.5%로, 데이터센터 조건에서 50.9%에서 55.6%로 상승했다. Online-Mind2Web은 각각 40.5%에서 43.4%, 29.5%에서 37.2%로 상승했다.
- 고정된 월드에서 궤적 수만 늘리면 합성 환경 평균은 계속 상승했지만 실제 웹 전이는 포화되는 양상을 보였다. 반면 환경 종류를 늘린 실험에서는 합성 평균과 WebVoyager 성능이 계속 개선되었다.
- ECHOSTAY에서는 게스트 수 제어 결함을 고친 뒤 완료 가능한 예약 과제 비율이 48%에서 78%로 높아졌고, 해당 월드 코퍼스로 학습한 모델의 점수는 16.2%에서 38.5%로 상승했다. 다만 이는 환경·과제·검증기가 함께 변한 공진화 라운드의 비교이므로, 개별 수정 요소의 독립 효과로 해석할 수는 없다.

얕은 환경과 깊은 환경 학습의 실제 웹 도메인별 성능 비교

열네 평가 분할에서 기본 모델·지도학습 모델·프런티어 모델의 성공률

날짜 선택기와 중첩 필터 역량별 지도학습 절제 실험

합성 환경 학습의 실제 웹 벤치마크 전이 성능

고정 환경의 궤적 수와 환경 다양성 확장에 따른 성능 변화

ECHOSTAY 공진화 라운드에 따른 학습 모델 성능 변화
7 Reinforcement learning on the worlds
- 강화학습 단계는 지도학습 정책을 초기값으로 하여 다섯 월드에서 그룹 상대 정책경사를 적용한다. 논문은 실제 웹이 정확한 재설정, 대량 병렬 에피소드, 신뢰할 수 있는 보상, 학습 중 정지성, 파괴적 행동의 안전성을 제공하지 못하므로 강화학습 환경으로 적합하지 않다고 본다.
- 종단 보상은 최종 데이터베이스 상태와 참조 상태 변화를 비교한 검증기에서 얻는다. 단계별 보상은 클릭 대상이 표시된 행동 전 스크린샷을 보고, 행동이 실제로 효과를 냈는지를 판정하는 GPT-4.1 비전 모델의 이진 보상이다.
- 종단 결과가 틀린 궤적에서는 마지막 단계의 조밀 보상을 0으로 만들고, 잘못 종료하면 별도 패널티를 준다. 이에 따라 단계별 보상이 잘못된 최종 결과를 보상하는 문제를 제한하려고 한다.
- 후보 과제는 초기 정책이 네 번 중 한 번·두 번·세 번 성공한 중간 난도 과제만 남겼다. 전혀 성공하지 못하거나 항상 성공하는 과제는 그룹 내 이점이 0이 되기 쉬워 제외했다.
- 학습은 ECHOTUNES, ECHOBANK, ECHOFORUM, ECHOSTAY, ECHOFORGE의 다섯 월드에서 수행했다. 보류 검증 과제의 데이터베이스 기반 판정 점수는 약 두 에포크, 50단계에서 58.8%에서 68.0%로 상승했다. 보고된 검증 점수는 조밀 단계 보상을 포함하지 않는 종단 결과 점수다.

실제 웹과 Echoverse의 강화학습 환경 요건 충족 비교

Echoverse 월드에서의 그룹 기반 강화학습 루프

다섯 월드 강화학습에서 보류 검증 점수와 학습 보상 변화
짧은 생각
- 이 논문의 핵심 해석은 합성 환경을 단순한 벤치마크나 궤적 공급원으로 취급하지 말고, 에이전트 실패를 통해 지속적으로 검증·수리되는 학습 인프라로 취급해야 한다는 점이다. 특히 데이터베이스에 근거한 검증과 과제별 재설정은 장기 브라우저 궤적의 지도학습과 강화학습 모두에 직접적인 기반을 제공한다.
- 얕은 환경이 실제 웹 성능을 떨어뜨릴 수 있다는 결과는 환경의 외형적 유사성이나 환경 수만으로 학습 품질을 판단해서는 안 된다는 근거를 제공한다. 그러나 비교는 두 실제 웹 도메인과 제한된 과제 수에서 이루어졌으므로, 깊이의 효과 크기를 일반화된 정량 법칙으로 보기는 어렵다.
- 역량 월드의 보류 위젯 성능 향상은 동일한 조작 원리를 여러 렌더링과 맥락에 배치하는 설계가 화면 배치 암기보다 나은 일반화를 유도할 가능성을 시사한다. 다만 보류 분할도 연구자가 만든 합성 분포이므로, 매우 다양한 실제 웹 전체에 대한 전이를 보장하지는 않는다.
- 공진화 결과는 환경 결함을 모델 실패로 오인하지 않는 절차의 실용적 가치를 보여 준다. 반면 ECHOSTAY의 전후 비교에서는 환경, 과제 코퍼스, 검증기가 함께 변했으므로 어느 구성 요소가 성능 상승을 얼마나 만들었는지는 분리되지 않는다.
- 강화학습 보상은 최종 결과를 데이터베이스로 고정하지만 중간 행동의 품질은 비전 LLM 판정에 의존한다. 논문은 결합 규칙으로 보상 악용을 줄이려 했으나, 단계별 판정기가 만드는 편향이나 오류가 학습에 미치는 영향은 별도로 정량화하지 않았다.
- 공개되는 것은 ECHOSTAY, ECHOFORGE 및 두 역량 월드의 평가 과제와 검증기다. 폐쇄형 업무 시스템의 안전한 학습·평가 기반으로 활용할 수 있지만, 공개 과제만 제공되므로 학습 코퍼스 전체를 재현할 수 있는지는 본문에 제시되지 않았다.