Gorio Tech Blog search

SPADE: Self-Play in Adaptive Synthetic Executable Environments 요약 설명

|

목차

이번 글에서는 SPADE: Self-Play in Adaptive Synthetic Executable Environments 논문의 핵심 포인트만 간단히 정리한다.

  • 2026년 8월 19일(Arxiv), arXiv
  • Liu, Bo, Yu, Simon, Jiang, Yiding, Qu, Ao, Zhao, Andrew, Liu, Zichen, Kim, Junsu, Zhou, Zijian, Kim, Seungone, Ren, Tongzheng, et al.
  • University of Washington, Stanford University, Northeastern University, Carnegie Mellon University, Massachusetts Institute of Technology, National University of Singapore, Seoul National University, Stevens Institute of Technology, University of Chicago
  • 논문 링크

요약

  • SPADE는 학습자가 강해져도 고정된 환경 풀의 과제 분포가 변하지 않아 개선이 멈추는 문제를 다룬다. 하나의 LLM이 실행 가능한 Python 환경을 작성하는 Environment Designer와 이를 푸는 Reasoning Agent를 역할별 프롬프트로 번갈아 수행하고, 두 역할의 GRPO 업데이트는 같은 가중치에 적용된다. Designer는 힌트 유무에 따른 Agent 평균 반환 차이를 보상으로 받아 현재 능력의 경계에 있으면서 힌트로는 풀 수 있는 환경을 만들도록 학습한다. 30B-A3B 게임 설정에서 여덟 개 held-out 수학·과학·코드·절차 추론 벤치마크의 비가중 평균은 기본 모델 50.2에서 SPADE 58.3으로 8.1퍼센트포인트 상승했고, 동일 backbone과 400회 학습 예산의 가장 높은 고정 환경 기준선인 Fixed-env RLVE 53.0보다 5.3퍼센트포인트 높았다. 도구 사용에서는 같은 30B-A3B 기본 모델 대비 BFCL v4 multi-turn이 49.0에서 54.7로 5.7퍼센트포인트, ACEBench-Agent가 62.0에서 75.9로 13.9퍼센트포인트 상승했다.
    • 핵심은 Python 코드로 상태 전이·보상·검증을 함께 정의하는 환경 표현, 힌트 기반 후회 보상, 외부 코퍼스 접지와 과거 환경 메모리다.
    • 저자들은 이를 개방형 지속적 자기 개선을 향한 단계로 제시하지만, 평가는 고정 held-out 벤치마크에 한정되며 생성 가능한 환경 복잡도는 기반 모델의 문맥 내 표현력과 생성 예산에 제한된다고 밝힌다.
공유 LLM의 이중 역할 자기 대전 구조와 게임·도구 사용 성능 향상 추이
공유 LLM의 이중 역할 자기 대전 구조와 게임·도구 사용 성능 향상 추이
학습 단계에 따른 적응형 다중 턴 환경 커리큘럼 사례
학습 단계에 따른 적응형 다중 턴 환경 커리큘럼 사례

4 SPADE: Self-Play in Adaptive Synthetic Executable Environments

  • SPADE의 한 주기는 환경 생성, 구문·실행 검증, 힌트 생성, 힌트 유무의 Agent 롤아웃, 두 역할의 공동 GRPO 갱신으로 구성된다. Designer는 코퍼스 문서와 환경 메모리를 조건으로 Gym 형식의 reset()/step() 인터페이스를 갖춘 환경 코드와 힌트를 생성한다. Agent는 생성 환경의 검증 보상으로 과제 수행을 학습하고, Designer는 힌트가 Agent 반환을 얼마나 높였는지를 신호로 학습한다. 이 구조는 단일 턴 답안 채점과 상태 전이가 있는 다중 턴 도구 사용을 하나의 실행 환경 인터페이스로 다루려는 설계다.
    • 공유 정책의 두 목적이 간섭하지 않도록 Agent 반환은 환경별 롤아웃 안에서 표준화하고, Designer 보상은 기술별로 평균 중심화한다.
    • Designer 궤적의 빈도가 낮으므로 손실 비중을 높이고, 환경 세트당 학습 횟수 k만큼 Designer 갱신을 늦춘다. 이 지연으로 생기는 오프폴리시 경사는 절단 중요도 샘플링으로 보정한다.
코퍼스·메모리 기반 환경 생성과 힌트 유무 Agent 롤아웃의 공동 학습 절차
코퍼스·메모리 기반 환경 생성과 힌트 유무 Agent 롤아웃의 공동 학습 절차

4.1 Dual-Role Self-Play and Code-as-Environment

  • Designer 정책 πD와 Agent 정책 πA는 역할별 시스템 프롬프트만 다르고 파라미터 θ를 공유한다. Designer는 상태 전이와 보상 함수를 step()에 포함한 실행 가능한 Python MDP e 및 과제 전략·부분 해법·핵심 관찰을 담은 힌트 h를 생성한다. Agent는 환경 관측을 받아 순차 행동을 내고 환경이 반환하는 보상을 받는다. 단일 턴 환경에서는 reset() 뒤 답안을 step()에 넣어 종료 보상을 받고, 다중 턴 환경에서는 관측·행동·상태 전이를 반복한다. 후보 환경은 구문과 실행 가능성 검사를 통과한 경우에만 학습 풀에 들어간다.
    • Agent는 환경의 과제 완료 보상으로, Designer는 힌트 기반 후회와 난이도 앵커로 gradient를 받으며 두 gradient는 동일한 공유 정책을 갱신한다.
    • 배포 보상은 원시 후회를 0에서 절단하고 고정 척도로 [0,1]에 정규화한 항(가중치 0.4)과, Agent 승률이 목표 구간 [0.4,0.6]에서 최대이고 구간 밖에서는 선형으로 감소하는 난이도 앵커(가중치 0.6)를 결합한다.

4.2 Hint-Based Regret Reward

  • 힌트 기반 후회는 rD(e)=r̄A(e|h)−r̄A(e)이며, 같은 환경에서 힌트 조건과 무힌트 조건으로 각각 G개의 새 Agent 롤아웃을 실행해 얻은 평균 반환의 차이다. 힌트가 있을 때만 잘 풀리는 환경은 학습 경계 후보가 되고, 양 조건 모두 성공하면 숙달된 환경, 양 조건 모두 낮으면 난해한 환경으로 간주한다. Figure 4의 섬유 탐색 과제에서 표시된 단일 롤아웃 반환은 무힌트 0.00, 힌트 조건 1.00이지만, Designer 보상은 두 조건의 전체 기록 롤아웃 평균 차이다. 오디오 필터 과제도 표시된 단일 쌍은 0.30→1.00이나 실제 보상에 쓰인 평균은 0.30→0.65로 구분된다.
    • 부록의 이상화 분석은 유효 실행 환경, 힌트가 최적 무힌트 값을 달성한다는 가정, 힌트 행동을 무힌트 정책으로 내재화할 수 있다는 가정 아래 순수 내시 균형에서 모든 유효 환경의 무힌트 후회가 0이 된다고 보인다. 이는 유한 표본과 제한된 모델로 구현한 학습이 같은 보장을 만족한다는 뜻은 아니다.
    • 4B와 8B에서는 유한 표본으로 추정한 후회가 장기간 음수가 될 수 있다. 저자들은 힌트가 현재 정책을 오도할 수 있기 때문이라고 설명하며, 학습에서는 원시 후회를 0에서 절단한다.
특권 힌트가 Agent 행동과 반환에 미치는 사례
특권 힌트가 Agent 행동과 반환에 미치는 사례

4.3 Environment Design

  • 코퍼스 접지는 자기 출력만 조건으로 한 생성기가 반복 패턴으로 수렴하는 문제를 줄이기 위한 외부 신규성 원천이다. 게임에서는 DCLM의 수학 문서 1만 개와 MegaScience의 과학 문서 5천 개, 도구 사용에서는 Nemotron 사전학습 코드 코퍼스 문서 1만 5천 개를 사용한다. 환경 메모리는 이전 환경, 후회 점수, 기술 태그를 최대 200개까지 보관하며 Designer가 고후회 환경을 변형하도록 한다. 저자들의 구분에 따르면 코퍼스는 환경 주제의 폭을, 메모리는 Agent 능력 경계에 맞춘 난이도 연속성을 주로 제공한다.
    • 게임 환경은 숨은 상태, 여러 행동, 상태 변화, 부분 보상을 포함하는 자기 완결형 Python 게임이다. 도구 사용 환경은 OpenAI 함수 호출 형식의 모의 도구, 도구가 갱신하는 백엔드 상태, 순차적으로 공개되는 3~5개 사용자 지시, 상태 기반 성공 기준으로 구성된다.
    • 본문과 부록 C.2는 도구 환경에서 여러 seed의 결정적 reset 검사와 LLM 검사를 통해 사전 충족·도달 불가·도출 불가 기준을 걸러낸다고 주장한다. 그러나 부록 G.3.3의 CustomerSupportTicketWorkflowEnv는 초기 상태에 high·new 티켓이 정확히 2개이고 첫 성공 기준도 그 개수=2이므로 reset 시 이미 참이다. 따라서 해당 예시는 ‘사전 충족 기준을 거른다’는 주장과 충돌하며, 이 환경의 검증 통과 여부와 전체 생성 풀에서의 빈도는 PDF만으로 확인할 수 없다.

5 Experimental Setup

  • 게임 실험은 Qwen3-4B-Instruct-2507, Qwen3-8B, Qwen3-30B-A3B-Instruct-2507을 사용한다. 4B와 30B-A3B는 instruct 모델이며, 8B는 두 역할에서 thinking을 활성화한다. GRPO로 24개 환경을 사용하는 롤아웃 400회를 학습하고, 게임은 k=4이므로 4회 롤아웃마다 환경 세트를 재생성한다. 각 환경은 무힌트로 16×k회, 힌트 조건으로 16회 실행하며 후회는 같은 재생성 단계에서 측정한 두 조건 평균의 차이다. 한 게임 롤아웃은 활성 기술 세 개에 각각 8개, 총 24개 환경을 사용하고 여섯 기술 범주 가운데 세 개가 순환한다.
    • 게임 기준선은 각 backbone의 동일 기본 체크포인트에서 400회 예산으로 별도 재학습한 Fixed-env GRPO 및 Fixed-env RLVE다. 평가는 AIME 2025·2026 Avg@32, GPQA-Diamond 정확도, LiveCodeBench-v6 Pass@1, hard 난이도 Reasoning-Gym 네 범주의 승률을 합친 여덟 벤치마크로 구성하며 모두 학습에서 제외했다.
    • 도구 사용은 생성 비용 때문에 k=8을 사용한다. Agent는 모든 사용자 지시를 완료했을 때만 보상을 받으며, BFCL v4 multi-turn, 표준 τ²-bench, ACEBench-Agent로 평가한다. Table 2의 문헌 시스템 행은 원 논문에서 전사한 값이므로 backbone, 학습 자료와 예산, BFCL 버전, τ²-bench 프로토콜 및 harness가 달라 통제 비교가 아니다.

6 Experimental Results

  • 실험 결과는 게임과 도구 사용에서의 held-out 성능, 그리고 학습 중 생성 환경 및 행동의 변화를 제시한다. 게임의 핵심 통제 비교는 동일 backbone과 동일 400회 예산으로 재학습한 고정 환경 기준선에 대한 비교다. 도구 사용에서는 SPADE 자체 기본 모델과의 전후 비교가 직접적인 결과이며, 문헌에서 전사한 합성 환경 시스템과의 표 수치는 프로토콜 차이가 있는 맥락 비교로 해석해야 한다.
    • 세 Qwen3 backbone에서 SPADE 게임 학습은 기본 모델과 고정 환경 학습과 다른 전이 양상을 보였다.
    • 도구 사용에서는 생성 환경과 구조적으로 가까운 상태 기반 다중 턴 함수 호출 평가에서 큰 기본 모델 대비 향상이 보고되었다.

6.1 Quantitative Analysis

  • Table 1에서 Qwen3-30B-A3B의 여덟 벤치마크 비가중 평균은 기본 50.2, Fixed-env GRPO 51.4, Fixed-env RLVE 53.0, SPADE 58.3이다. 따라서 원문이 말한 가장 강한 고정 환경 기준선 대비 5.3은 이 backbone·400회 예산·여덟 벤치마크 평균 조건에서 58.3−53.0=5.3퍼센트포인트라는 뜻이다. 같은 모델에서 기본 대비 변화는 GPQA-Diamond 70.4→75.8(+5.4pp), LiveCodeBench-v6 43.2→47.3(+4.1pp), Reasoning-Gym 수학 45.0→63.3(+18.3pp), 알고리즘 18.0→32.1(+14.1pp), 인지 23.0→37.7(+14.7pp), 논리 67.0→72.8(+5.8pp)이다. AIME 2025와 2026은 각각 61.5→62.8(+1.3pp), 73.5→74.4(+0.9pp)였다.
    • Table 1의 SPADE 평균 향상은 각 backbone 기본 대비 4B +5.2pp, 8B +5.7pp, 30B-A3B +8.1pp이고, Fixed-env GRPO는 각각 +1.0pp, +1.2pp, +1.2pp이다. 저자들은 이 양상이 모델 규모가 클수록 적응형 커리큘럼의 이점이 커진다는 해석과 일치한다고 보지만, 이 비교만으로 규모 이외 요인의 인과 효과를 분리할 수는 없다.
    • Table 2에서 SPADE-30B-A3B는 자체 기본 모델 대비 BFCL v4 multi-turn 평균 49.0→54.7(+5.7pp), τ²-bench 평균 49.0→52.6(+3.6pp), ACEBench-Agent 평균 62.0→75.9(+13.9pp), 세 벤치마크의 최종 평균 53.3→61.1(+7.8pp)였다. 최종 평균의 차이는 반올림 전 평균값으로 계산된 표의 Δ 열에는 +7.7로 표시되므로, 표시값만으로 정확한 세부 계산은 재현할 수 없다.
    • Table 2의 전사 수치에서는 SPADE-30B-A3B의 BFCL 54.7과 ACEBench 75.9가 문헌 합성 시스템 행의 해당 최고 보고값 41.9와 72.5보다 높다. 다만 부록 C.3.1이 모델·훈련 자료·평가 버전·harness 차이를 명시하므로 이를 통제된 방법 우위로 해석할 수 없다.
게임 환경 학습의 backbone별 held-out 추론·코드 벤치마크 성능
게임 환경 학습의 backbone별 held-out 추론·코드 벤치마크 성능
30B-A3B 게임 학습 중 held-out 벤치마크 성능 궤적
30B-A3B 게임 학습 중 held-out 벤치마크 성능 궤적
도구 사용 환경 학습의 벤치마크별 성능과 문헌 시스템 비교
도구 사용 환경 학습의 벤치마크별 성능과 문헌 시스템 비교

6.2 Qualitative Analysis

  • Figure 6의 30B-A3B 게임 실행에서 전체 SPADE는 Agent 승률이 20~80%인 학습 가능 환경의 롤아웃 예산 비중을 학습 말기에 약 3분의 1까지 높였고, 메모리·코퍼스·Designer 학습을 제거한 변형은 감소하거나 붕괴했다. Figure 7과 Table 8의 Vendi/n은 코퍼스 접지 조건 0.68, 비접지 조건 0.04이며, t-SNE는 보조 시각화이고 정량 비교의 근거는 보정된 Vendi 점수다. Figure 8에서는 동일 실행의 물리 환경 473개에서 초기 관측이 지배 공식을 직접 보이는 비율이 25%에서 5%로 감소했고, 비접지 변형은 step 290~312에 회전 미로 계열 41개를 연속 생성했다.
    • 저자들은 생성 지시문이 400단계 동안 고정되고 코퍼스 문서도 매 단계 새로 표본화되므로, 공식 공개 감소와 부분 보상 세분화가 프롬프트 일정이 아니라 Designer 학습과 연결된다고 해석한다. 이는 한 canonical run의 생성물에 대한 관찰이다.
    • Figure 9의 개별 궤적에서 Agent는 step 0에 장문의 사전 유도로 형식 오류를 반복하지만, step 200에는 짧은 가설을 시험하고, step 300에는 먼저 탐침한 뒤 증거가 모였을 때 한 번 유도한다. 이는 사례 궤적에 근거한 정성 관찰이며, 저자들은 장문 유도 능력 보존의 근거로 Table 1의 늦은 체크포인트 성능을 함께 제시한다.
구성요소별 학습 가능 환경 비중의 변화
구성요소별 학습 가능 환경 비중의 변화
코퍼스 접지 유무에 따른 환경 다양성
코퍼스 접지 유무에 따른 환경 다양성
Designer 학습에 따른 정보 은닉 강화와 비접지 생성 붕괴 사례
Designer 학습에 따른 정보 은닉 강화와 비접지 생성 붕괴 사례
사전 유도에서 증거 우선 상호작용으로 바뀌는 Agent 궤적
사전 유도에서 증거 우선 상호작용으로 바뀌는 Agent 궤적

7 Ablations

  • Table 3의 Qwen3-30B-A3B 게임 설정에서 전체 SPADE의 여덟 벤치마크 평균은 58.3이다. 메모리 제거는 53.2, 코퍼스 접지 제거는 53.5, Designer 학습과 메모리를 함께 제거한 자기 생성 제어는 40.5, 코퍼스 접지된 GPT-5.5 오프라인 고정 풀은 53.0이다. 각 변형은 여덟 벤치마크 평균이 가장 높은 체크포인트를 선택한 결과다. 전체 구성이 표의 변형 중 가장 높지만, 자기 생성 제어는 Designer 학습과 메모리를 동시에 바꾸고 GPT-5.5 제어는 생성기와 온라인성도 함께 바꾸므로 각 요인의 독립 효과를 모두 식별하지는 못한다.
    • 힌트 기반 후회와 난이도 앵커 결합은 기본 50.2에서 58.3으로 8.1퍼센트포인트 높았고, 힌트 재실행 없이 기존 롤아웃을 재사용하는 EMA 학습 잠재력 신호는 55.9로 5.7퍼센트포인트 높았다. 저자들은 EMA 신호가 기술별 과거 이력을 필요로 하고, 느린 평균으로부터의 절대 편차이므로 숙달된 환경과 불가능한 환경을 모두 높게 평가할 수 있다고 설명한다.
    • Figure 12는 기본 대비 평균 향상이 4B·8B·30B-A3B에서 각각 +5.2·+5.7·+8.1pp로 증가하고 Fixed-env GRPO는 약 +1.2pp에 머무는 양상을 보인다. Figure 13에서 여섯 기술 커리큘럼의 평균 58.3은 두 기술 변형 53.7보다 4.6퍼센트포인트 높다. 이는 동일 30B-A3B 설정에서 커리큘럼 폭의 기여를 보는 절제 결과이지 특정 게임 계열 하나의 효과를 입증하지는 않는다.
적응형 구성요소 제거와 고정 Designer의 게임 벤치마크 절제 결과
적응형 구성요소 제거와 고정 Designer의 게임 벤치마크 절제 결과
Designer 학습·메모리·코퍼스 제거에 따른 벤치마크 성능 궤적
Designer 학습·메모리·코퍼스 제거에 따른 벤치마크 성능 궤적
힌트 기반 후회와 EMA 학습 잠재력 보상의 절제 비교
힌트 기반 후회와 EMA 학습 잠재력 보상의 절제 비교
모델 규모별 기본 대비 향상과 힌트 기반 후회 추정치
모델 규모별 기본 대비 향상과 힌트 기반 후회 추정치

9 Discussion

  • 저자들은 적응형 Designer가 해당 Qwen3 기반의 오프라인 Fixed-env GRPO 풀 및 GPT-5.5가 만든 고정 풀보다 높은 게임 평균을 냈고, 코드 기반 환경 인터페이스가 게임과 도구 사용 양쪽에 적용됐다는 결론을 제시한다. 한계로는 Designer가 기반 모델이 문맥 안에서 표현할 수 있는 복잡도를 넘는 환경을 만들 수 없다는 점, 두 역할을 갱신하는 GRPO 규칙은 사람이 설계했다는 점, 힌트 기반 후회가 최적 커리큘럼을 보장하지 않는다는 점, 고정 과제 성능이 개방형 성장 자체를 측정하지는 않는다는 점을 든다. 도구 사용 환경의 사전 충족 기준을 거른다는 주장과 부록 G.3.3 첫 성공 기준이 reset 시 이미 참인 예시는 충돌하므로, 환경 검증의 실제 범위와 누락률은 추가 실행 검증 없이는 판단할 수 없다.

부록

  • 부록은 기호 표, 힌트 기반 후회의 이상화된 게임 분석과 가정, 시스템 프롬프트·구현·재현성 정보, 확장 절제 실험, 관련 연구 확장, 환경 품질·다양성의 추가 정량 분석, 게임·도구 사용 생성 사례 및 생성 환경 코드 모음으로 구성된다.

짧은 생각

이 방법에서 주목할 점은 단순히 어려운 과제를 선호하는 대신, 힌트가 현재 정책의 수행을 실제로 얼마나 개선하는지를 Designer의 보상으로 사용했다는 데 있다. Figure 4는 보기 좋은 단일 궤적의 차이와 학습 보상에 쓰인 반복 롤아웃 평균을 분리해 제시하므로, 보상 신호의 집계 단위를 명확히 한다. 반면 작은 모델에서는 후회 추정치가 장기간 음수가 되어 절단이 필요했고, 도구 사용 부록 예시에는 reset 시 이미 충족되는 성공 기준도 남아 있다. 따라서 이 접근의 실용적 효과는 힌트 품질과 표본 수뿐 아니라 생성 환경 검증의 정확성에도 좌우된다. 힌트의 정보량과 생성 주체를 통제하고, 독립적인 실행 검증으로 사전 충족·도달 불가 기준의 비율을 측정한다면 후회 보상 자체의 기여를 더 분명히 평가할 수 있을 것이다.