Gorio Tech Blog search

SPADE: Self-Play in Adaptive Synthetic Executable Environments 요약 설명

|

Contents

이번 글에서는 SPADE: Self-Play in Adaptive Synthetic Executable Environments 논문의 핵심 포인트만 간단히 정리한다.

  • 2026년 8월 19일(Arxiv)
  • Liu, Bo, Yu, Simon, Jiang, Yiding, Qu, Ao, Zhao, Andrew, Liu, Zichen, Kim, Junsu, Zhou, Zijian, Kim, Seungone, Ren, Tongzheng, et al.
  • University of Washington, Stanford University, Northeastern University, Carnegie Mellon University, Massachusetts Institute of Technology, National University of Singapore, Seoul National University, Stevens Institute of Technology, University of Chicago
  • 논문 링크

영문판 보기


요약

  • SPADE는 하나의 공유 LLM이 실행 가능하고 상태를 지닌 학습 환경을 작성하고 해결하도록 학습한다. 힌트 기반 regret 신호는 특권 지침이 Reasoning Agent의 반환을 높이는 환경에 보상하며, 코퍼스 grounding, 메모리, 난이도 anchor는 에이전트의 능력 경계 근처에서 실현 가능한 커리큘럼을 유지하도록 설계됐다.

공유 정책의 2개 역할 학습 loop를 소개하고, 고정 환경 baseline 대비 게임과 tool use의 보고된 향상 곡선을 제시한다.

하나의 LLM이 실행 가능 환경을 설계하고 특권 힌트의 유무에 따라 해결하며, 반환 차이는 Designer에 보상하고 과제 완료는 Agent에 보상하는 구조
하나의 LLM이 실행 가능 환경을 설계하고 특권 힌트의 유무에 따라 해결하며, 반환 차이는 Designer에 보상하고 과제 완료는 Agent에 보상하는 구조

1 Introduction

논문은 사람이 고정적으로 구성한 환경, 정적으로 합성한 환경, verifier가 고정된 환경 풀이 학습자가 향상되어도 과제 분포에 적응하지 않으므로 병목이 된다고 본다. SPADE는 대신 Gym 스타일의 reset()/step() 인터페이스를 갖는 Python MDP를 생성하며, 추론 게임과 multi-turn tool-use 과제를 모두 다룬다. 정적으로 합성한 환경에 대해서는 이 글을 참조하라.

초기부터 후기 학습까지 4개 환경을 보여 주며, Reasoning Agent가 향상됨에 따라 state-gated multi-turn 과제로 이동한다는 보고를 설명한다.

학습 단계 0, 112, 200, 384에서 생성한 환경 관측, Python 코드, Designer 작성 힌트 예시
학습 단계 0, 112, 200, 384에서 생성한 환경 관측, Python 코드, Designer 작성 힌트 예시

SPADE는 자신의 접근을 LLM self-play, 비지도 환경 설계, 합성 환경 생성과 연결한다. 논문이 제시하는 차별점은 완전한 실행 가능 MDP를 온라인으로 생성하고, 고정된 과제 생성기나 고정된 parameterized level 공간이 아니라 측정한 Reasoning Agent 반환으로 Designer를 최적화한다는 점이다.

3 Preliminaries

이 방법은 Gym 스타일 MDP 환경과 GRPO로 최적화한 검증 가능한 보상 기반 강화학습을 결합한다. 생성한 Python 코드는 상태 전이, 보상 함수, 검증 로직을 제공한다.

3.1 Markov Decision Processes and Gym-Style Environments

MDP는 (S, A, T, R, ρ0)로 정의한다. 생성 환경은 초기 관측과 info dictionary를 반환하는 reset() 및 (s′, r, terminated, truncated, info)를 반환하는 step(a)를 제공하며, SPADE는 완전 관측 환경을 사용한다.

3.2 RLVR and GRPO

각 prompt에 대해 GRPO는 응답 그룹을 샘플링하고 그룹 평균과 표준편차를 기준으로 보상을 정규화한다. 정책은 clipped objective와 참조 정책에 대한 KL regularization으로 최적화한다.

4 SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE는 하나의 공유 정책 πθ 안에서 Environment Designer와 Reasoning Agent의 trajectory를 번갈아 수행한다. Designer는 검증된 환경과 힌트를 만들고, 힌트가 있는 rollout과 없는 rollout의 쌍은 역할별 보상을 제공하여 공동 GRPO 업데이트에 사용한다.

완전한 데이터 흐름을 나타낸다. 코퍼스와 메모리가 Designer를 조건화하고, 힌트가 있는 rollout과 없는 rollout의 쌍이 regret를 추정하며, Designer와 Agent 보상이 공유 parameter를 업데이트한다.

Environment Designer 생성, Reasoning Agent rollout, 힌트 기반 regret, 공동 GRPO 업데이트로 구성한 SPADE framework
Environment Designer 생성, Reasoning Agent rollout, 힌트 기반 regret, 공동 GRPO 업데이트로 구성한 SPADE framework

4.1 Dual-Role Self-Play and Code-as-Environment

역할별 prompt는 행동을 Designer 또는 Agent로 구분하지만 parameter는 공유한다. Designer는 전이와 보상 로직, 특권 힌트를 구현하는 Python program을 출력하며, syntax 및 실행 가능성 검사가 학습 전에 유효하지 않은 후보를 제외한다.

4.2 Hint-Based Regret Reward

기본 Designer 보상은 힌트가 있는 Reasoning Agent 반환 평균과 없는 반환 평균의 차이다. 높은 regret는 도움을 받으면 풀 수 있지만 그렇지 않으면 풀지 못하는 과제를 식별하며, 낮은 regret는 숙련 또는 실현 불가능성을 모두 뜻할 수 있다. 배포에서는 regret의 하한값과 0.4–0.6 승률 구간을 목표로 하는 난이도 anchor를 추가로 결합한다.

힌트가 행동을 개선하는 rollout 수준의 예시를 제공한다. 표시된 fiber 쌍의 반환은 0.00과 1.00이며 audio 쌍은 0.30과 1.00을 보인다. caption은 Designer 보상이 arm 평균을 사용하며 audio 과제에서는 0.30에서 0.65로 변한다고 설명한다.

특권 힌트의 유무에 따른 Reasoning Agent 플레이를 비교한 2개의 positive-regret 예시
특권 힌트의 유무에 따른 Reasoning Agent 플레이를 비교한 2개의 positive-regret 예시

4.3 Environment Design

새로운 코퍼스 문서는 주제 소재를 제공하고, 메모리는 이전 환경, regret 점수, skill tag를 저장해 이후 변형에 사용한다. 게임에는 DCLM과 MegaScience의 수학 문서 10k개와 과학 문서 5k개를 사용하며, tool use에는 Nemotron pretraining code corpus의 문서 15k개를 사용한다.

5 Experimental Setup

실험에는 Qwen3-4B-Instruct-2507, Qwen3-8B, Qwen3-30B-A3B-Instruct-2507을 사용한다. held-out 평가는 게임 설정의 추론 및 코드 benchmark 8개와 tool use의 BFCL v4 multi-turn, τ²-bench, ACEBench-Agent를 포함한다.

5.1 SPADE Training Recipe

주요 recipe는 GRPO, 그룹 크기 G=16, rollout당 환경 24개, rollout 400회를 사용한다. 환경은 k rollout마다 재생성하며, 게임에서는 k=4, tool use에서는 k=8이다. 지연된 Designer 업데이트는 점수가 off-policy이므로 truncated importance sampling을 사용한다.

5.2 Domain: Games

게임에서 Designer는 Mathematical Reasoning, Logical Deduction, Spatial Reasoning, Pattern Recognition, Optimization, Causal Inference의 순환하는 인지 skill 6개에 걸쳐 독립적인 Python 환경을 생성한다. 연구는 SPADE를 동일 예산의 Fixed-env GRPO 및 Fixed-env RLVE baseline과 비교한다.

5.3 Domain: Tool Use

tool use에서 Designer는 모의 OpenAI function-calling tool, 변경 가능한 backend state, 상태 기반 기준을 갖는 순차 사용자 지시 3–5개를 만든다. 검증은 deterministic reset과 사용 가능한 tool로 기준을 달성할 수 있는지도 추가로 확인하며, benchmark 과제는 생성기에 제공하지 않는다.

6 Experimental Results

게임과 tool use 전반에서 SPADE는 학습하지 않은 base 모델과 보고된 고정 환경 학습 소스보다 held-out 점수를 높인다. 이 근거는 온라인 환경 설계, 코퍼스 grounding, 메모리로 구축한 적응형 커리큘럼을 뒷받침하는 것으로 제시된다.

6.1 Quantitative Analysis

Qwen3-30B-A3B에서 게임 설정 SPADE는 8개 benchmark 평균 58.3에 도달하며, 50.2인 base보다 +8.1-point, 53.0인 Fixed-env RLVE보다 +5.3 높다. 같은 backbone으로 tool use를 수행하면 BFCL v4 multi-turn에서 +5.7, τ²-bench에서 +3.6, ACEBench-Agent에서 +13.9를 얻으며, 논문 간 reference 행은 서로 다른 base, 데이터, protocol을 사용한다.

Qwen3 backbone 3개에 대한 held-out 게임 설정 결과를 보고한다. SPADE는 모든 backbone block에서 가장 높은 suite 평균을 보이며, 가장 큰 보고된 향상은 30B-A3B에서 나타난다.

고정 환경 baseline과 SPADE 생성 게임의 held-out 수학, 과학, 코드, Reasoning-Gym 결과
고정 환경 baseline과 SPADE 생성 게임의 held-out 수학, 과학, 코드, Reasoning-Gym 결과

30B-A3B에서 게임 설정 평가 8개의 checkpoint trajectory를 보여 준다. SPADE는 GPQA-Diamond, LiveCodeBench-v6, procedural reasoning을 향상시키며, competition-math 성능은 보고된 checkpoint에서 학습 전 baseline 근처 또는 그 이상을 유지한다.

SPADE와 고정 환경 baseline의 held-out 수학, 과학, 코드, procedural-reasoning benchmark 학습 trajectory
SPADE와 고정 환경 baseline의 held-out 수학, 과학, 코드, procedural-reasoning benchmark 학습 trajectory

backbone과 benchmark별 tool-use 점수를 보여 준다. SPADE는 BFCL v4 multi-turn, τ²-bench, ACEBench-Agent에서 Qwen3 base를 향상시키며, 표는 reference-system 행이 protocol-matched되지 않았음을 명시한다.

합성 환경 시스템과 Qwen3 backbone 기반 SPADE post-training의 tool-use benchmark 결과
합성 환경 시스템과 Qwen3 backbone 기반 SPADE post-training의 tool-use benchmark 결과

6.2 Qualitative Analysis

보고된 환경은 더 state-gated해지고 지배적인 공식을 직접 노출할 가능성이 낮아진다. Physics 과제에서 공식 공개 비율은 초기 25%에서 후기 5%로 감소한다. 정성적 trajectory는 긴 사전 유도에서 짧은 probe, 증거 수집, 목표 지향 추론으로 이동하며, 코퍼스 grounding이 없을 때 저자들은 반복된 RotatingMazeEnv 변형을 보고한다.

Reasoning Agent 승률이 [0.2, 0.8]인 생성 환경의 비율을 추적한다. 전체 SPADE는 후기 학습에서 약 1/3까지 상승하는 반면, 제시된 ablation은 감소하거나 붕괴한다.

전체 SPADE와 구성요소 ablation의 학습 가능 환경 비율 변화
전체 SPADE와 구성요소 ablation의 학습 가능 환경 비율 변화

환경 embedding을 시각화하고 코퍼스-grounded SPADE와 no-corpus ablation 사이의 큰 다양성 차이를 보고한다. t-SNE는 예시적 표현이며, 명시된 정량 비교는 calibrated Vendi/n이다.

SBERT-embedded 환경의 t-SNE와 calibrated Vendi/n 다양성 점수를 활용한 코퍼스 grounding 비교
SBERT-embedded 환경의 t-SNE와 calibrated Vendi/n 다양성 점수를 활용한 코퍼스 grounding 비교

대표적인 Reasoning Agent 행동이 유효하지 않은 사전 유도에서 probing, 수정, 증거 기반 해결로 바뀌는 모습을 보인다. 이는 통제된 인과 측정이 아니라 정성적 근거다.

증거 우선 상호작용 변화가 나타나는 초기, 중기, 후기 학습 단계의 Reasoning Agent episode
증거 우선 상호작용 변화가 나타나는 초기, 중기, 후기 학습 단계의 Reasoning Agent episode

7 Ablations

ablation은 온라인 Environment Designer 적응과 Designer 보상 설계를 검증한다. 전체 구성은 선택한 8개 benchmark 평균에서 가장 강하며, Designer 학습과 메모리를 모두 제거하면 40.5로 50.2인 학습 전 base보다 낮아지고, 정적인 GPT-5.5-generated pool은 53.0에 도달한다.

Qwen3-30B-A3B에서 주요 구성 ablation을 정량화한다. 전체 시스템은 58.3에 도달해 나열된 모든 부분적·비적응적 변형보다 높지만, 일부 control은 1개보다 많은 요인을 바꾼다.

Environment Designer 학습, 코퍼스 grounding, 메모리, 고정 GPT-5.5 Designer에 대한 게임 설정 ablation 결과
Environment Designer 학습, 코퍼스 grounding, 메모리, 고정 GPT-5.5 Designer에 대한 게임 설정 ablation 결과

7.1 Ablation: Environment Designer Adaptation

메모리를 제거하면 선택한 suite 평균은 58.3에서 53.2로 낮아지고, 코퍼스 grounding을 제거하면 53.5로 낮아진다. 이 변형들은 전체 SPADE보다 더 이르게 정점에 도달하지만, self-generation 및 GPT-5.5 비교의 control은 여러 요인을 함께 바꾸므로 구성요소별 인과 귀속에는 한계가 있다.

적응 ablation의 benchmark별 trajectory를 보여 준다. 전체 SPADE는 후기까지 가장 강한 성능을 유지하는 반면, 메모리, 코퍼스, Designer 학습을 제거한 변형은 더 이른 정점 이후 악화된다.

전체 SPADE, 부분 ablation, 고정 GPT-5.5 Environment Designer의 benchmark별 trajectory
전체 SPADE, 부분 ablation, 고정 GPT-5.5 Environment Designer의 benchmark별 trajectory

7.2 Ablation: Environment Designer Reward

힌트 기반 regret는 선택한 8개 benchmark 평균을 50.2에서 58.3으로 높이며, EMA learning-potential 대안은 55.9에 도달한다. 논문은 skill-level moving average에서 부호 없는 편차가 숙련된 환경과 가망 없는 환경 모두에 보상할 수 있고, 정보성을 갖기 전에 과거 추정치가 필요하다고 주장한다.

학습된 Designer 설정에서 힌트 기반 regret와 EMA learning potential을 비교한다. regret 변형이 가장 높은 보고 suite 평균에 도달하며, 학습과 메모리를 모두 제거한 control은 악화된다.

힌트 기반 regret, EMA learning potential, Designer 학습 제거를 비교한 Environment Designer 보상 ablation
힌트 기반 regret, EMA learning potential, Designer 학습 제거를 비교한 Environment Designer 보상 ablation

8 Scaling Results

게임 설정에서 base 대비 향상은 4B에서 +5.2, 8B에서 +5.7, 30B-A3B에서 +8.1로 증가하는 반면, Fixed-env GRPO는 +1.2 근처에 머문다. six-skill 커리큘럼은 8개 benchmark suite에서 58.3에 도달하며, two-skill 버전은 53.7이다.

six-skill 커리큘럼이 제한된 two-skill 버전보다 더 높은 suite 평균에 도달함을 보여 준다.

six-skill 및 two-skill SPADE 커리큘럼의 8개 benchmark suite 평균 trajectory
six-skill 및 two-skill SPADE 커리큘럼의 8개 benchmark suite 평균 trajectory

backbone 규모가 커질수록 base 대비 향상이 증가하는 모습을 보이고, 추정 힌트 regret를 함께 나타낸다. 30B-A3B 추정치만 학습 대부분에서 양수를 유지하며, 더 작은 모델도 noisy하거나 음수인 finite-sample 추정치에도 향상된다.

4B, 8B, 30B-A3B 모델의 게임 설정 base 대비 향상과 힌트 기반 regret trajectory의 scaling
4B, 8B, 30B-A3B 모델의 게임 설정 base 대비 향상과 힌트 기반 regret trajectory의 scaling

9 Discussion

결과는 보고된 고정 환경 풀보다 적응형 환경 설계를 지지하며, 하나의 code-as-environment 인터페이스를 게임과 multi-step tool use 모두에 사용할 수 있음을 보인다. 한계로는 base 모델과 생성 예산에 제한되는 Designer 복잡도, 사람이 설계한 GRPO optimizer, 커리큘럼 최적성에 대한 형식적 보장이 없다는 점, 직접적인 open-ended growth가 아니라 고정 과제로 평가했다는 점이 있다.

10 Conclusion

SPADE는 실행 가능 MDP 생성, 코퍼스 및 메모리 grounding, 힌트 기반 regret를 통해 환경 설계를 학습 가능한 LLM post-training 구성요소로 만든다. 30B-A3B에서 논문은 게임에서 base 대비 평균 +8.1점, ACEBench-Agent에서 +13.9, BFCL v4 multi-turn에서 +5.7을 보고한다.

부록

  • appendix는 표기법, 이상화한 equilibrium 분석, prompt, 구현 세부사항, 재현성 자료, 확장 ablation, 확장 related work, 정량 분석, 생성 환경 예시를 제공한다. sound generation, 명확히 기술된 힌트, internalizability를 가정할 때 이론적 결과는 모든 pure Nash equilibrium이 valid 환경에서 zero hint regret와 pointwise hint-free optimality를 갖는다고 말한다.

짧은 생각

가장 강한 실증 근거는 코퍼스 grounding과 온라인 적응의 공동 역할에 관한 것이다. 논문은 코퍼스 grounding이 있을 때 Vendi/n 0.68, 없을 때 0.04를 보고한다. 결론은 생성 환경의 유효성과 protocol이 일치하지 않는 외부 tool-use 비교에 제한되므로, 공개한 코드, 구성, 평가 JSON, figure script는 독립적 검증에 중요하다.