PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents 요약 설명
04 Aug 2026 | Paper Review Agent Evaluation Recursive Self-Improvement Agent's Memory목차
- 요약
- Introduction
- Related Work
- PAST-Bench
- Benchmark Construction
- Evaluation Pipeline
- Experiments
- Experimental Setup
- Main Results
- Diagnosis-Driven Design: Hermes+
- Mechanism Evidence and Generalization
- Conclusion
- Future Work
- 부록
- 짧은 생각
이번 글에서는 PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents 논문의 핵심 포인트만 간단히 정리한다.
- 2026년 8월 4일(Arxiv), arXiv
- Xue, Shuhan, Ding, Zixin, Shen, Yichen, Wang, Yinjie, Yin, Zhenfei, Wu, Yingcheng, Chen, Yuxin, Wang, Mengdi, Yang, Ling.
- Princeton University
- 논문 링크
- Github
요약
- PAST-Bench는 개인 AI 에이전트가 세션 간에 보존한 경험을 이후 과업의 개선으로 실제 전환하는지 측정하는 성능 귀속 벤치마크다. 저자들은 모델 재학습, 프롬프트 최적화, 장문맥 적응 없이 이전 상호작용에서 축적한 상태를 재사용해 미래 행동을 바꾸는 능력을 온라인 자기 진화로 정의한다. 벤치마크는 기억, 절차 재사용, 정보 탐색, 갱신을 다루는 26개 과업 가족과 204개 에피소드로 구성된다. 영속 상태 접근을 허용하거나 차단한 짝 조건에서 후속 과업 점수 차이 Δ를 측정하고, 저장·검색·적용·갱신이 의도한 경로를 따랐는지는 Mech 점수로 별도 보고한다. Hermes+는 Hermes에 다섯 런타임 개입을 더한 기준선으로, MiniMax-M2.7에서 Mech를 0.64에서 0.73으로, 평균 Δ를 +0.13에서 +0.15로 높였다. 다만 전체 Δ의 차이 +0.02는 실행 간 변동보다 작으며, 가장 뚜렷한 평균 변화는 갱신 Δ가 +0.12에서 +0.24로 상승한 결과다.

과업 가족 기반 영속 경험 귀속 벤치마크의 구성과 평가 축
Introduction
- 재귀적 자기 개선은 AI 시스템이 운용 중 생성한 경험으로 미래 능력을 높이는 능력이다. 개인 에이전트는 사용자 선호, 작업 이력, 도구 절차, 스킬, 세션 파일을 세션 간에 보존하므로 이를 행동 수준에서 검증하기에 적합하다. 그러나 상태를 축적했다고 해서 개선이 보장되지는 않는다. 에이전트는 잘못된 내용을 저장하거나 무관한 기억을 검색하고, 취약한 절차를 재사용하거나 이미 정정된 오래된 상태를 적용할 수 있다. PAST-Bench는 매 에피소드를 새 세션에서 시작하고 이전 대화를 문맥에 누적하지 않으며, 영속 저장소만 이전 경험의 전달 경로로 남긴다. 동일한 프롬프트, 채점기, 도구, 시드에서 보존 상태 접근만 제거한 짝 절제를 사용하지만, 저자들은 이를 인과 증명이 아니라 강한 설계 통제로 규정하고 Mech로 경로 수준의 근거를 보완한다.
Related Work
- 기존 상호작용 에이전트 벤치마크는 주로 새 세션의 개별 과업 성공을 측정하므로 기반 모델, 프롬프트, 도구 정책, 런타임, 보존 경험의 기여가 하나의 점수에 섞인다. 궤적 채점 벤치마크는 한 에피소드 안에서 도구 호출과 행동 순서를 평가하지만, 이전 에피소드가 만든 상태가 후속 과업 성공에 재사용됐는지는 직접 평가하지 않는다. 장기 기억·스킬 벤치마크는 기억 추출이나 절차 재사용 같은 저장 기제를 다루지만, 동일 과업 가족에서 보존 상태 접근만 제거한 대조군으로 후속 실행 과업의 이득을 분리하지는 않는다. PAST-Bench는 과업 가족 단위의 시간적 비교, 짝 영속성 절제, 실행 흔적을 결합해 결과 이득과 의도한 영속 경로의 증거를 구별한다.

대표 에이전트 벤치마크의 보존 경험, 모델·프레임워크 비교, 궤적 진단 지원 범위
PAST-Bench
- PAST-Bench의 평가 단위는 단발성 과업이 아니라 잠재 규칙, 재사용 산출물, 정정 정보, 사전 배치된 참조 자료를 공유하는 순서 있는 과업 가족이다. 각 에피소드는 새 세션에서 시작하므로 이전 대화가 직접 문맥으로 전파되지 않는다. 초기 에피소드는 재사용 가능한 상태를 만들 기회를 제공하고, 후속 평가 에피소드는 결정적 규칙을 다시 제시하지 않은 상태에서 기억, 스킬, 세션 이력, 저장 파일을 활용해야 한다. 모델 비교에서는 Hermes와 과업·채점기를 고정하고 기반 모델을 바꾸며, 프레임워크 비교에서는 MiniMax-M2.7과 과업·채점기를 고정하고 에이전트 런타임을 바꾼다. Figure 1은 이 통제 구조와 네 능력 범주, 과업 점수 및 기제 증거의 이중 보고 방식을 요약한다.
Benchmark Construction
- 기억 과업은 사용자 선호, 제약, 예외, 과거 결정처럼 수정하지 않는 선언적 정보를 한 번 검색해 적용하는지를 평가한다. 절차 재사용 과업은 SOP, 플레이북, 배포·장애 대응 흐름처럼 순서와 도구 조합이 중요한 기술 작업을 저장하고 다시 실행하는지를 시험하며, 순서 오류·단계 생략·잘못된 도구 대체는 실패로 처리한다. 정보 탐색 과업은 답에 필요한 산출물이 영속 계층에 미리 저장된 상황에서, 잡음 있는 문맥 속에서도 적절한 시점에 능동 검색하는지를 측정하고 검색을 대신할 그럴듯하지만 틀린 기본값을 둔다. 갱신 과업은 오래된 사실·규칙·SOP·임시 예외 뒤에 권위 있는 두 번째 기록을 제공하며, 새 상태를 사용하면서 오래된 상태가 누출되지 않는지를 평가한다. 각 가족에는 상태를 제거하는 비보존 대조군, 유사하지만 무관한 정보를 주입하는 방해 대조군, 오래된 상태 대조군, 잘못된 스킬이나 근거원을 제시하는 잘못된 기제 대조군이 포함된다.

네 능력 범주에 걸친 PAST-Bench 과업 가족 분포
Evaluation Pipeline
- 과업 가족은 cold, learn, evaluation, control 역할의 에피소드로 구성된다. cold는 영속 상태가 형성되기 전 최초 접촉 성능을 보정과 여유 분석에 쓰지만, 영속성 비활성 기준선은 아니다. learn과 갱신 에피소드는 목표 절, 절차, 정정값을 영속 저장소에 남기고, evaluation 에피소드는 뒤의 새 세션에서 이를 재사용해야 한다. 영속성 활성 조건은 같은 가족에서 앞선 에피소드가 생성하거나 수정한 상태 접근을 허용하며, 비활성 조건은 그 접근을 차단한다. 가족별 Δf는 활성 조건 평가 점수 평균에서 비활성 조건 평가 점수 평균을 뺀 값이다. 저자들은 shortcut, 표면 암기, 오래된 상태 재사용, 잘못된 기제의 설명을 배제하는 대조 조건의 상한을 넘어야 Δf를 자기 진화의 증거로 취급한다. 메모리 쓰기, 스킬 생성·사용, 세션 검색, 검색 시점, 갱신 이벤트와 저장 산출물은 점수 이득이 의도한 경로를 따랐는지 확인하는 원격 측정값이다.
Experiments
- 실험은 Hermes를 고정하고 7개 기반 모델의 영속성 이득을 비교한 뒤, MiniMax-M2.7을 고정하고 nanobot, ZeroClaw, Agent-Zero, Hermes, Hermes+의 런타임 설계를 비교한다. 이어 낮거나 불균등한 이득을 보인 실행 흔적을 분석해 Hermes+의 다섯 기제를 설계하고, 단일 기제 절제, 기제 상호작용 진단, 다른 기반 모델로의 전이 실험을 수행한다. 과업 점수와 Δ는 행동 결과를 나타내며, Mech는 결과가 의도한 영속 경로에서 비롯됐다는 귀속 주장을 보조하는 척도다.
Experimental Setup
- 각 과업 가족은 영속성 활성·비활성 조건에서 짝지어 평가하고, 활성 조건 점수와 가족 균형 평균 Δ를 보고한다. 에피소드 과업 점수는 완료도 80%와 도구 오류 회복성 20%의 가중합에 이진 안전 게이트를 곱해 계산한다. 안전 위반이 있으면 전체 점수는 0점이며, 도구 오류 회복성은 오류를 낸 서로 다른 도구를 이후 성공적으로 다시 호출한 비율과 성공 호출 비율에 따른 하한으로 계산한다. 각 에피소드는 독립 3회 실행하고, 누락 또는 충돌 실행은 0점으로 처리한다. 활성·비활성 쌍 안에서는 모델, 에이전트, 프롬프트, 도구, 문맥 창, 출력 제한, 에이전트 제한, 압축 정책을 동일하게 유지한다. 다만 시스템 사이의 절대 점수에는 각 프레임워크의 고유한 기억 렌더링, 문맥 관리, 압축·절단 정책 차이가 남는다.
Main Results
- Table 2의 Hermes 고정 모델 비교에서 7개 기반 모델은 모두 양의 전체 Δ를 보였다. MiniMax-M2.7은 +0.13, Kimi K2.6과 DeepSeek-V4-Pro는 각각 +0.17, Claude Opus 4.6은 +0.19, GLM-5.1과 Claude Sonnet 4.6은 각각 +0.20, GPT-5.4는 +0.24였다. GPT-5.4의 기억·절차·정보·갱신 Δ는 각각 +0.37, +0.19, +0.07, +0.34이며, 이 수치는 전체 모델 가운데 가장 큰 전체 Δ +0.24가 능력별로 고르게 나타난 것은 아님을 보여 준다. Table 3의 MiniMax-M2.7 고정 프레임워크 비교에서 nanobot과 Hermes는 모두 전체 Δ +0.13이지만 Mech는 0.57과 0.64로 다르다. ZeroClaw는 Δ +0.12, Mech 0.55이고, Agent-Zero는 Δ −0.08, Mech 0.39다. Hermes는 Hermes+를 제외한 네 프레임워크 가운데 네 능력의 Δ가 모두 양수인 유일한 사례다. Hermes+는 절차 Δ −0.02를 보였으나 기억 +0.27, 정보 +0.12, 갱신 +0.24로 전체 Δ +0.15와 Mech 0.73을 기록했다.

Hermes 고정 조건에서 기반 모델별 영속성 활성·비활성 성능과 차이

MiniMax-M2.7 고정 조건에서 에이전트 프레임워크별 능력 차이와 기제 증거
Diagnosis-Driven Design: Hermes+
- Hermes+는 모델 매개변수를 학습하거나 변경하지 않고 Hermes의 영속 상태 읽기·쓰기·검색 시점과 저장 표현을 바꾸는 런타임 기준선이다. E1 Plan은 위험하거나 회상이 필요한 행동을 계획하기 전에 노출된 영속 상태를 확인하도록 한다. E2 Render는 기억을 유형, 범위, 개체, 현재값, 대체된 값, 만료 시각이 포함된 바인딩으로 기록하고, 후속 세션에는 범위에 맞는 최신 바인딩만 제시한다. E3 Route는 적용 조건과 순서 있는 단계를 포함한 스킬을 저장하고 질의 관련성으로 순위를 매기며, 절차가 바뀌면 가까운 기존 스킬을 갱신한다. E4 Gate는 과거 상태에 의존하거나 되돌릴 수 없는 행동 전에 필요한 기억·세션·스킬 검색이 없으면 한 차례 응답을 보류하고 검색을 요구한다. E5 Close는 에피소드 종료 때 최종 바인딩 또는 수정 규칙을 추출해 기존 항목을 권위 있는 최신 산출물로 덮어쓰고 동기적으로 저장한다. Figure 3은 이 다섯 기제가 프롬프트 문맥, 도구, 검색 게이트, 종료 처리의 어느 지점에 삽입되는지 보인다.

Hermes+의 다섯 런타임 기제가 에이전트 루프에 삽입되는 위치
Mechanism Evidence and Generalization
- MiniMax-M2.7, 동일 과업 집합, 동일 채점기를 사용한 Table 4의 단일 기제 절제에서 E2는 기억 활성 점수 0.80, E3는 절차 Δ +0.10, E4는 정보 Δ +0.17, E5는 갱신 Δ +0.16으로 각각 해당 진단 대상에서 가장 높은 단일 기제 결과를 냈다. 전체 Hermes+는 Base Hermes와 같은 전체 활성 점수 0.66을 유지하면서 전체 Δ +0.15, 갱신 활성 점수 0.74, 갱신 Δ +0.24를 기록했고, 이 갱신 결과는 Table 4의 절제 설정 중 가장 높다. Table 5의 절차 집중 진단에서는 E2를 제거했을 때 Δ가 +0.085에서 +0.108로 상승했지만, E3 또는 E5를 제거하면 +0.062, +0.042로 하락했다. 이는 특정 가족의 스킬 생성·검색 흔적에 기반한 진단이며 전체 벤치마크 효과로 일반화할 수 없다. Table 6에서 MiniMax-M2.7은 +0.13에서 +0.15, Claude Sonnet 4.6은 +0.20에서 +0.22로 높아졌고 GPT-5.4는 +0.24로 유지됐다. DeepSeek-V4-Pro와 Claude Opus 4.6은 하락했으므로 전이는 균일하지 않다. GPT-5.4와 Hermes+의 Δ +0.24, Mech 0.80은 보고된 설정 가운데 가장 높은 전체 Δ와 동률이다. MiniMax-M2.7의 3회 실행에서 Hermes와 Hermes+의 전체 Δ는 각각 0.13±0.04, 0.15±0.06이어서 평균 차이 +0.02를 안정적인 전체 개선으로 해석할 수 없다.

단일 기제와 완전한 Hermes+의 능력별 절제 결과

절차 재사용에서 기제 상호작용과 스킬 라우팅의 집중 진단

다섯 기반 모델에서 Hermes+의 능력별 성능과 기제 증거
Conclusion
- 저자들은 PAST-Bench를 과업 가족 안에서 영속 상태 활성·비활성의 짝 비교와 실행 경로 증거를 결합해, 기반 모델·런타임·보존 경험이 후속 과업 성능에 미치는 기여를 분리하려는 벤치마크로 제시한다. 실험은 영속 경험의 이득이 능력과 모델에 따라 달라지고, 동일한 Δ도 서로 다른 수준의 write-then-read 경로 증거를 가질 수 있음을 보였다. Hermes+는 모든 모델과 능력에서 성능을 높이는 보편적 방법이 아니라, 실패 위치를 진단하고 런타임 기제를 절제할 수 있게 하는 기준선이다.
Future Work
- 향후 연구에서는 합성되고 서로 분리된 과업 가족을 사람 작성 또는 실제 상호작용 유래 시나리오, 더 긴 에피소드 순서, 가족 간 전이와 간섭이 있는 환경으로 확장할 필요가 있다. 기억·절차 재사용·정보 탐색·갱신을 넘어 새 도구 전략 습득, 장기 계획의 수정, 다중 에이전트 간 경험 공유, 무엇을 저장·검색·검증·갱신할지 결정하는 정책 자체의 개선도 평가 대상이 될 수 있다. 현재 Mech는 예상한 영속 경로와의 일치도를 측정할 뿐 그 경로가 성공에 인과적으로 필요했음을 보이지 않는다. 따라서 산출물을 삭제·대체·오염시키는 반사실 개입, 여러 의미적으로 동등한 저장 형식의 지원, 사람의 경로 주석과 불확실성 추정이 필요하다. 또한 기억 바인딩과 스킬 라우팅의 상호작용은 경험을 어느 영속 인터페이스에 둘지 동적으로 결정하는 설계와 정확도·지연·토큰 비용의 공동 최적화를 요구한다.
부록
- 부록은 과업 가족 분류와 합성 과업의 품질 관리, 실행 흔적 기반 사례 연구, 과업 점수와 Mech의 계산·집계 정의, LLM 채점기의 사람 채점 검증과 민감도 분석, 개인 에이전트 및 일반 목적 에이전트의 적용 범위, 추가 절제·가족별 결과·비용, 재현 가능한 문맥·영속성·추론·재시도 설정, 확장 관련 연구를 수록한다.
짧은 생각
이 논문의 핵심 선택은 영속성 활성 점수나 Δ만으로 자기 개선을 선언하지 않고, 동일한 전체 Δ +0.13을 보인 Hermes와 nanobot의 Mech가 각각 0.64와 0.57이라는 차이를 별도 축으로 드러낸 데 있다. 개인 에이전트에서 유용한 경험은 단순히 기록되는 것으로 끝나지 않고, 후속 새 세션에서 적절한 시점에 검색되어 올바른 행동에 적용돼야 한다. 다만 Mech의 기대 계약이 산출물 유형, 키워드, 최소 읽기·쓰기 횟수를 미리 정하므로, 같은 의미를 더 압축적으로 저장하거나 다른 저장소를 쓰는 에이전트에는 불리할 수 있다. 후보 산출물을 삭제·교체하는 반사실 실험과 여러 유효한 저장 표현에 대한 사람 평가를 함께 적용했을 때도 프레임워크의 Δ–Mech 관계가 유지되는지 확인해야, 이 척도가 경로 정렬을 얼마나 일반적으로 포착하는지 판단할 수 있다.