Apodex 1.1: Scaling Agentic Intelligence for Complex Work 요약 설명
24 Aug 2026 | Paper Review Multi-Agent AI Reinforcement Learning LLM Inference Long-Context LLMs목차
- 요약
- 2 Core Insights and Design Principles
- 3.1 Environment Scaling
- 3.2 Apodex Agent Team 1.1: Interactive Self-Organizing Teams
- 3.3 AgentOS: An Execution Substrate for Long-Horizon Work
- 3.4 Training
- 4.2 Main Results
- 부록
- 짧은 생각
이번 글에서는 Apodex 1.1: Scaling Agentic Intelligence for Complex Work 논문의 핵심 포인트만 간단히 정리한다.
- 2026년 8월 24일(Arxiv), Technical Report
- An, B., Li, B., Wang, B., Zhang, B., Wang, B. L., Feng, C., Wei, C., Xue, C., Zhang, C., Ng, D., et al.
- Apodex
- 논문 링크
- Github
- Project Page
요약
- Apodex 1.1은 복잡한 장기 작업의 능력을 단발성 응답 정확도보다 실제 목표를 향해 지속적으로 진전하고 검증 가능한 납품물을 완성하는 ‘working capability’로 정의한다. 이를 위해 파일·검색·코드로 이루어진 실행 환경의 다양성·충실도·검증성을 넓히는 Environment Scaling과, 과업 분해·병렬 위임·비동기 결과 통합·재계획을 정책으로 학습하는 Agentic Coordination Scaling을 결합한다. 공통 실행 하니스와 AgentOS는 도구와 에이전트 전반의 작업 상태·산출물·출처를 유지하며, 통합 SFT와 agentic RL은 환경 궤적 및 조정 궤적을 학습 신호로 사용한다. 저자들은 다양한 전문 업무, 금융, 과학 연구, 수학, 코딩, 검색 평가에서 선도 성능 대역에 도달했다고 주장한다. 다만 초록의 ‘상당히 작은 모델’이라는 비교는 다수 기준 시스템의 매개변수 수가 공개되지 않아 정량 검증할 수 없으며, 35B Mini의 결과는 선택된 비교 시스템과의 성능 대역 비교로 읽어야 한다.
2 Core Insights and Design Principles
- 논문은 하나의 과업 계약을 E=(W,W0,q,A,T,Ω,B,D,VD)로 정의한다. W와 W0는 작업공간 상태와 초기 상태, q는 정규화한 목표, A·T·Ω는 행동·상태 전이·관찰 인터페이스, B는 턴·도구 호출·토큰·벽시계 시간·동시 실행 등을 제한하는 예산, D는 납품 계약, VD는 최종 산출물을 판정하는 검증기다. 초기 사용자 요청 u0와 목표 q는 구별한다. 근거·우선순위·방법만 명확히 하는 후속 메시지는 기존 계약을 유지하지만, 목표·필수 납품물·수용 조건을 실질적으로 바꾸는 메시지는 새 계약을 만든다. 저자들은 환경 확장을 프롬프트 수 증가가 아니라 상태·실패·검증을 갖춘 실행 계약 분포의 확장으로, 조정 확장을 에이전트 수 증가가 아니라 결과·사용자 피드백을 공유 상태에 반영해 작업을 재조직하는 정책 능력으로 규정한다. 공통 하니스는 훈련, 재생, 실행의 인터페이스를 맞추며, 평가는 ReAct로 기반 정책을 보고 Agent Team으로 학습된 조정과 추가 조직화 계산을 포함한 시스템 수준 효과를 측정한다.

환경 확장과 조정 확장으로부터 훈련·평가로 이어지는 능력 개발 순환
3.1 Environment Scaling
- Environment Scaling은 공통 정책이 실제 작업의 인과 구조를 학습하도록 파일·검색·코드 세계를 구성하고 검증하는 방식이다. 파일 환경은 여러 형식·버전·디렉터리에 흩어진 자료에서 권위 있는 정보와 관계를 복원해 전문 산출물로 변환하게 하며, 시나리오 레지스트리는 33개 도메인, 318개 직업, 1,208개 납품물 군을 포괄한다. 검색 환경은 후보 출처 탐색, 수집, 출처 선별, 상충 근거 조정, 주장-근거 정렬 및 불확실성 표기를 요구한다. 코드 환경은 저장소·의존성·프로세스를 변경하고 실행 테스트로 검증한다. 수집 과제는 기준 상태에서 실패하고 참조 변경 뒤 통과해야 하는 fail-to-pass 테스트와 양쪽 상태에서 통과해야 하는 pass-to-pass 테스트를 확인하며, 합성 과제는 실제 완수 없이 보상을 얻는 공격으로 검증기를 강화한다. 획득 중심 파일·검색 과제에서는 그럴듯한 후보 수와 핵심 근거 전이 수를 도구 호출 예산으로 나눈 ρacq를 획득 압력 좌표로 쓰되, 보편적 난이도 지표라고 주장하지는 않는다. 학습에 쓰는 궤적은 불변 world manifest, 격리 샌드박스, 도구·파일 변경·검증기 버전·종료 사유를 포함해 재생 가능해야 한다.
- 파일·검색·코드 환경은 각각 권위와 변환, 발견과 근거 정렬, 실행 가능한 변환과 검증을 중점적으로 다루지만, 하나의 궤적에서 함께 구성될 수 있다.
- 생성된 과제·참조 해법·채점기가 동일한 오류를 공유하지 않도록, 검증은 독립 도출, 출처 기록, 샌드박스 실행 테스트, 제한된 의미 검토에 근거한다.

파일·검색·코드 환경군의 구성 방식과 검증 경계
3.2 Apodex Agent Team 1.1: Interactive Self-Organizing Teams
- Apodex Agent Team 1.1은 고정된 역할 목록 대신 리드 에이전트가 문제에 맞춰 하위 과업과 전문 서브에이전트를 구성하고, 그 분해를 영속적인 Task Board에 기록한다. 보드 항목에는 제한된 목표, 의존성, 담당자, 해결 상태, 근거와 산출물 참조가 들어간다. 따라서 반환된 결과는 의존 과업을 즉시 열 수 있고, 잘못되거나 대체된 전제는 그 후속 항목만 무효화하며, 느린 작업 분기가 독립 작업 전체를 멈추지 않게 한다. 실행 중 사용자 개입은 요구 명확화, 사실 수정, 우선순위·예산·기한 변경, 새 근거 추가, 중단·재개를 포함하며, 정책은 무엇을 보존·무효화·통지할지 학습한다. 비대칭 검증은 생성 전체를 다시 풀기보다 특정 주장·근거·납품 조건을 공격하도록 검증 범위를 좁힌다. Adaptive Max Team Effort는 불확실하거나 논쟁적이고 결론에 중요한 주장에만 독립 가설·방법·출처를 추가 배정한다. 마지막으로 근거 그래프가 주장을 지지됨·논쟁됨·미해결로 분류하고, 작성 에이전트가 해당 상태와 납품 계약에 맞춰 결과물을 작성한다.
3.3 AgentOS: An Execution Substrate for Long-Horizon Work
- AgentOS는 단일 에이전트와 Agent Team이 함께 쓰는 장기 실행 기반이다. 작업공간은 파일 F, 검색 근거 Q, 실행 상태와 로그 C, 산출물 색인 I, 출처·의존 그래프 G, 선택적 제어 상태 K로 구성된다. /inputs는 읽기 전용 입력, /workspace는 계산과 후보 산출물, /outputs는 최종 납품물 공간이며, 배포 환경은 선택적으로 읽기 전용 문서 라이브러리 /shares를 제공할 수 있다. Task Board는 메시지 이력 밖의 K에 두고, Agent Bus는 서브에이전트의 생성·대기·실행·보고 상태를 관리한다. 보드의 ‘resolved’는 프로세스 종료가 아니라 반환 결과가 충분히 점검되었음을 뜻하므로 실행 상태와 의미적 해결 상태를 분리한다. 계획 모드에서는 위임·파일 변경·최종화 전에 보드 계획을 요구하고, 일반 최종화는 활성 항목이 모두 해결 또는 취소된 뒤에만 허용한다. 컨텍스트 압축은 추론 엔드포인트가 보고한 토큰 사용량을 기준으로 먼저 오래된 도구 관찰 본문을 제거하고, 부족할 때만 LLM 요약을 수행한다. 시간 예산은 soft deadline에서 이미 얻은 결과를 정리한 뒤 제한된 도구 없는 최종화를 시도하며, hard timeout은 최후 수단이다. 단일 게시자 lease와 정확한 manifest는 선언되지 않았거나 오래되었거나 빈 파일이 최종 납품물로 처리되는 일을 막는다. 다만 이 런타임 계약은 과학적 결론이나 출처의 정확성을 보장하지 않으며, 조정 상태와 파일시스템의 원자적 공동 체크포인트, 과거 파일 상태 복구는 제공하지 않는다.

공유 AgentOS 작업공간 위의 Agent Team 조정 구조와 산출물 게시 경계

AgentOS 실행 메커니즘과 대응 실패 모드
3.4 Training
- 훈련은 환경·조정 설계를 모델 행동으로 전환한다. SFT 혼합물은 일반 추론, 도구 사용, 검색, 파일 상호작용, 코딩, 수학, 과학·금융 추론, 전문 납품, 다중 에이전트 조정을 공통의 상태 기반 상호작용 형식으로 통일한다. 잘못된 도구 상호작용, 불일치 상태, 관찰 무시, 미완성 납품 궤적은 제외한다. 정답이 있는 과제에는 reject sampling을 적용하고, 루브릭 과제에는 단일 종합 판정 대신 과제 관련 차원과 임계값을 이용해 시연을 선별한다. 일반·에이전트·코딩 등 능력 영역별 SFT 변형을 학습한 후 model soup으로 병합한 체크포인트를 이후 최적화의 초기값으로 사용한다. PIVOT-RL은 긴 궤적에서 종료 보상만으로 책임을 배분하기 어려운 문제를 겨냥한다. 사후 분석으로 비생산적 전략 시작, 근거 부족, 도구 오용, 가정 미수정이 발생한 pivot을 찾고, 유용한 접두부와 해당 실행 상태는 유지한 채 짧은 교정 힌트가 달린 국소 후속 과제를 구성한다. 힌트는 예측 대상이 아니고 추론 시 제공되지 않으며, 힌트 없는 전체 과제와 섞어 학습한다. 완료 궤적은 느린 에피소드를 기다리지 않고 비동기로 최적화에 투입한다. Figure 4는 RL rollout step이 증가할수록 held-out 검색·지식·과학 평가의 원점수와 평활 점수가 전반적으로 상승하는 추세를 보이지만, 개별 단계의 점수는 변동한다.

강화학습 계산 증가에 따른 held-out 검색·지식·과학 과제 점수 추세
4.2 Main Results
- 평가는 최소 오케스트레이션의 ReAct와 동적 서브에이전트 생성·집중 검증·공유 계획 갱신을 허용하는 Agent Team을 구분한다. Table 3에서 Apodex 1.1은 APEX-Agents 34.4(ReAct)와 38.5(Agent Team), GDPVal 승률 69.5%와 78.8%, FrontierFinance 48.7과 54.3을 기록했다. FrontierFinance에서 Agent Team은 ReAct보다 54.3−48.7=5.6점 높으며, Table 3의 해당 열에 제시된 비교 행 중 최고값이다. 반면 APEX-Agents에서는 Claude Opus 5가 42.3으로 38.5보다 3.8 높고, GDPVal에서는 Claude Opus 5가 89.4%로 78.8%보다 10.6%p 높다. Table 4에서 FrontierScience-Research는 55.0%에서 63.3%로 8.3%p 상승했으며, 해당 열의 제시 비교 행 중 최고값이다. BioMysteryBench Human-difficult 17개 과제에서는 23.5%(4/17)에서 35.3%(6/17)로 11.8%p, 2과제 증가했으나 Claude Opus 5의 49.4%보다 14.1%p 낮다. HLE는 53.2에서 56.1로 2.9점, DeepSearchQA F1은 88.2에서 92.4로 4.2점 상승했다. 35B Mini는 Table 5에서 ReAct 기준 FrontierFinance 40.0, FrontierScience-Research 45.0, APEX-Agents 24.2를, Agent Team 기준 50.2, 51.7, 27.7을 기록해 각각 10.2, 6.7, 3.5점 높다. Mini의 FrontierFinance 50.2는 Table 5의 선택 비교 행 중 최고값이지만, 일부 독점 모델의 매개변수 수가 공개되지 않아 모델 규모 효율성은 성능 대역 수준으로만 비교할 수 있다.

전문 업무·금융·과학 연구·일반 추론 벤치마크에서 Apodex와 비교 시스템의 성능

전문 업무·금융·비즈니스 시뮬레이션 성능 비교

과학 연구·일반 추론·심층 검색 성능 비교

35B Apodex Mini 모델의 작업·금융·과학 연구 성능 비교
4.3 Capability Analysis
- 능력 분석은 전문 업무, 과학, 검색, 수학, 코딩을 과제별로 분리한다. GDPVal은 9개 산업의 44개 직업에서 완성된 업무 산출물 품질을 승률로 평가하고, APEX-Agents는 33개 데이터 풍부 환경에서 전문가가 만든 480개 장기·다중 애플리케이션 작업의 지속 실행과 엄격한 완료 기준을 평가한다. GDPVal에서 Agent Team 78.8%는 ReAct 69.5%보다 9.3%p 높고, APEX-Agents의 38.5는 34.4보다 4.1점 높다. Apodex 1.0의 APEX-Agents 16.5와 ReAct 34.4의 차이는 17.9점이며, 34.4/16.5≈2.08배다. FrontierFinance는 220개 개방형 질의를 11,543개 전문가 작성·출처 부착 루브릭 항목으로 평가하며, headline 점수는 무응답을 0점으로 처리한 질의별 거시 평균 루브릭 충족률이다. 수학에서 Table 6의 MathArena 프로토콜 점수는 Apodex 1.0 Agent Team 대비 IMO 2025에서 12.5→36.5, IMO 2026에서 13.0→30.5, USAMO 2026에서 5.8→26.5로 상승했다. Agent Team 점수는 각 세트의 기준선 35·29·25를 각각 넘지만, 이는 해당 과제 세트의 기준선 충족에 관한 비교다. 코딩은 Terminal-Bench 2.1 70.8, SWE-bench Verified 77.7이며, Table 7의 각 비교 행에는 더 높은 점수도 있으므로 코딩 최고 성능을 뜻하지 않는다.

경시 수준 수학 증명 과제의 추론 성능

터미널 및 저장소 기반 코딩 에이전트 성능
4.4 Internal Evaluation
- 내부 평가는 구조화된 검색과 종단간 과학 납품을 다룬다. FrontierSearchBench는 검증 가능한 심층 검색 과제 41개에서 산출물을 구조화된 주장으로 추출하고, 고정된 판정 모델 패널로 정답 차원에 정렬한 뒤 결정론적 루브릭으로 과제별 점수 ri∈[-1,1]를 계산한다. 보고 점수는 41개 과업 계약의 비가중 평균에 100을 곱한 값이므로 범위는 [-100,100]이며, 오답 주장에는 음수 페널티가 적용된다. Table 8에서 Agent Team은 평균 69.1, 양성 87.8%, 무득점 9.8%, 음성 2.4%를 기록했고, ReAct의 57.0, 75.6%, 19.5%, 4.9%와 비교하면 평균은 12.1점 높고 무득점 비율은 9.7%p 낮다. 69.1은 표에 제시된 시스템 중 최고 평균이며 9.8%는 최저 무득점 비율이다. FrontierResearchBench는 Docker 기반 과학 작업 97개에서 코드·구조화 데이터·그림·도메인 파일·보고서의 일관성을 확인하고, 모든 요구를 충족한 과업의 비율을 Pass Rate로 센다. Table 9에서 Agent Team은 FrontierAgent 하니스에서 12.4%, 같은 모델의 Claude Code 행은 10.3%다. 그러나 GPT-5.6-Sol/Codex와 Grok-4.6/Claude Code는 각각 다른 모델·하니스 조합에서 20.6%를 기록했으므로, 이 표는 직접적인 모델 우위 비교가 아니라 난도가 높은 종단간 과학 납품 문제의 현황으로 해석해야 한다.

구조화 심층 검색 과제의 정규화 점수와 과제별 결과 분포

종단간 과학 연구 납품 벤치마크 통과율
4.5 Heavy-Duty Solver (HDS6) Analysis
- HDS6는 최종 정답만이 아니라 기록된 실행 궤적의 과정을 판정하는 틀이다. 장기 상태 일관성, 근거 충실도, 가설 관리, 경계·실패 추론, 도구 사용·실행 상태 관리, 검증 하 자기 교정의 여섯 능력에 각각 네 개 항목을 두어 총 24개 항목을 0·1·2로 채점한다. 매퍼가 항목별 로그 창을 만들고, 판정자·검토자·중재자가 순차적으로 판단한다. 도구 결과 조작이나 실제 로그에 없는 행동 서술이 있으면 integrity gate가 가중 점수와 무관하게 전체 궤적을 0점 처리한다. 원문은 Figure 6에서 Initial Decomposition의 +1.3과 Final Verification의 +0.8을 가장 큰 단일 항목 변화로 보고한다. 다만 그림에는 원시 항목값이 표기되지 않아 이 차이를 독립적으로 재계산할 수는 없다. Deep Discover의 v1.0은 397B Agent Team의 독립 8회 집계이고 v1.1은 단일 실행이며, Deep Solve는 397B ReAct, Deep Research는 35B ReAct다. 세 패널은 과제군·모델 크기·실행 모드·집계 방식이 다르므로, 저자들이 명시한 대로 패널 내부의 버전 비교로만 읽어야 하며 패널 간 절대 수준 비교나 엄밀한 단일 실행 절제로 해석할 수 없다.

HDS6 과정 능력 분류와 다단계 궤적 판정 절차

세 실행 설정에서 Apodex 1.0과 1.1의 HDS6 과정 능력 비교
부록
- 부록 A는 원시 파일과 납품 조건을 받아 답변이 아니라 검증 가능한 산출물 묶음을 생성한 세 가지 사례를 제시한다. 사례는 단백질 시뮬레이션 준비, 형광 현미경 이미지 정량, 돼지 RNA-seq 코호트의 WGCNA 분석을 다루며, 과업 분해와 병렬 작업, 실패 복구, 독립 검증, 산출물 manifest 및 파일 점검을 기록한다. 부록 B는 기여자 명단을 수록한다.
짧은 생각
이 보고서에서 다중 에이전트의 가치는 단순한 병렬 표본 수보다, 작업 보드에 기록한 의존성과 중간 결과가 돌아온 뒤의 재계획에 둔다는 점이 설득력 있다. 특히 부록의 이미지 정량 사례는 같은 원자료에서도 측정 정의에 따라 집단 차이의 방향까지 달라질 수 있음을 보이고, 별도 검증자가 측정 정의와 임계값 민감도를 판정해 공유 ROI 평균을 채택한다. 이는 검증이 결과를 재실행하는 절차에 그치지 않고 과업에서 무엇을 측정해야 하는지를 결정하는 과정임을 보여 준다. 다만 ReAct와 Agent Team의 차이는 학습된 조정 정책, 동적 병렬성, 추가 도구·모델 호출이 함께 반영된 결과다. 과제별 총 도구 호출 수, 벽시계 시간, 모델 호출 비용을 맞춘 비교와 Task Board·비대칭 검증·근거 그래프 합성의 개별 절제가 제시된다면, 어떤 설계가 성능 향상과 비용 증가에 기여했는지를 더 명확히 판단할 수 있을 것이다.