20 Jul 2026
|
Paper Review
Reinforcement Learning
On-Policy Distillation
LLM Evaluation
이번 글에서는 LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks 논문의 핵심 포인트만 간단히 정리한다. 2026년 7월 20일(Arxiv), arXiv Ye, Tianzhu, Dong, Li, Chen, Guanheng, Zhu, He, Wu, Xun, Huang, Shaohan, Wei, Furu. Microsoft Research, Tsinghua University, Peking University 논문 링크 영문판 보기 요약 이 논문은 루브릭 기반 LLM 평가가 흔히 스칼라...
15 Jul 2026
|
Paper Review
KV Cache
Inference-Time Learning
LLM Serving
This article explains the key points of Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel. 2026-07-15 (arXiv) Schelpe, Sietse. Corbenic AI Paper Project Page Read this article in Korean Summary Taliesin persists a verified solution as KV state and grafts it...
15 Jul 2026
|
Paper Review
KV Cache
Inference-Time Learning
LLM Serving
이번 글에서는 Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel 논문의 핵심 포인트만 간단히 정리한다. 2026년 7월 15일(Arxiv) Schelpe, Sietse. Corbenic AI 논문 링크 Project Page 영문판 보기 요약 Taliesin은 검증된 풀이를 KV 상태로 저장하고 새 추론 문맥에 graft한다. Galahad는 모델...
14 Jul 2026
|
Paper Review
Harness Optimization
LLM Evaluation
Test-Time Scaling
This article explains the key points of Rethinking the Evaluation of Harness Evolution for Agents. 2026-07-14 (arXiv) Wang, Yike, Zhu, Huaisheng, Hu, Zhengyu, Yuan, Yige, Chen, Zhengyu, Senthil, Shakti, Hajishirzi, Hannaneh, Tsvetkov, Yulia, Dasigi, Pradeep, Xiao, Teng. Allen Institute for AI, University of Washington, Independent Paper Github Project Page Read...
14 Jul 2026
|
Paper Review
Harness Optimization
LLM Evaluation
Test-Time Scaling
이번 글에서는 Rethinking the Evaluation of Harness Evolution for Agents 논문의 핵심 포인트만 간단히 정리한다. 2026년 7월 14일(Arxiv) Wang, Yike, Zhu, Huaisheng, Hu, Zhengyu, Yuan, Yige, Chen, Zhengyu, Senthil, Shakti, Hajishirzi, Hannaneh, Tsvetkov, Yulia, Dasigi, Pradeep, Xiao, Teng. Allen Institute for AI, University of Washington, Independent 논문 링크 Github Project...