Gorio Tech Blog search

AlayaWorld: Long-Horizon and Playable Video World Generation 요약 설명

|

목차

이번 글에서는 AlayaWorld: Long-Horizon and Playable Video World Generation 논문의 핵심 포인트만 간단히 정리한다.

  • 2026년 7월 7일(Arxiv)
  • AlayaWorld Team, Zhang, Kaipeng, Li, Chuanhao, Zhan, Yifan, Ge, Yongtao, Yin, Yuanyang, Tan, Jiaming, He, Kang, Fan, Liaoyuan, Liu, Ruicong, et al.
  • Alaya Lab
  • 논문 링크
  • Project Page

영문판 보기


요약

  • AlayaWorld는 플레이 가능한 비디오 세계에서 사용자 제어, 장소 재방문 시 일관성, 긴 자기회귀 생성 과정의 안정성, 상호작용에 필요한 실행 속도라는 4가지 문제를 다룬다. 명시적으로 설계한 객체와 규칙으로 세계를 구축하는 대신 LTX-2.3을 파인튜닝한 프레임워크를 제시한다.
  • 이 설계는 렌더링된 3D 캐시와 AdaLN 방식의 카메라 조건 부여, 청크 경계에서의 프롬프트 전환, 압축된 프레임 이력, 오류 뱅크, DMD 기반 소수 단계 증류를 결합한다. 캐시와 압축된 이력은 각각 공간·시간 정보를 제공하며, 드리프트가 발생한 이력과 샘플링한 오류를 사용한 학습은 생성이 누적되면서 나타나는 결함을 줄이는 데 초점을 맞춘다.
  • 논문은 카메라 제어, 프롬프트로 지정한 행동, 장소 재방문, 1분 생성, 다양한 시각적 스타일의 정성적 사례를 제시한다. 약 1초 길이의 청크마다 4단계의 노이즈 제거를 거쳐 720p 비디오를 24fps로 생성한다고 명시하지만, 지연 시간·제어 정확도·일관성에 관한 수치 결과는 보고하지 않는다. 완전한 기술 세부사항과 실험 결과, 전체 코드베이스는 7월 중순에 공개할 예정이라고 밝힌다.

1 Introduction

수작업으로 만드는 가상 세계에서는 객체, 애니메이션, 상호작용 규칙을 미리 지정해야 한다. 반면 AlayaWorld는 사용자 상호작용을 조건으로 관측 장면을 자기회귀적으로 생성하며, 게임형·현실형·합성 장면에서 이동과 행동을 시연한다. 프로젝트 페이지는 https://alaya-lab.github.io/AlayaWorld/ 에 있다.

이 모음 그림은 실내와 실외, 게임형 화면과 사실적 화면, 1인칭 효과와 마주침 장면을 나란히 보여준다. 일관성을 측정하기보다는 AlayaWorld가 제시하는 장면과 행동의 범위를 보여준다.

여러 시점과 시각적 영역에 걸친 탐색 가능 장면 및 프롬프트 기반 행동 모음
여러 시점과 시각적 영역에 걸친 탐색 가능 장면 및 프롬프트 기반 행동 모음

관련 연구에서는 합성의 기반이 되는 비디오 생성 모델과, 생성이 이어지는 동안 행동에 반응하는 상호작용형 세계 모델을 구분한다. 이어지는 방법 검토에서는 기술적 요구사항을 상호작용, 일관성, 안정성, 실행 속도를 중심으로 정리한다.

2.1 Video Genration Models

DiT 노이즈 제거기를 사용하는 확산·잠재 확산 비디오 모델은 미리 정한 경로를 따라 클립을 생성하는 기반 모델이다. 논문은 Open-Sora, HunyuanVideo, CogVideoX, Wan, LTX-Video 등의 오픈소스 사례를 다루지만, 비디오를 생성하는 능력만으로는 지속적인 사용자 제어가 가능하지 않다고 설명한다.

2.2 Interactive World Models

관련 연구에는 행동 조건을 사용하는 Genie, GameNGen과 Oasis 같은 게임 전용 신경망 엔진, Yume 같은 자유 탐색 시스템이 포함된다. Genie 3, Matrix-Game, Hunyuan-GameCraft, Lingbot-World처럼 스트리밍 상호작용이나 장시간 일관성을 목표로 하는 시스템도 다룬다.

3 AlayaWorld

AlayaWorld는 LTX-2.3을 파인튜닝한 자기회귀 DiT를 사용하며, 카메라 제어, 프롬프트 갱신, 공간·시간 메모리, 드리프트에 대한 견고성, 빠른 샘플링을 위한 장치를 갖춘다. 이 버전은 각 장치의 역할을 설명하지만, 아키텍처의 전체 사양이나 학습 절차를 완전히 제시하지는 않는다.

3.1 Interaction

프레임워크는 시점을 바꾸는 탐색과 생성된 세계에서 일어나는 일을 바꾸는 프롬프트 기반 행동이라는 2가지 상호작용을 지원한다. 두 상호작용 모두 이어지는 비디오 생성의 조건으로 쓰인다.

3.1.1 Navigation

탐색 관련 선행 기법은 외부 카메라 조건 부여, 기하 정보를 반영한 트랜스포머 구조, 렌더링된 기하 정보로 나뉜다. 포즈나 행동을 조건으로 주면 생성기가 요청받은 경로에 반응할 수 있다. 반면 기하학적 대리 표현을 렌더링하면 이미지 공간의 안내 정보를 얻지만, 기하 추정과 캐시 유지가 필요하다.

AlayaWorld는 GEN3C를 따라 3D 캐시를 유지하고 플레이어가 목표로 하는 카메라 시점에서 이를 렌더링한다. 동시에 AdaLN 방식의 변조로 간결한 카메라 조건을 DiT에 주입한다. 렌더링된 뷰는 요청한 시점의 외형과 기하 정보를 제공하며, 변조는 저자들이 피하려는 무거운 카메라 융합 모듈 없이 경로 정보를 전달한다.

3.1.2 Prompt-driven Action

프롬프트 전환은 청크 경계에서 텍스트 조건을 교체하므로, 이전 비디오를 다시 생성하지 않고도 행동 프롬프트를 다음 청크에 반영할 수 있다. 논문은 주문 시전, 무기 전투, 괴물 소환을 예로 들지만, 텍스트 조건 갱신을 넘어서는 제약 없는 행동 인터페이스는 명시하지 않는다.

3.2 Consistency

논문은 떠났다가 돌아오는 경로에서의 일관성과 전진 생성 중 시각적 드리프트가 없는 상태를 구분한다. 중간 영상이 안정적으로 보여도 재방문한 장소는 달라질 수 있다. 시간 기준 메모리는 생성 이력에 따라 관측 장면을 보존하거나 압축하고, 공간 기준 메모리는 시점이나 기하 정보를 바탕으로 관련 정보를 검색한다. 후자의 성능은 공간 표현의 품질에 좌우된다.

AlayaWorld는 명시적인 3D 캐시를 재투영해 이전에 관측한 영역을 활용하고, Frame Preservation을 따라 최근 프레임을 가벼운 임베딩으로 압축한다. 캐시는 주로 정적인 장면 구조를 유지하며, 임베딩은 정적 캐시만으로 표현할 수 없는 최근 움직임과 시간적 맥락을 제공한다.

3.3 Stability

안정성은 장소 재방문 여부와 관계없이 자기회귀 생성이 길어질수록 품질이 저하되는 문제를 다룬다. 논문은 조건 입력, 학습, 샘플링 일정, 예측 대상에서 개입할 수 있다고 정리하며, 추론 중에는 오류가 포함되었을 수 있는 생성 프레임을 반복해서 조건으로 사용한다고 지적한다.

AlayaWorld는 Helios를 따라 드리프트가 발생한 이력으로 학습하고, 생성 과정에 남은 결함을 모은 오류 뱅크를 도입한다. 뱅크에서 뽑은 샘플로 메모리 조건과 목표 세그먼트를 모두 교란해, 불완전한 이력과 후속 생성에 나타나는 오류를 모델이 경험하게 한다. 논문은 이러한 동시 교란의 효과를 분리한 소거 실험은 제공하지 않는다.

3.4 Runtime

논문은 생성 결정부터 프레임 표시까지의 시각적 지연과, 사용자 의도가 바뀐 순간부터 그 변화가 출력에 반영되기까지의 의미적 지연을 구분한다. 소수 단계 증류는 생성 연산량을 줄이는 데 초점을 맞추고, 조건을 자주 갱신할 수 있는 지점은 명령 변화에 대한 반응성을 높이는 데 초점을 맞춘다.

AlayaWorld는 DMD 기반 증류, 짧은 시간 청크, 청크 경계에서의 텍스트 조건 갱신을 사용한다. 따라서 프롬프트가 바뀌어도 전체 시퀀스를 다시 생성할 필요는 없지만, 논문은 실제 경과 시간으로 측정한 지연이나 캐시 재사용·KV 재캐싱 기법과의 실행 속도 비교는 보고하지 않는다.

4 Qualitative Results

정성적 결과에서는 LTX-2.3-fine-tuned 자기회귀 모델로 720p 비디오를 24fps로 생성한다. 약 1초 길이의 청크마다 노이즈 제거에 4단계를 사용한다. 저자들은 공개 구현이 허용하는 경우 비교 대상에도 동일한 입력 조건과 해상도를 사용했다고 밝힌다.

4.1 Camera Control

Figure 2는 다양한 카메라·행동 명령에 따른 시퀀스를 보여주며, 패널에는 키보드 방식의 조작 아이콘이 표시된다. 프레임들은 여러 장면에서 시점과 위치가 바뀌는 모습을 보여주지만, 논문은 카메라 경로 오차를 수치로 보고하지 않는다.

연속된 프레임은 여러 배경에서 시점이나 이동이 바뀌는 모습을 보여주며, 표본 아래에는 조작 아이콘이 있다. 탐색 명령에 대한 반응을 살펴볼 수 있지만, 요청한 카메라 포즈와 실제 포즈를 수치로 비교하지는 않는다.

다양한 탐색 및 행동 명령에 따른 카메라 제어 비디오 시퀀스
다양한 탐색 및 행동 명령에 따른 카메라 제어 비디오 시퀀스

4.2 Open-ended Action

Figure 3은 생성 도중 프롬프트를 변경한 뒤 나타나는 여러 행동과 환경 효과를 보여준다. 텍스트 조건은 이전 비디오를 다시 생성하지 않고 청크 경계에서 갱신된다. 다만 새 행동이 나타나기까지의 지연은 측정하지 않는다.

중앙의 초기 화면 주변에 행동 시퀀스가 배치되어 있고, 다른 장면에서 효과가 나타나는 3프레임 사례도 추가로 제시된다. 패널은 프롬프트 변경 뒤 생성된 다양한 행동을 보여주지만, 프롬프트에 대한 반응 시간을 측정하지는 않는다.

프롬프트 기반 행동 변경으로 생성한 정성적 시퀀스
프롬프트 기반 행동 변경으로 생성한 정성적 시퀀스

4.3 Consistency

Figure 4는 떠났다가 돌아오는 경로의 표본을 다른 상호작용형 세계 모델과 비교한다. 저자들은 비교 사례에서 시각적 품질 저하, 부정확한 제어, 달라진 장면 내용을 지적하며, 자체 사례에서는 식별 가능한 방과 갤러리의 특징이 유지된다고 제시한다. 이 비교는 루프 폐합을 정량적으로 평가한 결과가 아니라 시각적 비교다.

각 행은 방과 갤러리의 초기 화면을 연속해서 방향을 전환한 뒤의 프레임과 비교한다. 비교 대상의 사례에서는 장면 변화가 더 뚜렷하지만, AlayaWorld의 사례에서는 알아볼 수 있는 특징이 유지된다. 따라서 시각적 비교의 초점은 재방문 시의 일관성에 있다.

기존 방법과의 이탈·재방문 장면 일관성 비교
기존 방법과의 이탈·재방문 장면 일관성 비교

4.4 Long-Horizon Generation

Figure 5는 1분 길이의 생성 시퀀스 4개에서 0s, 20s, 40s, 60s의 프레임을 보여준다. 이 프레임으로 전진 생성 중의 외형을 살펴볼 수 있지만, PDF에는 드리프트 점수, 더 긴 구간의 측정값, 안정성에 대한 구성 요소별 기여도 검증이 없다.

그림에 제시된 4개 시퀀스에는 0s, 20s, 40s, 60s로 표시된 프레임이 포함된다. 이 표본으로 1분 동안의 모습을 살펴볼 수 있지만, 표시된 구간 이후의 동작까지 확인할 수는 없다.

1분 길이의 자기회귀 생성에서 추출한 프레임
1분 길이의 자기회귀 생성에서 추출한 프레임

4.5 Diverse Styles

Figure 6은 동일한 탐색 경로를 사실적 스타일, Minecraft, 수묵화, 유화, 사이버펑크, 픽셀 아트, Zelda에서 영감을 받은 스타일로 보여준다. 정렬된 표본은 렌더링 스타일이 달라도 장면 구조와 카메라 움직임이 유사함을 정성적으로 보여준다.

정렬된 3프레임 시퀀스는 서로 다른 렌더링 스타일에서도 비슷한 거리 배치를 따라 탐색하는 모습을 보여준다. 반복되는 경로를 통해 외형이 달라질 때 장면 구조가 유지되는지 정성적으로 살펴볼 수 있다.

여러 시각적 스타일로 표현한 동일한 탐색 경로
여러 시각적 스타일로 표현한 동일한 탐색 경로

5 Contributions

기여자 목록은 Kaipeng Zhang을 Core Lead로, Chuanhao Li를 Lead로 명시한다. Chuanhao Li, Kaipeng Zhang, Yifan Zhan, Yongtao Ge, Yuanyang Yin을 Core Contributors로, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao를 Contributors로 기재한다. 서론은 이 프로젝트를 전체 기술 스택을 아우르는 오픈소스 프로젝트로 설명하면서, 전체 코드베이스와 완전한 실험 결과는 7월 중순에 공개할 예정이라고 밝힌다.

짧은 생각

이 방법은 재방문 시의 공간적 일관성과 전진 생성 중의 안정성을 구분한다. 3D 캐시는 전자를 해결하기 위한 장치이고, 드리프트가 발생한 이력으로 하는 학습과 오류 뱅크는 후자를 대상으로 한다. Figure 4와 Figure 5는 각각의 상황을 보여주지만, 표시된 결과를 개별 구성 요소의 효과로 돌릴 수 있는 소거 실험은 없다.

이 버전에서는 실행 속도에 관한 주장을 측정 결과로 뒷받침하지 않는다. 청크당 4단계의 노이즈 제거와 24fps 출력은 생성 설정을 나타낼 뿐, 프레임이 실제로 계산되고 표시되는 속도를 알려주지 않는다. 시각적·의미적 지연 측정이 없으므로, 그림은 상호작용 방식을 보여줄 뿐 실시간 성능을 검증하지는 않는다.