Gorio Tech Blog search

4DAnyone: Create Anyone in 4D from a Casual Monocular Video 요약 설명

|

목차

이번 글에서는 4DAnyone: Create Anyone in 4D from a Casual Monocular Video 논문의 핵심 포인트만 간단히 정리한다.

  • 2026년 8월 20일(Arxiv), arXiv
  • Jin, Yudong, Xie, Tao, Zhang, Qihang, Shen, Zehong, Xu, Zhen, Shen, Yujun, Bao, Hujun, Zhou, Xiaowei, Xu, Yinghao.
  • State Key Lab of CAD&CG, Zhejiang University, Robbyant, Chinese University of Hong Kong, Ant Group, Hong Kong University of Science and Technology
  • 논문 링크
  • Github
  • Project Page

요약

  • 4DAnyone은 보통 카메라 움직임이 완만하고 카메라 내부·외부 파라미터를 알 수 없는 단안 인간 비디오에서 재구성에 사용할 수준의 다중 시점 비디오를 생성하고, 이를 4D Gaussian Splatting(4DGS)으로 변환하는 프레임워크이다. 저자들은 4DGS에 필요한 수십 개 목표 시점을 하나의 Diffusion Transformer(DiT) 순전파에 모두 담기 어려운 bounded-attention-context 문제를 핵심 병목으로 제시한다. 이에 누적 참조 영상을 고정 길이의 혼합 해상도 문맥으로 압축하는 Reference Context Packing(RCP), 확산 과정에서 목표 시점 묶음을 바꾸는 Target Context Routing(TCR), 깊이 버퍼링한 3D 골격 조건을 결합한다. DNA-Rendering과 DyMVHumans 평가에서 저자들은 생성 비디오 일관성, 4DGS 재구성, 생성 비디오 재구성의 세 조건에서 비교 기준선보다 우수한 결과를 보고한다.
카메라 내부·외부 파라미터를 알 수 없는, 보통 카메라 움직임이 완만한 단안 비디오에서 다중 시점 비디오와 자유 시점 4D 볼류메트릭 비디오를 생성하는 개요
카메라 내부·외부 파라미터를 알 수 없는, 보통 카메라 움직임이 완만한 단안 비디오에서 다중 시점 비디오와 자유 시점 4D 볼류메트릭 비디오를 생성하는 개요

문제 설정과 4DGS 재구성 파이프라인

  • 입력은 미보정 단안 소스 비디오 Vsrc이며, 목표는 피사체 주위의 지정된 정적 시점에서 v개 인간 비디오를 생성해 자유 시점으로 렌더링 가능한 4DGS를 만드는 것이다. 단안 비디오를 직접 재구성하는 방법은 대체로 카메라 파라미터를 요구하고, 관측하지 못한 신체 부위의 외관을 복원하기 어렵다. 제안 파이프라인은 GVHMR로 소스 영상의 3D 골격 시퀀스를 추정하고, 각 목표 카메라에서 깊이 버퍼링 골격 비디오를 렌더링한다. 이 조건으로 목표 시점 비디오를 생성한 다음, 생성된 다중 시점 영상을 FreeTimeGS에 입력해 4DGS를 최적화한다.

3.1 Overview

  • 그림 2의 파이프라인에서 VAE는 소스 비디오와 참조·목표 비디오를 잠재 토큰으로 변환한다. 골격 인코더는 목표 시점의 깊이 버퍼링 골격에서 토큰을 만들고, 이를 각 확산 시점의 노이즈 잠재 토큰에 잔차로 더한다. 소스 토큰, RCP 참조 토큰, 골격 조건이 반영된 목표 토큰은 시점 축으로 연결되어 DiT의 비디오 어텐션, 다중 뷰 어텐션, 텍스트 교차 어텐션을 통과한다. 생성한 목표 비디오는 이후 생성 라운드의 RCP 참조로 사용할 수 있으며, 많은 목표 시점은 TCR로 묶어 복원한다.
3D 골격 조건 다중 뷰 비디오 생성과 FreeTimeGS 기반 4DGS 학습 파이프라인
3D 골격 조건 다중 뷰 비디오 생성과 FreeTimeGS 기반 4DGS 학습 파이프라인

3D 기하 조건과 확장 가능한 다중 뷰 일관성

  • 시점 수가 단일 DiT의 실용적 메모리·연산 한도를 넘으면 목표 시점을 여러 그룹으로 나누어야 한다. 이때 모든 이전 생성 시점을 완전한 참조로 붙이면 참조 문맥 길이와 계산량이 참조 수 N에 비례하는 O(N)으로 증가하며, 서로 분리된 목표 그룹은 직접 정보를 교환하지 못해 전역 구조가 표류할 수 있다. 저자들은 야생 환경 단안 영상에서 조밀한 깊이를 신뢰성 있게 추정하기 어렵다는 이유로, 기하 신호의 밀도보다 정확성을 우선하는 원칙을 택한다. 따라서 조밀한 깊이 대신 단안 인간 동작 복원으로 얻은 희소 3D 골격을 사용하고, RCP는 외관 참조 병목을, TCR은 그룹 간 구조 전달 병목을 담당한다.

3.2 3D-Aware Skeleton Conditioning

  • 3D-Aware Skeleton Conditioning은 2D 골격 그림이 잃어버리는 신체 부위의 앞뒤 가림 관계를 보완한다. 3D 키포인트를 픽셀 단위 z-buffer로 래스터화하여 가까운 부위가 먼 부위를 가리게 하므로, 입력 채널을 더 늘리지 않고도 가림을 반영한 골격 영상을 만든다. 본문 기준으로 308개 Goliath 키포인트에서 몸 17개, 발 6개, 손바닥 수준 손 10개, 목·어깨·팔꿈치 보조점 7개를 포함한 40개를 남기고, 얼굴 238개와 손가락 관절 30개는 제외한다. 얼굴 표정과 미세 손 형상은 소스 비디오 참조에서 학습하도록 하며, 골격 인코더의 마지막 투영층은 0으로 초기화해 학습 초기에 사전학습 DiT의 동작을 보존한다.

3.3 Scalable Multiview Consistency

  • RCP는 표준 Wan2.2 patchify의 공간 커널·스트라이드 (1, 2, 2)를 압축비 r에 대해 (1, 2r, 2r)로 바꾼다. 따라서 r=2와 r=4는 표준 토큰 수의 각각 1/4와 1/16을 만들며, 고정 RCP 문맥은 소스 1배 토큰, 1라운드 참조 3개의 2배 압축 토큰, 2라운드 참조 4개의 4배 압축 토큰으로 구성된다. 학습 중에는 4배 압축 참조만, 또는 2·4배 압축 참조를 함께 확률 0.1로 0 처리한다. 일반 추론은 farthest-point sampling으로 참조 시점을 고르고 두 라운드에 걸쳐 참조를 생성한 뒤 고정 RCP 문맥을 모든 목표 그룹이 공유한다. TCR은 고노이즈 단계에서 시점 인덱스를 순환 이동해 네 시점 그룹을 매 단계 다시 구성하여 구조 정보를 전달하고, 저노이즈 단계에서는 인접 네 시점 그룹을 고정해 세부 외관과 시점 전이를 정제한다. 각 그룹은 같은 그룹당 메모리 예산에서 순차 처리하거나 여러 GPU에 병렬 배치할 수 있다.
고정 길이 참조 문맥 패킹과 목표 문맥 라우팅을 사용하는 점진적 추론
고정 길이 참조 문맥 패킹과 목표 문맥 라우팅을 사용하는 점진적 추론

다단계 학습과 데이터 구성

  • 학습은 Wan2.2-TI2V-5B 기반 DiT를 미세 조정하는 세 단계 커리큘럼이다. 1단계에서는 전경만 남긴 DNA-Rendering으로 골격 조건 카메라 제어를 학습하고, 확률 0.2로 소스와 목표 클립을 서로 다른 시간 구간에서 뽑아 목표 골격의 포즈와 소스 외관을 분리한다. 2단계에서는 전경 마스킹을 제거하고 모든 다중 시점 자료로 확장한다. 저자들은 마스킹이 단색 그린스크린 배경 과적합을 줄일 수 있으나, 마스크 경계 잡음과 다중 시점 불일치, 조명·그림자 단서 학습 부족을 낳는다고 설명한다. 3단계에서는 Pexels와 TedTalk 단안 자료를 더하고 손가락 키포인트를 제거해, 잡음이 큰 손가락 조건 대신 소스 참조로 손 세부를 추론하게 한다. 손실은 잠재 공간 MSE flow-matching 손실과 가중치 0.25의 프레임 LPIPS 손실의 합이며, 후자는 고공간압축 VAE가 만드는 시각적 인공물을 완화하기 위해 사용한다.

3.4 Training Protocol

  • 학습 자료는 자체 게임 엔진으로 만든 MVGameHuman, SynCamVideo, DNA-Rendering, 단안 Pexels와 TedTalk로 구성된다. Table 1의 Videos는 비디오 개수로, MVGameHuman은 3만 8천 개 비디오·24개 카메라·318명 배우·2560×1440 해상도이고, SynCamVideo는 3만 4천 개·10개 카메라·66명·1280×1280, DNA-Rendering은 5만 1천 개·48개 카메라·548명·2048×2048이다. TedTalk은 4만 2천 개 단안 비디오·413명·2160×1620, Pexels는 2만 개 단안 비디오·1,411명·3840×2160이다. 다중 시점 자료에서는 Sapiens2-1B의 2D 키포인트를 교차 시점 삼각측량해 3D 골격을 만들고 각 카메라에 재투영하며, 단안 자료에서는 Sapiens2 pointmap의 키포인트 깊이로 z-buffer를 구동하고 카메라 움직임이 큰 시퀀스를 제외한다.
학습 데이터셋별 비디오 수, 카메라 수, 배우 수, 해상도 통계
학습 데이터셋별 비디오 수, 카메라 수, 배우 수, 해상도 통계

4 Experiments

  • 실험은 생성 비디오의 시점 간 3D 일관성, 생성 비디오를 이용한 4DGS 재구성, 생성 비디오 자체의 정답 재구성 품질을 분리해 평가한다. 또한 RCP·TCR·3D 인지 골격 조건의 절제와 야생 환경 영상의 정성 결과를 제시한다. 부록의 실패 사례에 따르면, 신체에서 멀리 펄럭이는 큰 천은 골격만으로 운동을 충분히 조건화하기 어려워 시점 간 불일치와 재구성 저하를 일으킨다. 또한 HMR이 특이 포즈를 잘못 추정하면 생성 모델은 잘못된 골격을 따라가며, 예시에서는 발끝으로 선 자세가 평평한 발로 추정되어 모든 생성 시점에 그 오류가 이어진다.
후면 소스, 복잡한 외관, 복잡한 동작을 포함한 도전 사례
후면 소스, 복잡한 외관, 복잡한 동작을 포함한 도전 사례
다양한 야생 환경 인간 비디오에 대한 다중 시점 생성과 4DGS 렌더링 결과
다양한 야생 환경 인간 비디오에 대한 다중 시점 생성과 4DGS 렌더링 결과

4.1 Experimental Setup

  • 정량 평가는 학습에서 제외한 DNA-Rendering 10개 장면과 모든 방법에 분포 밖인 DyMVHumans 3개 장면에서 수행했다. 각 장면에서 약 균일하게 배치된 16개 카메라와 98프레임을 사용하고, 하나의 정면 소스 비디오로 16개 목표 시점 비디오를 생성한다. 4DGS 재구성 평가는 16개 생성 시점으로 FreeTimeGS를 학습한 뒤 렌더링을 정답 영상과 비교한다. 생성 비디오 일관성 평가는 등간격 네 시점을 보류하고 나머지 12개 생성 시점으로 4DGS를 학습한 뒤, 보류 시점 4DGS 렌더링과 그 시점의 생성 영상을 비교한다. 생성 비디오 재구성 평가는 16개 생성 영상을 정답과 직접 비교하며, 모든 평가는 PSNR↑, SSIM↑, LPIPS↓를 사용한다. 비교 기준선은 공개 가중치를 영점 일반화로 적용한 MV-Performer와 TrajectoryCrafter, 그리고 같은 자료·학습 프로토콜에 RCP·TCR까지 적용해 미세 조정한 ReCamMaster†이다. 세 기준선은 같은 소스 영상과 목표 시점에서 평가했지만, 추론 해상도와 클립 길이 등 개별 기준선의 실행 조건은 부록에 따라 다르다.

4.2 Comparison with State-of-the-Art

  • Table 2를 직접 확인하면 4DAnyone은 DNA-Rendering과 DyMVHumans의 세 평가 차원에서, 표에 제시된 MV-Performer·TrajectoryCrafter·ReCamMaster†보다 PSNR·SSIM은 높고 LPIPS는 낮다. 예를 들어 DNA-Rendering 생성 비디오 일관성에서 4DAnyone은 24.33 dB, 0.862, 0.163이고, 같은 조건에서 PSNR 기준 다음 값인 ReCamMaster†의 21.47 dB, 0.806, 0.210보다 PSNR이 24.33−21.47=2.86 dB 높다. DyMVHumans 4DGS 재구성은 23.28 dB, 0.846, 0.117이며 ReCamMaster†의 19.86 dB, 0.795, 0.159와 비교하면 PSNR은 3.42 dB 높고, SSIM 절대 차이는 (0.846−0.795)×100=5.1 퍼센트포인트, LPIPS 절대 차이는 0.042 낮다. Table 3의 DNA-Rendering 8개 장면 절제에서는 RCP·TCR을 모두 뺀 경우가 21.09/0.766/0.216, Sliding을 쓴 완전 모델이 22.63/0.796/0.191이다. Random 완전 모델은 22.20/0.788/0.197로 TCR 제거 모델의 22.21/0.788/0.196을 넘지 못했고, Strided는 22.06/0.786/0.198이다. 따라서 라우팅의 정량적 이득은 임의 또는 strided 재그룹화 일반이 아니라, 인접 시점 관계를 보존하는 Sliding 전략에서 확인된다. 본문은 MV-Performer의 측·후면 왜곡, TrajectoryCrafter의 깊이 오차 누적과 전후면 전환 실패, ReCamMaster†의 부정확한 카메라 제어를 관찰된 열화의 원인으로 제시하며, 그림 4와 5는 이 정성 비교와 3D 골격·RCP·TCR 절제를 보여 준다.
DNA-Rendering과 DyMVHumans에서 생성 비디오와 4DGS를 비교한 정량 결과
DNA-Rendering과 DyMVHumans에서 생성 비디오와 4DGS를 비교한 정량 결과
RCP·TCR 및 목표 시점 라우팅 전략의 생성 비디오 일관성 절제 결과
RCP·TCR 및 목표 시점 라우팅 전략의 생성 비디오 일관성 절제 결과
기준선과 4DAnyone의 목표 시점 생성 비디오 및 4DGS 렌더링 정성 비교
기준선과 4DAnyone의 목표 시점 생성 비디오 및 4DGS 렌더링 정성 비교
3D 인지 골격 조건과 RCP·TCR의 정성 절제 결과
3D 인지 골격 조건과 RCP·TCR의 정성 절제 결과

부록

  • 부록은 다중 뷰 self-attention, RCP의 다중 해상도 patchify, 골격 인코더로 이루어진 모델 세부 구성을 설명한다. 이어 MVGameHuman 수집 방식, 단계별 자료 샘플링과 학습 설정, HMR 및 키포인트 전처리, 다중 GPU 추론과 4DGS 최적화, 기준선별 평가 실행 조건을 다룬다. 또한 TCR 라우팅·전환 시점의 추가 절제, 단일 이미지에서 4D 아바타를 만드는 확장 파이프라인, 의상 운동과 포즈 추정 오류에 관한 실패 사례를 제시한다.

짧은 생각

이 논문의 핵심은 다중 시점 일관성을 하나의 문제로 취급하지 않고, 이전 생성 결과에서 외관 단서를 보존하는 문제와 분리된 목표 그룹 사이에서 전역 구조를 전달하는 문제로 나눈 점에 있다. Table 3에서 RCP와 TCR을 모두 뺀 설정보다 Sliding 완전 모델의 PSNR·SSIM·LPIPS가 모두 개선되고, Random은 고정 그룹보다 낫지 않으며 Strided는 더 낮다는 결과는 단순히 시점을 섞는 것보다 인접한 시점의 연결을 유지하는 방식이 중요하다는 해석을 뒷받침한다. 다만 ReCamMaster†만 제안법과 같은 자료·학습 프로토콜 및 RCP·TCR을 적용한 통제 비교이고, MV-Performer와 TrajectoryCrafter는 공개 가중치 영점 일반화 결과이다. 따라서 골격 조건의 기여를 기준선의 학습 자료, 해상도, 생성 길이와 더욱 엄밀히 분리한 비교가 추가되면 설계 선택의 효과를 더 명확히 판단할 수 있다.