Visual prompt engineering for video models 요약 설명
28 Jul 2026 | Paper Review Weekly Papers목차
- 요약
- 2. Visual prompt engineering (VIPE)
- 3. Text-based prompt engineering helps language models for language tasks. Does visual prompt engineering help video models for visual tasks?
- 4. How can visual prompt engineering be automated?
- 5. Can visual prompt engineering be used for test-time scaling?
- 6. Is language or visual prompt engineering more effective for video models?
- 7. Does visual prompt engineering help native image generation models, too?
- 8. Why does visual prompt engineering help?
- 짧은 생각
이번 글에서는 Visual prompt engineering for video models 논문의 핵심 포인트만 간단히 정리한다.
- 2026년 7월 28일(Arxiv), arXiv
- Geirhos, Robert, Li, Yuxuan, Wiedemer, Thaddäus, Kalibhat, Neha, Wang, Zi, Malek, Mani, Tafjord, Oyvind, Swersky, Kevin, Kim, Been, Jaini, Priyank.
- Google DeepMind
- 논문 링크
요약
- 이 논문은 비디오 모델의 시각 추론 성능을 높이기 위해, 과제의 논리는 유지하면서 입력 이미지를 더 모델 친화적인 모습으로 바꾸는 시각 프롬프트 엔지니어링(VIPE)을 제안한다. 공·경사로 물리 문제, 미로, RushHour, 색·숫자 기반 과제에서 VIPE는 전반적으로 성능을 향상시켰다. 특히 VPCT에서 Veo 3.1은 스케치 입력 시 41.3%였던 정확도가 사실적 장면으로 편집한 뒤 59.3%가 되었다. 저자들은 비디오 모델이 추상적·합성 이미지보다 사실적 시각 맥락에서 장면 일관성을 더 잘 유지한다는 사실을 주요 원인으로 제시한다.
- 핵심 기여는 시각 입력 자체를 최적화 대상으로 삼은 VIPE의 정의, 자동화 방법의 비교, 시험 시점 스케일링 및 텍스트 프롬프트 엔지니어링과의 비교, 사실성 편향에 관한 실험적 분석이다.
- 결과는 VIPE가 언제나 최선이라는 뜻은 아니다. 원본 과제 구조를 보존하는 이미지 편집 품질과 과제·모델별 입력 표현의 적합성이 성능에 직접 영향을 준다.
2. Visual prompt engineering (VIPE)
- VIPE에서 하나의 과제 표본은 이미지 시각 프롬프트와 텍스트 프롬프트의 쌍으로 구성된다. 목표는 원본 이미지의 공간 배치, 객체 수, 객체 대응 관계 및 추론 논리를 바꾸지 않으면서, 후속 비디오 생성 기반 추론의 성공률을 높이는 이미지 변형을 찾는 것이다.
- 아이데이터는 과제 보존 조건을 포함한 지시에 따라 자연어 이미지 편집 지시를 만든다. 아이데이터는 사람 또는 언어 모델일 수 있다.
- 이미지 편집기는 원본 이미지와 편집 지시를 받아 여러 후보 변형을 생성한다. 선택적 필터는 원본에 대한 충실도와 편집 품질을 평가해 후보를 고른다.
- 선택된 시각 프롬프트와 텍스트 프롬프트를 비디오 모델에 입력하고, 생성 비디오가 과제를 해결했는지는 자동 평가기로 채점한다. 여러 변형을 만들어 앙상블할 수도 있다.

시각 프롬프트 엔지니어링 파이프라인과 물리·숫자 정렬 사례
3. Text-based prompt engineering helps language models for language tasks. Does visual prompt engineering help video models for visual tasks?
- 저자들은 VPCT에서 스케치형 공·경사로 문제를 광사실적 장면으로 편집했다. 원본의 흰 공은 빨간 당구공으로, 검은 선은 길이·방향·위치를 유지한 목재 선반으로 바꾸고, 카메라 관점은 고정했다. Nano Banana Pro로 편집 후보 5개를 생성하고 Gemini 3.1 Pro로 후보를 선별했으며, 저자들이 과제가 쉬워지지 않았는지 검증했다고 설명한다.
- 100개 표본을 10회 실행한 결과, Veo 3.1의 정확도는 스케치 조건 41.3%에서 VIPE 조건 59.3%로 높아졌다. Omni Flash도 56.3%에서 67.5%로 향상됐다.
- Wan2.2의 TI2V 및 I2V 체크포인트도 영어·중국어 프롬프트 조건 전반에서 VIPE 후 무작위 추측 수준을 넘는 결과를 보였다.
- 깊이감은 있지만 비현실적 질감을 적용한 절제 실험에서는 대부분 모델이 원본 스케치와 유의미한 차이를 보이지 않았다. 따라서 이 실험은 3차원적 외형만이 아니라 시각적 사실성이 향상에 중요하다는 근거를 제공한다.

VPCT 물리 추론에서 스케치·비현실 질감·사실적 시각 프롬프트 조건의 모델별 정확도
4. How can visual prompt engineering be automated?
- 저자들은 사람의 직관에만 의존하지 않고 VIPE를 자동화하는 두 방법을 비교했다. 첫째, 자유 형식 방식은 VLM이 과제의 공간 구조와 객체 대응을 보존하는 새로운 시각 도메인을 제안하고, 이미지 편집기와 필터가 이를 구현하는 개방 루프 방식이다. 둘째, 원자적 개념 편집(ACE)은 배경·재질·크기 같은 한 가지 시각 개념만 단계적으로 바꾸며 자동 평가기 피드백에 따라 탐색하는 폐루프 방식이다.
- Veo 3.1을 사용해 VPCT, 네 종류의 미로, RushHour, Conjunctive Search, Connect the Dots, Sort 3 Numbers를 평가했다. 이 자동화 실험에서 생성한 비디오는 총 18,160개이다.
- 자유 형식 VIPE는 과제와 분할에 따라 기준선 대비 오류율을 크게 낮췄다. 최적 변형을 표본별로 고르는 오라클 설정에서는 일부 과제의 오류 감소 폭이 더 커졌다.
- ACE는 Connect the Dots, Conjunctive Search, Sort 3 Numbers에 적용됐다. 성공적인 편집에서 반복적으로 나타난 양상은 사실적 재질을 통한 객체 지속성 강화, 고대비 배경·윤곽선을 통한 목표 객체 분리, 직접적인 표현을 통한 의미 단순화였다.
- 자유 형식 방법은 서로 다른 난이도 분할에 공통으로 잘 작동하는 단일 변형을 찾는 데 어려움이 있었으므로, 변형 효과의 일반화는 확인되지 않았다.

자유 형식과 원자적 개념 편집 기반 자동 시각 프롬프트 엔지니어링의 과제별 오류 감소율
5. Can visual prompt engineering be used for test-time scaling?
- VIPE는 전통적인 시험 시점 스케일링인 자기 일관성보다 비용 효율적인 대안으로 제시된다. VPCT에서 Veo 3.1의 원본 프롬프트 정확도는 독립 생성 20회의 다수결로 41.3%에서 50.0%가 되었지만, VIPE 프롬프트에서 단일 생성만으로 59.3%를 기록했다. VIPE와 20회 다수결을 결합하면 68.0%에 도달했다.
- 저자들의 당시 API 비용 가정에서 비디오 하나는 3.20달러이고, 후보 5개 생성과 필터링을 포함한 VIPE 한 회는 약 0.40달러였다.
- 고정 예산에서 VPCT 정확도는 일반적으로 같은 시각 프롬프트에서 비디오 생성 횟수를 늘리는 것보다 더 많은 VIPE 변형을 탐색할 때 높았다. 부록의 Maze 및 RushHour 분석도 같은 방향의 결과를 보인다.
- 이 비용 비교는 논문에서 사용한 모델·API 가격과 평가 설정에 의존하므로, 다른 모델 및 운영 환경에 그대로 일반화할 수는 없다.

시각 프롬프트 엔지니어링과 다수결 시험 시점 스케일링의 결합 성능

시각 프롬프트 변형 수와 변형당 비디오 생성 횟수의 예산별 정확도 비교
6. Is language or visual prompt engineering more effective for video models?
- 비디오 모델은 텍스트와 이미지를 모두 입력받으므로, 저자들은 두 프롬프트 차원을 각각 바꾸어 비교했다. 동일한 VLM 아이데이터가 20개 텍스트 변형 또는 20개 이미지 변형을 제안했고, VPCT 부분집합·Conjunctive Search·Sort 3 Numbers·Connect the Dots에서 Veo 3.1을 평가했다.
- 두 방법 모두 기준선보다 나은 변형을 만들 수 있었다. Sort 3 Numbers에서는 기준선 4%에 비해 최선 텍스트 변형은 86%, 최선 이미지 변형은 76%였다.
- Conjunctive Search에서는 기준선 4%에 비해 최선 이미지 변형이 62%, 최선 텍스트 변형이 12%였고, Connect the Dots에서는 텍스트 변형이 35%, 이미지 변형이 8%였다. 즉 어느 양식이 우세한지는 과제에 따라 달랐다.
- 전체 변형의 분포에서는 Conjunctive Search와 Sort 3 Numbers에서 이미지 변형이 평균적으로 더 큰 개선을 보였지만, 단일 최고 변형은 텍스트가 앞서는 경우도 있었다.
- 텍스트와 이미지를 동시에 바꾸는 간단한 자유 형식 방법도 탐색했지만, 논문에서는 이미지 단독 변경보다 더 효과적이지 않았다.

텍스트 및 이미지 프롬프트 엔지니어링의 과제별 성능 비교
7. Does visual prompt engineering help native image generation models, too?
- VIPE의 효과가 이미지 생성 모델에도 나타나는지 확인하기 위해, 저자들은 VPCT에서 Nano Banana Pro와 Nano Banana 2가 결과를 이미지 또는 텍스트로 직접 출력하게 했다. 결과는 VIPE가 네이티브 이미지 생성 모델의 추론을 일관되게 향상시키지 않는다는 것이었다.
- Nano Banana Pro의 이미지 출력 Pass@1은 스케치 45.0%, VIPE 50.0%로 소폭 향상됐지만, Nano Banana 2의 이미지 출력은 스케치 37.0%에서 VIPE 21.0%로 하락했다.
- Nano Banana 2의 텍스트 출력은 스케치에서 Pass@1 58.0%, 다수결 80.0%로 이 비교에서 가장 높은 성능을 기록했다.
- 저자들은 답을 이미지로 렌더링하는 과정이 추론 결과를 올바르게 표현해야 하는 추가 병목이라고 해석한다. 또한 이미지 모델은 추상 스케치와 사실적 이미지를 모두 더 폭넓게 다뤄, 비디오 모델에서 관찰된 표현 간격이 작을 수 있다고 가설을 제시한다.

네이티브 이미지 생성 모델의 VPCT 입력 형식 및 출력 방식별 성능
8. Why does visual prompt engineering help?
- 논문은 VIPE가 추상 입력과 모델이 선호하는 사실적 표현 사이의 간격을 줄이기 때문에 효과가 난다고 해석한다. 사실적 장면에서는 객체가 갑자기 나타나거나 사라지고 형태가 변하는 현상이 줄어들어, 추론에 필요한 장면 구조가 시간에 따라 더 잘 보존된다는 것이다.
- 합성 장면에 철로, 철도 화차, 배경을 순차적으로 추가한 실험에서 Veo 3.1 생성 영상의 인간 평가 장면 일관성은 0%, 11%, 24%, 59%로 증가했다. 이는 사실성 증가와 장면 일관성 증가의 관찰된 연관성을 보여 준다.
- 저자들은 이를 비디오 모델의 사실성 편향으로 부른다. 따라서 추상적 벤치마크의 낮은 성능은 모델 역량의 하한일 수 있으며, 가능한 경우 동일 논리를 보존한 사실적 변형도 평가해야 한다고 권고한다.
- 다만 원인이 추상 장면의 분포 밖 일반화 실패인지, 또는 추상 장면에서 비현실적 변형을 허용하는 다른 학습 사전분포인지는 이 논문이 판별하지 못했다.
- 이미지 편집기가 과제의 본질을 바꾸거나 인공물을 추가하면 원래 과제를 풀 수 없게 되는 것이 핵심 한계다. 논문은 VLM 기반 필터링과 검증으로 이 위험을 완화했지만, 평가 결과는 편집과 자동 평가기의 신뢰도에도 의존한다.

사실성 단계 증가에 따른 생성 장면 일관성 변화
짧은 생각
- 이 논문의 중요한 관점 전환은 비디오 추론에서 이미지를 고정된 문제 진술로 보지 않고, 텍스트 프롬프트처럼 최적화할 수 있는 인터페이스로 다룬 점이다. 특히 단순히 생성 횟수를 늘리기보다 저렴한 이미지 편집으로 실패 가능성이 낮은 시각적 맥락을 먼저 찾는 전략은 실용적일 수 있다.
- 다만 ‘사실적인 이미지에서 성능이 높다’는 결과는 강건한 추론 능력 자체의 향상이라기보다, 현재 모델이 학습 분포에 가까운 입력에서 더 안정적으로 출력한다는 현상일 수 있다. VIPE 성능을 모델의 근본적 물리 이해 향상으로 해석해서는 안 된다.
- 실무 적용에서는 공간 배치·객체 대응·정답 누설 여부를 엄격히 검증해야 한다. 특히 안전성이나 의사결정에 쓰이는 시각 과제에서는 편집이 과제를 바꾸지 않았음을 확인하는 독립적 검증 절차가 필요하다.
- 향후에는 단일 이미지뿐 아니라 다중 참조 이미지·동영상 맥락에도 같은 원칙을 적용할 수 있으나, 그러한 확장은 이 논문에서 실증하지 않았다.