Marionette: Predicting World States, Rendering Geometry, Painting Appearance

발행일
출처
arXiv
논문 번호
914
분야
Computer Vision
arXiv 번호
2608.14530

영상 전체를 한 번에 상상하지 않고, 행동과 몸 상태, 기하와 외형을 나눠 오래 가는 게임 세계를 더 쉽게 통제하려는 모델이다.

이 논문은 한마디로 게임 영상을 바로 이어 그리지 않고 세계 상태를 먼저 예측하는 Marionette를 제안한다. 모델은 캐릭터 두 명의 관절과 이동, 회전을 담은 276차원 상태를 만든다. 고정된 그래픽 처리기가 이를 뼈대 영상으로 바꾸고, 50억 매개변수 영상 생성 모델이 외형을 입힌다. 이 구조에서는 행동 입력이 자세를 실제로 바꾸는지 확인하고, 캐릭터 간 거리나 지면 충돌 같은 규칙도 상태에 직접 적용할 수 있다. 다만 장기 생성에서는 외형이 달라지고 현재 동작 모델도 한 종류의 몬스터에 한정된다.

핵심 요약

  • ActionGPT가 행동을 고르고 PoseGPT가 자세를 만든다. 고정된 그래픽 처리기가 뼈대와 가림 관계를 계산한 뒤 영상 생성 모델이 외형을 입힌다.
  • 동작 모델은 초당 20프레임의 1,395개 구간으로 학습했고, 현재 동작 범위는 한 종류의 몬스터에 한정된다.
  • 48개 시험 구간에서 잘못된 행동을 강제로 넣자 관절 오차가 0.272미터에서 0.357미터로 31퍼센트 늘어, 행동 토큰이 자세를 통제한다는 점을 보였다.
  • 지면 충돌 규칙을 적용하자 관절이 땅을 뚫는 프레임 비율이 0.337에서 0.114로 줄었다. 거리 제한 규칙은 캐릭터 사이 거리를 21.2미터에서 5.1미터로 낮췄다.
  • 영상 품질 지표 FVD는 831로 픽셀 기반 모델의 975보다 낮았지만 신뢰 구간이 겹쳤다. 장기 외형 변화와 학습 때와 다른 자세 입력 문제도 남아 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)