GenClaw: Code-Driven Agentic Image Generation

발행일
출처
arXiv
논문 번호
272
분야
Computer Vision
arXiv 번호
2605.30248

GenClaw는 이미지 생성을 위한 코드 기반 에이전트형 패러다임을 제안하여, AI 에이전트가 텍스트 프롬프트 최적화에만 의존하는 대신 실행 가능한 코드를 정밀한 시각적 구성을 위한 직접적인 붓으로 사용하도록 한다.

GenClaw는 이미지 생성을 프롬프트를 반복 수정하는 검은 상자 과정이 아니라 개념화, 스케치, 채색의 세 단계로 나눈다. 에이전트가 먼저 검색과 추론으로 필요한 지식과 문맥을 정리한 뒤 SVG, HTML, ThreeJS 같은 실행 가능한 코드로 배치와 구조를 그린다. 마지막에는 이미지 생성 모델이 이 코드 기반 시각 초안에 질감, 재질, 사실감을 더한다. 코드가 중간 캔버스로 남기 때문에 사용자는 세부 배치를 직접 고칠 수 있고, 오류가 검색·코드·최종 렌더링 중 어느 단계에서 생겼는지도 구분하기 쉽다. 다만 최종 이미지 모델이 코드 초안의 세부 구조를 정확히 따르지 않을 수 있어 일부 상황에서는 결과의 안정성이 제한된다.

핵심 요약

  • 최종 렌더링: 이미지 모델은 이 물리적 초안을 시각적 가이드로 삼아 사실적인 장면을 생성한다.
  • 검색 결과가 틀렸다면, 이는 인지 오류다.
  • 레이아웃이 비논리적이라면, 이는 코드 오류다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)