BrickBench: Evaluating Agentic Brick Design

발행일
출처
arXiv
논문 번호
1184
분야
AI Agents
arXiv 번호
2610.12452

코딩 에이전트가 텍스트만 보고 실제로 조립 가능한 레고 세트를 설계할 수 있는지를 측정하는 벤치마크다. 물리적 유효성은 거의 해결됐지만, 인간다운 "설계 품질"과는 아직 큰 격차가 있음을 보여줬다.

이 논문은 한마디로 에이전트가 레고 조립 설계를 얼마나 잘하는지 측정하는 벤치마크다. 프롬프트를 받으면 부품 수백~수천 개짜리 조립품을 실제로 만들 수 있게 설계해야 한다. 저자들은 BrickAgent라는 도구 환경(조립·검사·검증용)을 제공했고, 최고 에이전트는 95%의 시맨틱 요구를 충족하며 거의 모든 프롬프트에서 유효한 결과를 냈다. 다만 도구 환경을 빼면 유효 조립 성공률이 40% 이하로 급락해, 검증 도구가 성공의 핵심임이 드러났다. 인간 평가자들은 360쌍 중 323번이나 인간 설계를 골랐고, "만들 수는 있지만 잘 설계한 것은 아니다"라는 결론에 도달했다.

핵심 요약

  • 최고 코딩 에이전트가 프롬프트 시맨틱 요구의 약 95%를 충족하며 거의 모든 프롬프트에서 물리적으로 유효한 조립품을 만들었다.
  • 도구 환경(BrickAgent)을 제거하자 유효 조립 성공률이 GPT-6 Astra 100%→40%, GPT-5.6 Luna 100%→1% 미만으로 급락했다. 접지된 검증 도구가 성공의 핵심이다.
  • 레고 전용 생성 모델(BrickNet-14B, BrickGPT)을 일반 코딩 에이전트가 능가했다. 다만 비용은 600~6800배 더 든다.
  • 인간 평가자는 360쌍 비교 중 323번(약 90%)에서 인간 설계를 골랐다. 요구 충족과 좋은 설계는 다른 문제다.
  • 디자인 품질 ELO 지표를 VLM 심판으로 계산하고, 인간 선호(Kendall τ=0.89)와 랭킹 일치를 검증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)