Neurosymbolic Embodied Agents

발행일
출처
arXiv
논문 번호
930
분야
Robotics
arXiv 번호
2608.16794

눈으로 필요한 상태를 먼저 확인한 뒤, 형식 규칙으로 실행 가능한 행동만 허용해 긴 집안일 계획의 오류를 줄이는 에이전트다.

이 논문은 한마디로 시각 탐색과 형식 규칙을 결합해 긴 집안일 계획의 오류를 줄이는 뉴로심볼릭 에이전트를 제안한다. 첫 단계에서는 영상 언어 모델이 여러 시점과 상호작용으로 목표에 필요한 물체와 관계를 확인한다. 두 번째 단계에서는 행동 조건과 결과를 적은 PDDL 규칙이 실행 가능한 행동만 허용하고, 몬테카를로 트리 탐색이 목표까지 갈 계획을 고른다. VirtualHome 200개와 ALFWorld 134개 과제에서 Qwen3.5 4B, 9B와 27B 세 모델의 성공률 범위는 각각 94.5퍼센트에서 99.5퍼센트, 90.3퍼센트에서 97.8퍼센트였다. 다만 시각 인식과 물체 연결, 형식 규칙이 모두 맞아야 하며 평가는 두 시뮬레이터의 이산 행동에 한정됐다.

핵심 요약

  • 첫 단계는 여러 시점과 시뮬레이터 안에서 직접 열어 보거나 집어 보는 상호작용으로 물체 위치와 관계를 확인한다. 보지 못한 물체를 모델의 추측만으로 상태에 넣지는 않는다.
  • 두 번째 단계는 현재 상태에서 조건을 만족하는 행동 토큰만 생성하게 한다. 탐색 시간은 과제당 최대 250초였고 완성된 계획은 실행 중 피드백을 받지 않는다.
  • VirtualHome 200개와 ALFWorld의 미공개 분할 134개를 평가했다. 전체 행동 예산은 각각 20회와 55회였으며 모델에는 장면 그래프나 정답 상태를 보여주지 않았다.
  • Qwen3.5-27B의 ALFWorld 성공률은 제약만 썼을 때 32.3퍼센트, 탐색만 썼을 때 29.2퍼센트, 둘을 합쳤을 때 95.5퍼센트였다. 같은 모델 크기끼리 두 환경의 비용을 평균하면 생성 토큰은 긴 추론 방식보다 최대 4배 적었다.
  • 남은 실패는 주로 첫 단계에 몰렸다. 상태를 잘못 얻은 비율은 VirtualHome 약 2.3퍼센트, ALFWorld 약 4.5퍼센트였으며 작은 물체를 놓치는 시각 오류가 대표적이었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)