GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI
- 발행일
- 출처
- arXiv
- 논문 번호
- 1128
- 분야
- Agents
- arXiv 번호
- 2609.30147
이 논문은 LLM 계획의 '복잡할수록 무너지는' 문제를 계획 생성·수정·평가를 나눈 다단계 파이프라인(GRASP)으로 풀어 정확도를 크게 끌어올렸다.
이 논문은 한마디로 복잡한 작업일수록 성공률이 급락하는 LLM 플래너의 약점을 '역할 분담'으로 해결한 연구다. GRASP은 전체 방침을 먼저 짜는 모듈(GenPlan), 각 단계별 전략을 따로 탐색하는 모듈(RevPlan), 완성된 계획을 여러 기준으로 검사하는 모듈(VerPlan)로 나뉜다. 각 모듈이 서로 다른 맥락(context)에서 일하기 때문에 정보가 뒤섞이는 오염을 막는다. 그 결과 캘린더 일정 잡기 +12.4%, 퍼즐 추론 ZebraLogic +30.8% 정확도가 올랐고, 여러 작업을 섞어도 성능 하락이 사실상 사라졌다.
핵심 요약
- 계획짜기를 '생성 → 수정 → 평가' 세 단계로 나누고, 각 단계를 맥락이 분리된 전용 모듈에 맡겼다.
- 자연어 실행 계획 과제에서 직접 플래닝 대비 캘린더 일정 +12.4%, 퍼즐 추론 +30.8% 정확도를 얻었다.
- 일반 플래너는 작업을 섞는 순간 성능이 무너지는데, GRASP은 혼합 작업에서도 하락 폭을 사실상 없앴다(최대 +16.7%).
- 맥락 분리 덕분에 GPT-5-mini 같은 최첨단 추론 모델보다도 14.5% 앞서는 구간이 있었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.