SwarmWorld: Stigmergic technological evolution in societies of language-model agents

발행일
출처
arXiv
논문 번호
1043
분야
AI / General
arXiv 번호
2608.26081

역할·레시피 없이 풀어놓은 LLM 에이전트 무리가 공유 세계에 남긴 흔적(스티머지)을 통해 기술을 누적 진화시키고, 각자 따로 탐색할 때보다 더 넓고 튼튼한 기술 포트폴리오를 만든다는 것을 입증한 논문.

이 논문은 한마디로 '에이전트들이 직접 대화하지 않아도, 공유하는 세계에 만들어 둔 유물이 다음 에이전트의 출발점이 되며 기술이 저절로 누적된다'는 것을 보인 연구다. SwarmWorld 시뮬레이터에서 처음에 똑같은 LLM 에이전트 50~200마리가 역할 없이 돌아다니며 재료를 시험하고, 실행 가능한 제어 프로그램을 담은 유물(아티팩트)을 짓는다. 에이전트를 전부 치운 뒤 예고 없는 교란을 8가지 가해 유물을 평가하니, 함께 산 세계가 같은 계산량을 각자 쓴 best-of-N 탐색보다 더 폭넓고 회복력 있는 기술 모음과 더 많은 검증 발명을 남겼다. 다만 가장 강한 단일 유물 하나만 따지면 각자 탐색도 여전히 경쟁력이 있었고, 문화 장치의 이득은 평가 항목과 시간에 따라 달라졌다.

핵심 요약

  • 역할·레시피·중앙 통제가 전혀 없는데도 똑같은 에이전트들이 탐험·건설·유지·조정 행동으로 저절로 분화했다(행동 특징 15개로 군집화해 확인).
  • 에이전트를 모두 제거한 뒤 8가지 예고 없는 교란으로 채점하는 구조를 만들어, LLM의 자기 주장이 아니라 시뮬레이터가 판정하는 객관 기능을 측정했다.
  • 공유 세계가 각자 탐색 대비 검증 발명 수 +1.2~+6.0개, 회복력 지표도 일관되게 앞섰다(시드 4개 짝비교).
  • 기술 재사용은 채팅이 아니라 남이 만든 유물을 몸소 관찰하는 데서 시작되는 경우가 가장 많았다.
  • 가르치기(TEACH) 같은 명시적 문화 장치는 협업과 조직을 키우지만, 기능 이득은 평가 항목과 시간대에 따라 들쭉날쭉해 만능이 아니었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)