SwarmWorld: Stigmergic technological evolution in societies of language-model agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 1043
- 분야
- AI / General
- arXiv 번호
- 2608.26081
역할·레시피 없이 풀어놓은 LLM 에이전트 무리가 공유 세계에 남긴 흔적(스티머지)을 통해 기술을 누적 진화시키고, 각자 따로 탐색할 때보다 더 넓고 튼튼한 기술 포트폴리오를 만든다는 것을 입증한 논문.
이 논문은 한마디로 '에이전트들이 직접 대화하지 않아도, 공유하는 세계에 만들어 둔 유물이 다음 에이전트의 출발점이 되며 기술이 저절로 누적된다'는 것을 보인 연구다. SwarmWorld 시뮬레이터에서 처음에 똑같은 LLM 에이전트 50~200마리가 역할 없이 돌아다니며 재료를 시험하고, 실행 가능한 제어 프로그램을 담은 유물(아티팩트)을 짓는다. 에이전트를 전부 치운 뒤 예고 없는 교란을 8가지 가해 유물을 평가하니, 함께 산 세계가 같은 계산량을 각자 쓴 best-of-N 탐색보다 더 폭넓고 회복력 있는 기술 모음과 더 많은 검증 발명을 남겼다. 다만 가장 강한 단일 유물 하나만 따지면 각자 탐색도 여전히 경쟁력이 있었고, 문화 장치의 이득은 평가 항목과 시간에 따라 달라졌다.
핵심 요약
- 역할·레시피·중앙 통제가 전혀 없는데도 똑같은 에이전트들이 탐험·건설·유지·조정 행동으로 저절로 분화했다(행동 특징 15개로 군집화해 확인).
- 에이전트를 모두 제거한 뒤 8가지 예고 없는 교란으로 채점하는 구조를 만들어, LLM의 자기 주장이 아니라 시뮬레이터가 판정하는 객관 기능을 측정했다.
- 공유 세계가 각자 탐색 대비 검증 발명 수 +1.2~+6.0개, 회복력 지표도 일관되게 앞섰다(시드 4개 짝비교).
- 기술 재사용은 채팅이 아니라 남이 만든 유물을 몸소 관찰하는 데서 시작되는 경우가 가장 많았다.
- 가르치기(TEACH) 같은 명시적 문화 장치는 협업과 조직을 키우지만, 기능 이득은 평가 항목과 시간대에 따라 들쭉날쭉해 만능이 아니었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.