DNQ: Deep Nash Q-Network for Partially Observable n-Player Games
- 발행일
- 출처
- arXiv
- 논문 번호
- 331
- 분야
- Game Theory
- arXiv 번호
- 2606.06480
부분 관찰 n인 게임에서 균형 감독 기반으로 에이전트를 학습하는 DNQ 프레임워크다.
DNQ(Deep Nash Q-Network)는 다중 턴 동시 입찰 환경에서 균형 기반 감독으로 에이전트를 학습하는 프레임워크다. 궤적 수집, critic 기반 보수 추정, 균형 계산, 정책 모방을 교대로 수행하며, 공유 critic이 pairwise 보수 행렬 또는 정확한 N인 보수 텐서를 예측하고 외부 솔버가 균형 전략을 계산한다. pairwise 공식화는 정확한 공식화 대비 균형 계산 비용과 학습 시간을 크게 줄이면서 더 많은 에이전트로 확장 가능하다.
핵심 요약
- solver-in-the-loop 균형 감독 프레임워크로 입찰 에이전트를 학습한다.
- 공유 critic이 pairwise 보수 행렬 또는 N인 보수 텐서를 예측해 학습 효율을 높인다.
- pairwise 공식화는 정확한 N인 공식화 대비 계산 비용을 크게 감소시킨다.
- 정확한 방법은 에이전트 수가 늘어나면 계산적으로 실현 불가능해진다.
- 전략적 충실도와 확장성 사이의 트레이드오프를 실증적으로 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.