반응형

https://www.anthropic.com/research/multiagent-systems

2026.8.13
[Patterns and problems in multiagent systems \ Anthropic]

이 글은 인공지능 모델들이 서로 상호작용하는 멀티에이전트 시스템의 부상과 그 과정에서 발생하는 독특한 사회적 결함들을 탐구합니다. 기술의 발전으로 에이전트 간의 협력이 정교해지고 있지만, 본문은 조정의 어려움, 동일한 모델들이 유발하는 획일적 판단 착오, 그리고 상대의 의도를 오해하여 발생하는 적대적 충돌과 같은 심각한 시스템 리스크를 경고합니다. 특히 에이전트들이 인간의 사회적 규범이나 신뢰 체계를 갖추지 못한 상태에서 자율성을 가질 때 나타나는 비정상적인 경쟁과 공모 현상을 실험을 통해 분석합니다. 결론적으로 저자는 지능의 향상이 반드시 원활한 협력으로 이어지지는 않기에, 대규모 에이전트 생태계가 안착하기 전 새로운 메커니즘 설계와 정렬 기술을 통해 이러한 다각적인 위험을 해결해야 한다고 제안합니다.

 

 

협력하는 에이전트 집단(실선)을 통해 발견된 누적 취약점과, 각기 다른 코드 영역을 지목한 독립 에이전트들이 발견한 취약점(별표)을 비교했습니다. 점선은 집단이 발견한 취약점 중 독립 에이전트들도 발견한 취약점의 누적 합계를 나타냅니다. 점선(Mythos Preview에서만 표시)은 독립 에이전트들이 조사하도록 지시받은 각 프로젝트의 핵심 코드에서 발견된 취약점만을 보여줍니다.

 

왼쪽: 각 시뮬레이션 종료 시점에 병합된 PR의 비율. 오른쪽: 각 시뮬레이션에서 에이전트의 코드 공유 정도 중앙값. 두 지표 모두 다양한 시뮬레이션 크기에 대해 세 가지 프롬프트 유형에 걸쳐 평균값을 계산했습니다. Sonnet 5만이 다른 에이전트와 직접 협업하고 코드를 공유하면서 높은 병합률을 유지할 수 있었습니다.

 

5가지 모델 각각에 대해 12시간 시뮬레이션 동안 PR 진행 상황을 살펴보았습니다. 소네트 4.6과 오푸스 4.6은 최신 모델에 비해 PR 병합 기능이 매우 떨어집니다. 최신 모델은 개설된 PR의 대부분을 병합할 수 있습니다.

 

 

728x90
반응형
Posted by Mr. Slumber
,