한눈에 보기

Anthropic은 여러 AI 에이전트가 공유 코드베이스 등에서 상호작용할 때 나타나는 패턴과 문제를 조사했습니다. 개별 모델의 능력이 좋아지는 것과 팀 전체가 좋은 결과를 만드는 것은 별개의 문제입니다. 작업 수나 PR 수만으로 협업 품질을 판단하기 어렵다는 점이 핵심입니다.

실험에서 드러난 문제

소프트웨어 협업 실험에서 초기 모델들은 공유 파일을 수정하면서도 충돌한 PR을 충분히 통합하지 못했습니다. 일부 후속 모델은 파일 소유권을 강하게 나누어 충돌을 줄였지만, 이는 깊이 협업하기보다 서로 떨어져 작업하는 방식에 가까웠습니다. 연구진은 완성 결과물의 품질에도 한계가 있었다고 설명합니다.

내 프로젝트에 적용하기

이 결과를 바탕으로 작은 팀을 설계한다면, 수정할 파일과 책임 범위를 먼저 구분하고 통합 담당을 명확히 두는 방법을 고려할 수 있습니다. 작업이 끝났다는 보고 대신 실제 테스트, 충돌 해결, 합쳐진 결과물로 완료를 판단하세요. 이는 연구를 실무에 옮기기 위한 편집 관점입니다.

확인할 점

특정 모델과 실험 환경에서 얻은 결과를 모든 에이전트 도구에 일반화할 수는 없습니다. 병렬화를 추가하기 전에 단일 에이전트 기준 결과와 비용을 확보하면 비교가 쉬워집니다.