한눈에 보기

Anthropic은 긴 시간 동안 앱을 개발하는 코딩 에이전트의 성능을 높이기 위해 실행 환경과 검증 절차를 설계한 경험을 공유합니다. 좋은 프롬프트뿐 아니라 결과를 평가하고 다음 수정으로 연결하는 구조가 중요하다는 내용입니다.

핵심 내용

연구진은 생성자와 평가자를 나누고, 주관적인 디자인 판단도 구체적인 평가 기준으로 표현했습니다. 장시간 개발에는 계획·생성·평가 역할을 연결하고, 작업을 다룰 수 있는 단위로 나누며, 세션 사이에 구조화된 기록으로 맥락을 전달하는 방식을 사용했습니다.

내 작업에 적용하기

기능을 요청할 때 화면 이름만 적기보다 사용자가 어떤 행동을 하고 무엇이 저장돼야 하는지 적어 보세요. 각 단위가 끝나면 실제 화면과 테스트 결과를 확인하고 미완료 항목을 기록합니다. 디자인 검토도 글자 가독성, 모바일 배치, 오류 상태처럼 확인 가능한 항목으로 나누면 수정 요청이 명확해집니다.

확인할 점

역할을 나누는 것 자체가 품질을 보장하지는 않습니다. 평가 기준이 잘못되면 잘못된 결과를 반복 강화할 수 있습니다. 자동 평가와 함께 실제 사용 흐름을 확인하는 검수가 필요하며, 여러 에이전트의 비용도 비교해야 합니다.