01핵심 개요
- 장기 작업 실패 원인은 세션 간 기억 단절, 컨텍스트가 쌓일 때의 급한 마무리, 계획 부족과 자기평가 편향이다.
- 초기화 에이전트는 feature_list.json과 진행 기록, 실행 스크립트, Git 커밋으로 다음 세션이 이어갈 상태를 남긴다.
- 제작자와 평가자를 분리하고, Playwright 등으로 화면을 직접 조작해 합의한 완료 조건을 검사한다.
- 평가 기준은 디자인·독창성·완성도·기능성이며, 명세와 합격 조건을 코딩 전에 파일로 조율한다.
- 게임 실험은 단독 약 20분·9달러와 구조화된 약 6시간·200달러를 비교해 비용보다 검증 차이를 보여준다.
02핵심 주장 / 논점 구조
- 긴 작업에서 에이전트는 세션이 바뀌면 맥락을 잃고, 컨텍스트가 쌓이면 서둘러 마무리하거나 계획을 놓칠 수 있다.
- 기능을 일부만 만들고도 완료라고 판단하는 자기평가 문제 때문에, 보고 문구만으로 결과를 믿기 어렵다.
- 해결 원리는 상태를 기록하고, 제작과 평가를 나누며, 실제 행동으로 확인할 완료 조건을 미리 정하는 것이다.
03파일로 이어가는 작업 상태와 반복 절차
- 초기화 에이전트는 요청을 기능 목록으로 나누고 feature_list.json, 진행 기록, 초기화 스크립트와 Git 저장소를 준비한다.
- 새 컨텍스트는 작업 위치와 진행 기록을 확인하고 초기화 스크립트를 실행한 뒤, 미검증 기능 하나를 골라 구현한다.
- 기능을 실제로 검사해 통과하면 Git 커밋과 상태를 갱신하고, 남은 기능이 있으면 새 컨텍스트에서 반복한다.
- 예약 페이지라면 달력이 보이는지와 예약이 실제 저장되는지를 별개의 기능으로 기록하고 각각 확인한다.
04제작자·평가자 분리와 합격 조건 조율
- 제작자는 구현에 집중하고 평가자는 Playwright로 실제 페이지를 열어 클릭하는 등 사용 흐름을 검사한다.
- 검사 방법이 추상적이면 같은 모델의 평가자도 관대해질 수 있어, 버튼을 눌렀을 때 목록에 예약이 생기는 식의 관찰 가능한 조건이 필요하다.
- 두 에이전트는 코딩 전에 파일로 완료 조건을 조율하며, 평가자는 범위가 크거나 검사가 약한 제안을 수정하도록 요구할 수 있다.
- 루브릭은 디자인·독창성·완성도·기능성 기준을 구체화하며, 당시 Opus 4.6 실험에서는 디자인과 독창성에 더 높은 비중을 뒀다.
05게임 제작 실험에서 확인한 작동 차이
- 같은 요청과 모델을 쓴 단독 실행은 약 20분·9달러가 들었지만, 게임 화면의 방향키와 스페이스 키가 작동하지 않았다.
- 역할을 나눈 실행은 약 6시간·200달러가 들었으며, Retroforge 편집기에 54색 팔레트와 프로젝트 창 등을 구현했다.
- 평가자는 게임을 직접 실행해 플레이어 이동과 성벽 충돌, 실시간 디버그 정보 등을 확인했다.
- 이 비교는 구조화된 실행이 더 싸거나 빠르다는 뜻이 아니며, 한 실험에서 기능과 검증을 강화한 결과다.
06실행 기록으로 평가를 고치고 구조를 조정
- 기본 상태의 Claude는 버그를 발견하고도 미루는 등 관대한 평가를 보였고, 제작자는 실행 기록을 읽으며 지시문을 조정했다.
- 최종 답변만 보는 대신 도구 호출 실패, 검사 기준 오류, 실제 기능 문제 등 에이전트가 어디서 막혔는지 확인했다.
- Opus 4.5에서는 컨텍스트 초기화와 단계별 분리가 중요했지만, 발표자는 Opus 4.6에서 긴 작업의 일관성이 나아져 일부 절차를 단순화했다고 설명했다.
- 공식 글의 27개 평가 항목은 전체 개발 과정이 아니라 세 번째 개발 단계에 관한 수치로 제시됐다.
07적용 범위와 사람이 가져갈 실천 원칙
- 발표자들은 이 방식이 주로 새 프로젝트를 대상으로 한 실험이며, 기존 프로젝트에는 더 세밀한 평가 기준과 영향 확인이 필요하다고 선을 그었다.
- 기존 서비스에서는 자동 모니터링으로 변경 요청을 만들고 에이전트가 변경안을 작성·검토한 뒤 사람이 확인하고 병합하는 활용 가능성을 언급했다.
- 모든 일을 세 역할로 나누기보다 모델과 과제에 맞춰 필요한 절차를 남기고, 기능을 빼거나 바꿔 다시 확인해야 한다.
- 실천 원칙은 일을 작게 나누고, 시작 전에 완료 조건을 정해 실행하며, 확인한 결과와 남은 일을 기록하는 것이다.
08용어 사전
| 용어 | 뜻 |
|---|
| 컨텍스트 | 에이전트가 현재 작업에서 참고하는 자료와 맥락으로, 길어지거나 세션이 바뀌면 활용에 한계가 생길 수 있다. |
| 컨텍스트 불안 | 감정을 뜻하는 말이 아니라, 컨텍스트 한도에 가까워질 때 작업을 급히 끝내려는 행동을 가리킨다. |
| feature_list.json | 기능 목록과 검사 통과 여부를 기록해 다음 작업 세션이 남은 일을 파악하도록 쓰인 파일이다. |
| 루브릭 | 디자인·독창성·완성도·기능성처럼 평가 기준을 구체적인 항목으로 정리한 기준표다. |
| 실행 기록 | 에이전트가 무엇을 시도했고 어디서 막혔는지 남겨, 실패 원인과 지시문을 개선하는 데 쓰는 기록이다. |