01핵심 개요
메이커 에반이 1년 동안 쌓아 올린 AI 하네스(harness) — AI 모델 바깥에 씌우는 규칙·검사·자동화 장치 뭉치 — 를 지난달 전부 지운 경험담이다. 룰 파일, 워크플로우 강제 장치, 멀티에이전트 오케스트레이션, 오픈소스 프레임워크 여러 개를 합쳐 몇만 줄에 달했지만, 걷어내니 오히려 결과물 품질은 올라가고, 작업 시간은 줄고, 토큰 비용은 크게 떨어졌다.
핵심 주장은 "하네스를 만들지 마라"가 아니라 "하네스를 놓는 자리가 바뀌었다"이다. AI가 스스로 못 하던 일(실행·계획·형식·사실확인)을 대신해 주던 실행 하네스는 이제 짐이 되었지만, AI가 절대 알 수 없는 것(내 머릿속의 의도·판단·맥락)을 고정하는 기획 하네스는 모델이 아무리 좋아져도 사라지지 않는다.
02핵심 내용 구조
영상은 크게 네 덩어리로 구성된다.
03기술적 맥락
세 신모델이 이 지형을 바꿨다.
- 지시를 안 까먹는다 — 15개를 줘도 다 지킨다. 지시 준수용 장치가 통째로 불필요.
- 긴 맥락을 진짜로 이해한다 — 30페이지를 실제로 참고하고 중간 조건도 놓치지 않는다. 문서를 조각내 순서대로 넣는 파이프라인이 필요 없어짐.
- 스스로 계획을 세운다 — "이거 해 줘"만으로 우리가 짠 것보다 나은 순서로 쪼갠다.
- 모르면 모른다고 한다 — 할루시네이션이 줄어 사실확인 이중 장치가 불필요.
모델별로도 다르다. 오퍼스 5는 긴 작업을 끝까지 끌고 가 "맥락 재주입" 장치가 헛일이 됨. 페이블 5는 톤·문체를 말로 설명해도 잡아 예시 뭉치가 오히려 방해(예시를 많이 넣으면 새 상황에서도 그 예시를 억지로 흉내 냄). GPT 5.6은 언제 검색·계산할지 스스로 판단해 도구 사용 규칙이 불필요.
04전략적 의미
핵심 통찰: "하네스는 AI를 못 믿어서 만드는 장치다." 그러므로 질문은 "지금도 AI를 못 믿는 영역이 어디 남았나"이다.
- 실행·계획·형식·사실확인 → 이제 믿을 만하다 → 실행 하네스는 사라진다 (성능 문제이므로 모델이 좋아지면 능력이 모델 안으로 넘어옴).
- 무엇을·왜 만들지 → AI가 못 해서가 아니라 AI 것이 아니라서 남는다 → 기획 하네스는 안 사라진다.
기획 하네스가 안 사라지는 이유 세 가지:
역할이 바뀌었다: 과거엔 하네스를 고치는 정비공(시간 70%가 장치 수리)이었다면, 이제는 무엇을 만들지 정하는 의뢰인(시간 70%가 방향 결정)이다. 그리고 후자가 훨씬 어렵다.
05핵심 워크플로우/방법론
| 장치 | 과거 이유 | 지금 문제 |
|---|---|---|
| 프롬프트 체인(쪼개기) | 순서를 헷갈려서 | 느려지고, 정보 새고, 더 나은 길 막음. 통으로 시킨 게 더 빠르고 품질↑, 비용 절반↓ |
| 규칙 파일 | 실수를 막으려고 | 이제 안 하는 실수를 막는 낡은 규칙을 성실히 지켜 오히려 해가 됨 |
| 멀티에이전트 오케스트레이션 | 한 모델이 다역할을 못 해서 | 조직도가 모델 안에 이미 있음. 에이전트 간 대화가 전부 토큰 → 같은 작업 6배 비쌈, 정보는 "전화 게임"처럼 100→80→60으로 깎임 |
| 자체 검증 루프 | 자기 답을 안 봐서 | 이미 내부 검토를 함. 밖에서 또 검사시키면 멀쩡한 답을 고쳐 뾰족한 게 깎임(1회차가 제일 좋고 반복할수록 밍밍) |
- 문제 정의 — "누가·언제·뭘 못 해서·뭘 포기하는가". "결제 경험을 개선한다"는 소원이지 정의가 아님. 이 한 문단이 룰 파일 200줄보다 결과물을 더 바꿈.
- 판단 기준과 제약 — "A와 B 중 항상 A, 왜냐하면 ~". '왜냐하면'이 있어야 AI가 새 갈림길에서 같은 방향으로 응용함. 넘으면 안 되는 선(제약)도 함께.
- 의사결정 기록(ADR) — "날짜 / 뭘 정했나 / 뭘 버렸나 / 왜". 안 적으면 다음 달 AI가 버린 방식을 다시 제안함(기억력이 하루짜리인 천재 컨설턴트).
06활용 시나리오
07현황 및 전망
2026년 기준, 세 신모델의 등장으로 실행 하네스의 대부분이 순손해로 전환됐다는 것이 핵심 진단이다. 특히 "순서 강제" 장치는 어느 모델을 쓰든 가장 먼저 지울 후보. 반대로 기획 하네스는 앞으로도 사라지지 않으며(뉴럴 링크로 뇌 정보를 통째로 읽는 수준이 오지 않는 한), 사람의 시간은 "장치 수리"에서 "방향 결정"으로 이동한다. 에반은 이것이 정답이 아니라 "재보는 방법"이며, 모델 민감도에 따른 활용법을 교육 중이라고 밝혔다.
08용어 사전
| 용어 | 한줄 설명 | 비유 |
|---|---|---|
| AI 하네스(harness) | AI 모델 바깥에 씌우는 규칙·검사·자동화 장치 | 말에 채우는 마구(굴레·안장) — 딴 길로 못 가게 잡아줌 |
| 실행 하네스 | "어떻게 할지"를 강제하는 장치 | 27년차 목수한테 "망치는 이렇게 잡아"라고 참견 |
| 기획 하네스 | "무엇을·왜 만들지"를 고정하는 장치 | 목수에게 건네는 설계도 |
| 프롬프트 체인 | 작업을 잘게 쪼개 순서대로 여러 번 호출 | 요리사에게 "양파 다 썰었어? 보여줘, 이제 마늘" |
| 멀티에이전트 오케스트레이션 | AI 여러 명을 팀처럼 역할 분담시켜 굴림 | 기획·작성·검토·관리 AI로 나눈 조직도 |
| 자체 검증 루프 | AI 답을 다시 AI에게 검사시켜 반복 수정 | 괜찮다 할 때까지 계속 트집 |
| 맥락 오염 | 프레임워크가 붙인 지시로 내 질문이 묻힘 | 쪽지가 100페이지 서류 맨 뒤에 껴 있음 |
| 할루시네이션 | 모델이 없는 사실을 자신있게 지어냄 | 모르면서 아는 척 |
| RAG/검색 장치 | 문서를 조각내 저장 후 관련 조각만 꺼내 넣음 | 계약서 3조만 보고 5조 예외를 놓침 |
| 맥락 재주입 | 긴 작업 중간에 "아까 그거 기억하지"를 다시 넣기 | 오퍼스 5에선 헛일 |
| ADR(의사결정 기록) | 정한 것·버린 것·이유를 날짜와 함께 적어둠 | 하루살이 천재에게 남기는 노트 |
