메이커 에반MORNING DIGEST · 2026-08-03 · 메이커 에반🎬 영상

1년 만든 AI 하네스, 지난달에 전부 지웠습니다

인포그래픽 요약

01핵심 개요

메이커 에반이 1년 동안 쌓아 올린 AI 하네스(harness) — AI 모델 바깥에 씌우는 규칙·검사·자동화 장치 뭉치 — 를 지난달 전부 지운 경험담이다. 룰 파일, 워크플로우 강제 장치, 멀티에이전트 오케스트레이션, 오픈소스 프레임워크 여러 개를 합쳐 몇만 줄에 달했지만, 걷어내니 오히려 결과물 품질은 올라가고, 작업 시간은 줄고, 토큰 비용은 크게 떨어졌다.

핵심 주장은 "하네스를 만들지 마라"가 아니라 "하네스를 놓는 자리가 바뀌었다"이다. AI가 스스로 못 하던 일(실행·계획·형식·사실확인)을 대신해 주던 실행 하네스는 이제 짐이 되었지만, AI가 절대 알 수 없는 것(내 머릿속의 의도·판단·맥락)을 고정하는 기획 하네스는 모델이 아무리 좋아져도 사라지지 않는다.

02핵심 내용 구조

영상은 크게 네 덩어리로 구성된다.

1
하네스란 무엇이고 왜 만들었나과거 모델의 약점을 막기 위한 합리적 장치였음
2
세 모델(오퍼스 5, 페이블 5, GPT 5.6)이 무엇을 바꿨나약점이 사라지며 울타리가 허공에 뜸
3
어떤 장치·오픈소스가 짐이 되는가필요 없어진 것을 켜두면 적극적으로 방해함
4
그럼에도 남겨야 할 것: 기획 하네스성능이 아니라 입장·책임의 문제

03기술적 맥락

세 신모델이 이 지형을 바꿨다.

  • 지시를 안 까먹는다 — 15개를 줘도 다 지킨다. 지시 준수용 장치가 통째로 불필요.
  • 긴 맥락을 진짜로 이해한다 — 30페이지를 실제로 참고하고 중간 조건도 놓치지 않는다. 문서를 조각내 순서대로 넣는 파이프라인이 필요 없어짐.
  • 스스로 계획을 세운다 — "이거 해 줘"만으로 우리가 짠 것보다 나은 순서로 쪼갠다.
  • 모르면 모른다고 한다 — 할루시네이션이 줄어 사실확인 이중 장치가 불필요.

모델별로도 다르다. 오퍼스 5는 긴 작업을 끝까지 끌고 가 "맥락 재주입" 장치가 헛일이 됨. 페이블 5는 톤·문체를 말로 설명해도 잡아 예시 뭉치가 오히려 방해(예시를 많이 넣으면 새 상황에서도 그 예시를 억지로 흉내 냄). GPT 5.6은 언제 검색·계산할지 스스로 판단해 도구 사용 규칙이 불필요.

04전략적 의미

핵심 통찰: "하네스는 AI를 못 믿어서 만드는 장치다." 그러므로 질문은 "지금도 AI를 못 믿는 영역이 어디 남았나"이다.

  • 실행·계획·형식·사실확인 → 이제 믿을 만하다 → 실행 하네스는 사라진다 (성능 문제이므로 모델이 좋아지면 능력이 모델 안으로 넘어옴).
  • 무엇을·왜 만들지 → AI가 못 해서가 아니라 AI 것이 아니라서 남는다 → 기획 하네스는 안 사라진다.

기획 하네스가 안 사라지는 이유 세 가지:

1
소유 문제내 머릿속·회사에만 있는 정보(작년에 그 사업을 왜 접었는지 등)는 모델이 아무리 커져도 못 알아낸다.
2
취향은 성능으로 안 풀린다안전 vs 과감, 둘 다 훌륭할 때 선택은 더 똑똑해진다고 나오는 답이 아니라 입장이 정해져야 나온다.
3
책임은 위임이 안 된다결과가 잘못되면 책임지는 사람이 방향을 정하는 게 맞다.

역할이 바뀌었다: 과거엔 하네스를 고치는 정비공(시간 70%가 장치 수리)이었다면, 이제는 무엇을 만들지 정하는 의뢰인(시간 70%가 방향 결정)이다. 그리고 후자가 훨씬 어렵다.

05핵심 워크플로우/방법론

장치과거 이유지금 문제
프롬프트 체인(쪼개기)순서를 헷갈려서느려지고, 정보 새고, 더 나은 길 막음. 통으로 시킨 게 더 빠르고 품질↑, 비용 절반↓
규칙 파일실수를 막으려고이제 안 하는 실수를 막는 낡은 규칙을 성실히 지켜 오히려 해가 됨
멀티에이전트 오케스트레이션한 모델이 다역할을 못 해서조직도가 모델 안에 이미 있음. 에이전트 간 대화가 전부 토큰 → 같은 작업 6배 비쌈, 정보는 "전화 게임"처럼 100→80→60으로 깎임
자체 검증 루프자기 답을 안 봐서이미 내부 검토를 함. 밖에서 또 검사시키면 멀쩡한 답을 고쳐 뾰족한 게 깎임(1회차가 제일 좋고 반복할수록 밍밍)
1
맥락 오염질문 40자가 프레임워크가 붙인 것들로 11,000자가 되어 내 질문 비중이 0.4%. 내가 안 쓴 지시가 결과를 망치는데 볼 수가 없음.
2
유지보수 부채모델이 2~3달마다 바뀌는데 무료 유지보수 프로젝트는 못 따라오거나 개판으로 유지됨. 검증 안 된 채 스타 수로 후킹하는 케이스 다수.
3
디버깅 불가결과가 이상해도 남의 코드 10겹을 뜯어야 원인을 찾음. 하네스는 문제를 못 만드는 게 아니라 문제를 자꾸 숨김.
  • 문제 정의 — "누가·언제·뭘 못 해서·뭘 포기하는가". "결제 경험을 개선한다"는 소원이지 정의가 아님. 이 한 문단이 룰 파일 200줄보다 결과물을 더 바꿈.
  • 판단 기준과 제약 — "A와 B 중 항상 A, 왜냐하면 ~". '왜냐하면'이 있어야 AI가 새 갈림길에서 같은 방향으로 응용함. 넘으면 안 되는 선(제약)도 함께.
  • 의사결정 기록(ADR) — "날짜 / 뭘 정했나 / 뭘 버렸나 / 왜". 안 적으면 다음 달 AI가 버린 방식을 다시 제안함(기억력이 하루짜리인 천재 컨설턴트).

06활용 시나리오

1
맨몸 테스트자주 하는 작업을 하네스 없이 시켜본다. 맨몸이 더 좋으면 그 하네스는 손해, 비슷하면 비용만 쓰는 중, 확실히 더 나으면 남기되 이유를 적는다.
2
이유를 쪼갠다"모델 약점을 막던 것"(다음 모델에서 사라짐)과 "내 맥락을 넣던 것"(영원히 필요, 문서로 분리)을 구분.
3
오래된 것부터 지운다규칙 파일의 가장 오래된 줄부터 "왜 넣었지?" 기억 안 나면 삭제 후 1주 사용, 문제없으면 죽은 규칙.
4
프레임워크는 통째로 판단"이게 없으면 내가 뭘 못 하지?" 답이 바로 안 나오면 없어도 되는 것.

07현황 및 전망

2026년 기준, 세 신모델의 등장으로 실행 하네스의 대부분이 순손해로 전환됐다는 것이 핵심 진단이다. 특히 "순서 강제" 장치는 어느 모델을 쓰든 가장 먼저 지울 후보. 반대로 기획 하네스는 앞으로도 사라지지 않으며(뉴럴 링크로 뇌 정보를 통째로 읽는 수준이 오지 않는 한), 사람의 시간은 "장치 수리"에서 "방향 결정"으로 이동한다. 에반은 이것이 정답이 아니라 "재보는 방법"이며, 모델 민감도에 따른 활용법을 교육 중이라고 밝혔다.

08용어 사전

용어한줄 설명비유
AI 하네스(harness)AI 모델 바깥에 씌우는 규칙·검사·자동화 장치말에 채우는 마구(굴레·안장) — 딴 길로 못 가게 잡아줌
실행 하네스"어떻게 할지"를 강제하는 장치27년차 목수한테 "망치는 이렇게 잡아"라고 참견
기획 하네스"무엇을·왜 만들지"를 고정하는 장치목수에게 건네는 설계도
프롬프트 체인작업을 잘게 쪼개 순서대로 여러 번 호출요리사에게 "양파 다 썰었어? 보여줘, 이제 마늘"
멀티에이전트 오케스트레이션AI 여러 명을 팀처럼 역할 분담시켜 굴림기획·작성·검토·관리 AI로 나눈 조직도
자체 검증 루프AI 답을 다시 AI에게 검사시켜 반복 수정괜찮다 할 때까지 계속 트집
맥락 오염프레임워크가 붙인 지시로 내 질문이 묻힘쪽지가 100페이지 서류 맨 뒤에 껴 있음
할루시네이션모델이 없는 사실을 자신있게 지어냄모르면서 아는 척
RAG/검색 장치문서를 조각내 저장 후 관련 조각만 꺼내 넣음계약서 3조만 보고 5조 예외를 놓침
맥락 재주입긴 작업 중간에 "아까 그거 기억하지"를 다시 넣기오퍼스 5에선 헛일
ADR(의사결정 기록)정한 것·버린 것·이유를 날짜와 함께 적어둠하루살이 천재에게 남기는 노트

09타임스탬프

메이커 에반 · 2026-08-03
← 목록으로