01핵심 개요
- 노력 수준을 무조건 max·ultra로 두기보다 작업 난도에 따라 light·medium·high부터 단계적으로 올려야 한다고 설명한다.
- DeepSuite에서 max는 73%·작업당 12달러였고, high는 같은 점수에 5.72달러, low는 67%에 2.19달러였다.
- 브라우저와 컴퓨터 사용 기능으로 Dribbble 등 API·MCP가 없는 서비스에서 레퍼런스를 수집하고 결과물에 반영할 수 있다.
- 기존 스킬을 감사해 미사용 항목과 과도한 스캐폴딩을 정리하고, Astra에 맞는 유효성을 벤치마크로 확인하라고 제안한다.
- 음성 모드의 개별 채팅 작업 및 다중 채팅 오케스트레이션 활용, 명확화 질문 처리 지침을 프롬프트에 넣는 방식을 다룬다.
02핵심 주장 / 논점 구조
- 영상은 GPT6 Astra를 이전 모델과 같은 방식으로 쓰면 결과를 제한할 수 있다며 다섯 가지 사용상 실수를 제시한다.
- 다섯 논점은 노력 수준 선택, 브라우저·컴퓨터 사용, 스킬 관리, 음성 모드, 분기 상황을 다루는 프롬프트다.
- Codex의 브라우저 사용·컴퓨터 사용·음성 모드를 Anthropic의 Cloud Code 데스크톱 앱보다 앞선 기능으로 언급한다.
03노력 수준별 성능과 비용 비교
- DeepSuite 벤치마크에서 max는 73%와 작업당 평균 12달러, low는 67%와 2.19달러로 제시됐다.
- max에서 extra high로 낮추면 더 좋은 결과와 거의 절반 수준의 작업당 비용이 나타났고, high는 max와 같은 점수에 5.72달러였다.
- Artificial Analysis Coding Agent Index에서는 low가 62.6점·150달러, max가 67점·498달러로 소개됐다.
- Joshua Tree의 가상 호텔 Dune House 홈페이지 제작에서 light는 13분·9만1,000토큰, max는 30분·15만2,000토큰을 사용했다.
- 발표자는 특별히 복잡한 작업이 아니면 high를 넘지 말고, 원하는 결과가 안 나올 때만 노력 수준을 점진적으로 올리라고 권한다.
04브라우저로 Dribbble 레퍼런스 수집하기
- 브라우저와 컴퓨터 사용은 CLI, MCP, API를 바로 쓸 수 없는 애플리케이션과 Astra를 연결하는 수단으로 설명된다.
- Astra가 Dribbble에서 호텔 웹사이트를 검색하고 개별 사례를 열어 스크린샷을 수집하는 과정을 시연했다.
- 수집한 이미지 레퍼런스를 Codex로 가져와 Dune House 웹사이트의 새 버전을 생성했고, 모바일 동작과 테스트도 수행했다고 말한다.
- 생성 결과에는 사용한 스크린샷, 메모, Dribbble 원문 링크를 담은 레퍼런스 표도 만들어졌다고 설명한다.
- 동일한 방식은 Pinterest, Twitter 등에서 정보를 가져와 Codex에 반영하는 시나리오로 확장할 수 있다고 언급한다.
05스킬 감사와 컨텍스트 윈도우 정리
- Astra와 Fable이 발전하면서 과거 모델용 스캐폴딩 역할을 하던 스킬은 현재 불필요하거나 성능을 방해할 수 있다고 주장한다.
- superpowers와 GSD 같은 무거운 스캐폴딩 스킬은 제거 대상으로 언급되며, 오래 설치한 미사용 스킬의 정리 필요성을 제기한다.
- 영상 속 skill audit은 Anthropic의 skill creator를 바탕으로 만들었으며, 특정 스킬의 현 모델 적합성을 테스트하도록 설계됐다고 설명한다.
- 감사 프롬프트는 스킬과 로그를 살펴 미사용 항목, 프런트매터 설명, 검토할 스킬 목록을 분류한다.
- 분류 버킷은 fix now, review for retirement, test next, test later, preserve로 제시된다.
06Astra 음성 모드의 작업과 오케스트레이션
- Codex 음성 모드는 이전의 GPT Terra light 기반에서 Astra high 또는 Astra low를 사용할 수 있도록 개선됐다고 설명한다.
- 개별 채팅 안에서 음성으로 웹페이지 하단의 정보 요청 폼 추가와 브라우저 기반 테스트를 지시하는 사례를 보였다.
- 실제 작업 수행에는 high, 대화나 여러 작업을 관리하는 오케스트레이터 역할에는 light를 쓰는 방식을 제안한다.
- 새 음성 채팅에서는 별도 채팅을 열어 GPT6 Astra 음성 모드 활용 사례 조사와 HTML 문서 작성을 지시했다.
- 한 음성 창에서 여러 채팅과 에이전트를 관리할 수 있어 동시에 2개 이상 에이전트를 운용할 때 유용하다고 설명한다.
07명확화 질문을 제어하는 프롬프트 설계
- OpenAI 설명에 따르면 Astra는 이전 모델이 가정을 했을 상황에서 명확화를 요청할 가능성이 더 높다고 전한다.
- 장시간 실행되는 복잡한 에이전트 작업에서는 갈림길에서 질문할지, 사용자 의도를 따라 완료까지 진행할지를 프롬프트에 명시해야 한다고 말한다.
- 질문 없이 진행하도록 맡길 경우, 갈림길에서 방향을 잡아 줄 스캐폴딩이 충분하지 않으면 결과가 평균으로 회귀할 수 있다고 설명한다.
- OpenAI가 제시한 방식으로, 검토 가능한 구체적 결과를 준비한 뒤에만 승인을 요청하고 이미 할 수 있는 일을 막지 않도록 지시하는 프롬프트를 소개한다.
- 문제만 보고하지 말고 문제와 가능한 해결책을 함께 제시하도록 모델에 요청하는 방식을 권한다.
08용어 사전
| 용어 | 뜻 |
|---|
| 노력 수준 | Codex에서 light, medium, high, extra high, max, ultra 등으로 설정하며 비용·토큰·작업 시간과 결과에 영향을 주는 설정이다. |
| DeepSuite | 영상에서 장시간 실행되는 에이전트 작업을 평가하는 벤치마크로 소개되며 노력 수준별 점수와 작업당 비용 비교에 사용됐다. |
| 브라우저 및 컴퓨터 사용 | API·MCP·CLI가 없는 웹서비스에서 검색, 클릭, 스크린샷 수집, 테스트 등을 Astra가 수행하게 하는 기능이다. |
| skill audit | 스킬과 로그를 점검해 미사용 스킬을 찾고, 현재 모델에서의 적합성을 테스트·분류하도록 만든 스킬이다. |
| 오케스트레이터 | 음성 채팅 하나에서 새 채팅을 만들고 여러 에이전트 작업을 지시·관리하는 Astra의 활용 방식이다. |
| 스캐폴딩 | 이전 모델을 보조하려고 추가한 스킬과 지침 구조로, 영상에서는 과도하면 Astra의 컨텍스트를 막을 수 있다고 설명한다. |