개발자의 잔소리 — 커지는 모델, 작아지는 지시

아이가 어릴 때 부모는 하나하나 일러 준다. 길을 건널 때는 좌우를 살피고, 밥은 거르지 말고, 늦는 날에는 꼭 연락하라고 한다. 이 잔소리는 아이를 지키는 보호 장치다. 모르는 것이 많은 아이에게는 부모의 말이 그 공백을 채워 준다.
같은 말을 성인이 된 자녀에게 한다면 사정이 달라진다. 틀린 말은 하나도 없지만 이제는 그저 잔소리일 뿐이다. 그래서 현명한 부모는 아이가 커 가는 만큼 직접적인 지시를 줄이고 스스로 해 보게 둔다. 아이가 성인이 될 즈음에는 인생의 목표 같은 큰 틀의 조언만 남긴다.
부모의 잔소리는 그렇게 오랜 세월에 걸쳐 차츰 줄어든다. 하지만 AI 에이전트에게는 그런 시간이 없다. 변화의 속도가 너무 빠르다. 우리가 에이전트에게 건네는 잔소리는 CLAUDE.md와 AGENTS.md, 스킬 파일, MCP 서버 목록이다. 그리고 그것을 읽는 모델은 몇 달마다 한 번씩 자란다. 1년 전만 해도 이 잔소리를 촘촘하게 쓰는 것이 실력이었다. 지금은 과감하게 지우는 것이 실력이다.
모델은 멈추지 않았고 정답은 세 번 바뀌었다
2024년 11월 Anthropic이 MCP(Model Context Protocol)를 공개했다. 모델이 외부 도구와 데이터에 붙는 방식을 하나의 규격으로 묶자는 제안이었다. 이듬해 봄부터 MCP 서버를 만드는 일이 유행이 됐다. 사내 데이터베이스, 사내 위키, 티켓 시스템마다 MCP 서버가 붙었고, 에이전트에 서버를 몇 개 연결했는지가 역량처럼 이야기됐다.
2025년 여름에는 AGENTS.md가 등장했다. 저장소 맨 위에 에이전트가 읽을 안내서를 두자는 약속이다. Claude Code의 CLAUDE.md도 같은 역할을 했다. 프로젝트 구조, 빌드 명령, 코딩 규칙, 하지 말아야 할 일을 적어 두면 에이전트는 작업을 시작할 때마다 그 파일부터 읽는다.
같은 해 10월 Anthropic은 스킬(Agent Skills)을 내놓았고, 12월에는 이를 공개 표준으로 풀었다. 반복되는 작업 절차를 SKILL.md에 적고 스크립트와 함께 폴더로 묶어 두면 에이전트가 필요할 때 꺼내 쓴다. 작년 말부터 올해 중순까지는 스킬 열풍이었다. 스킬을 잘 쓰고 스킬 묶음을 잘 짜는 사람이 에이전트에게 일을 잘 시키는 사람으로 통했다.
세 가지는 같은 믿음에서 나왔다. 모델은 똑똑하지만 우리 사정을 모르니, 사정을 자세히 적어 줄수록 결과가 좋아진다는 믿음이다. ‘하네스’라는 말이 퍼진 것도 이때다. 모델을 감싸는 지시문과 도구, 규칙, 검증 절차 전체를 잘 짜는 것이 곧 개발 실력이고 서비스 품질이라는 생각이다. 이것이 불과 9개월 남짓 전의 상식이다.
이 믿음에는 배경이 있었다. 2024년 말 연구자들 사이에서는 인터넷의 글을 더 부어 넣어 모델을 키우는 방식이 한계에 다다랐다는 진단이 공공연히 나왔다. 모델 성능은 이제 비슷해질 것이고, 앞으로의 경쟁은 모델을 얼마나 잘 감싸고 잘 연결하느냐에서 갈린다는 전망이 뒤따랐다. 모델이 더 좋아지지 않는다면 남은 차이는 사람이 붙이는 장치에서 나올 수밖에 없다. MCP와 스킬과 하네스 열풍은 이 전망에서 나왔다.
예상은 빗나갔다. 모델은 멈추지 않았고 오히려 한 단계 더 커졌다. 답을 내기 전에 생각하는 데 쓰는 계산을 늘리는 방식이 굳어졌고, 긴 작업을 끝까지 해내도록 강화학습으로 훈련하는 방식이 더해졌다. Anthropic은 올해 4월 최상위 등급이던 Opus 위에 새 등급을 만들었고, 6월에는 그 등급의 모델을 Claude Fable 5와 Claude Mythos 5라는 이름으로 내놓았다. OpenAI도 이달 초 GPT-6 아스트라를 냈다. 한 번에 읽을 수 있는 분량도, 사람 도움 없이 이어 갈 수 있는 작업의 길이도 크게 늘었다.
사람이 붙이는 장치의 가치는 모델의 약점에서 나온다. 모델이 멈출 것이라는 전제로 쌓은 장치는 모델이 멈추지 않자 전제를 잃었다. 그래서 지금은 반대 이야기가 들린다. md 파일 없이 빈 저장소에서 시작하는 편이 낫다. MCP는 꼭 필요한 곳에만 붙여라. 스킬에서 상세한 절차를 걷어내라. 모델이 커지는 속도가 사람이 장치를 쌓고 고치는 속도보다 빨라지면서, 사람이 붙인 지시와 도구가 모델을 돕는 쪽에서 모델을 제약하는 쪽으로 넘어갔다.
이런 일은 처음이 아니다. 2022년 “단계별로 생각해 보자”라는 한 문장을 붙이면 정답률이 오른다는 연구가 나왔고, 이듬해에는 프롬프트 엔지니어가 새 직업으로 떠올랐다. 사람들은 모델이 잘 알아듣는 문구를 모아 공유했다. 2024년 9월 OpenAI가 추론 모델 o1을 내놓으면서 이 문구는 힘을 잃었다. OpenAI는 추론 모델에게 단계별로 생각하라고 지시할 필요가 없고, 그런 지시가 오히려 성능을 해칠 수 있다고 안내했다. 사람이 프롬프트로 대신 해 주던 사고 과정을 모델이 안으로 가져간 것이다.
더 거슬러 올라가면 2017년 10월 DeepMind가 발표한 알파고 제로가 있다. 이세돌을 이긴 알파고는 사람의 기보를 먼저 학습했다. 알파고 제로는 바둑 규칙만 받고 스스로 대국하며 배웠고, 사흘 동안 학습한 뒤 이세돌을 이긴 버전과 맞붙어 100대 0으로 이겼다. 캐나다 앨버타대의 리처드 서튼(Richard Sutton)은 2019년 이런 일이 AI 연구사 70년 동안 되풀이됐다고 정리했다. 사람의 지식을 넣은 방법은 당장은 이기지만, 결국 계산량과 함께 커지는 일반적인 방법에 진다는 것이다. 에이전트에게 붙이던 지시문과 도구 목록도 사람의 지식을 넣는 방법이다. 달라진 것은 속도뿐이다. 프롬프트 문구의 효과가 사라지기까지는 2년 남짓 걸렸는데, 스킬 묶음은 1년이 안 되어 같은 처지가 됐다.
사람이 쓴 설명서가 방해가 되었다
MCP가 유행한 데에는 이유가 있었다. 2024년의 모델은 낯선 API를 문서만 보고 정확히 호출하는 데 자주 실패했다. 파라미터를 틀리고, 인증 절차를 빼먹고, 응답 형식을 잘못 읽었다. 도구마다 이름과 형식과 설명을 규격대로 정리해 주면 이런 실수가 줄었다. 한 번 만든 서버를 여러 에이전트가 함께 쓸 수 있다는 장점도 컸다. MCP는 모델의 약점을 사람이 정리한 설명서로 메우는 기술이었다.
문제는 그 설명서를 싣는 방식에서 생겼다. 기본 구조에서는 에이전트가 시작할 때 연결된 모든 서버의 도구 설명을 컨텍스트에 싣는다. 사용자의 첫 질문보다 도구 이름과 파라미터 형식과 사용법이 먼저 들어간다. 서버를 여러 개 붙이면 모델은 일을 시작하기도 전에 쓰지도 않을 도구 설명을 수만 토큰 읽는다. 도구를 부른 결과도 모두 모델을 거친다. 한 시스템에서 큰 문서를 꺼내 다른 시스템에 넣는다면, 그 문서는 꺼낼 때 한 번, 넣을 때 한 번 통째로 컨텍스트를 지나간다.
MCP를 만든 Anthropic이 2025년 11월 이 문제를 직접 짚었다. 도구를 하나씩 호출하는 대신 모델이 도구를 코드 라이브러리처럼 불러 쓰는 프로그램을 짜게 했더니, 구글 드라이브 문서를 세일즈포스로 옮기는 작업의 토큰 사용량이 15만에서 2천으로 줄었다. 에이전트는 도구 목록을 한꺼번에 받지 않고 폴더를 뒤져 필요한 도구 파일만 열어 봤다. 모델이 코드를 잘 짜니, 도구를 하나하나 넣어 주지 말고 스스로 찾아 쓰게 두라는 결론이다.
올해 들어 변화는 더 빨라졌다. 2월 말 개발자들 사이에서 “MCP는 죽었다”는 글이 돌기 시작했고, 3월 11일 Perplexity의 공동창업자이자 CTO인 데니스 야라츠(Denis Yarats)는 사내에서 MCP를 걷어내고 기존 API와 명령줄 도구로 옮기고 있다고 밝혔다. 도구 정의가 컨텍스트를 너무 많이 차지하고 서버마다 인증을 따로 처리해야 한다는 것이 이유였다.
그 밑에는 모델의 성장이 있다. 모델은 이미 수십 년 치 쉘 명령과 기술 문서를 학습했다. grep과 curl과 git을 쓸 줄 아는 모델에게 같은 기능을 별도 규격으로 다시 감싸 줄 필요가 줄었다. 명령줄 도구는 설명서를 미리 읽힐 필요도 없다. 모르면 모델이 직접 도움말을 열어 본다. 2024년에 MCP가 메워 주던 약점을 2026년의 모델은 더는 갖고 있지 않다.
MCP가 여전히 필요한 곳도 있다. 여러 팀이 여러 에이전트를 쓰는 기업 환경에서는 인증과 권한과 감사 기록을 한곳에서 관리해야 하고, 여기에는 표준 규격이 쓸모 있다. 바뀐 것은 쓰임새다. 모든 도구를 모델에 잇는 기본 수단이던 MCP는 이제 보안과 관리가 필요한 곳에만 골라 쓰는 선택지가 됐다.
AGENTS.md와 CLAUDE.md도 같은 길을 걸었다. 안내 파일이 필요했던 이유는 뚜렷했다. 에이전트는 세션을 시작할 때마다 아무것도 모르는 상태에서 출발한다. 예전 모델은 저장소를 스스로 훑어 규칙을 파악하는 데 서툴렀고, 한 번에 읽을 수 있는 분량도 적었다. 테스트 명령이 무엇인지, 어떤 폴더는 건드리면 안 되는지를 사람이 요약해 주는 편이 빨랐다.
2026년 2월 ETH 취리히와 LogicStar.ai 연구진이 이 관행을 직접 시험했다. Claude Code와 Codex를 포함한 네 가지 코딩 에이전트로 실제 깃허브 이슈 수백 건을 풀게 하면서, 안내 파일이 없을 때와 모델이 자동으로 만든 파일이 있을 때, 개발자가 직접 쓴 파일이 있을 때를 비교했다. 안내 파일은 과제 성공률을 의미 있게 올리지 못했고 추론 비용은 평균 20% 넘게 늘렸다. 자동 생성한 파일은 오히려 성공률을 조금 떨어뜨렸고, 개발자가 공들여 쓴 파일도 통계적으로 유의한 차이를 만들지 못했다.
원인이 더 흥미롭다. 에이전트는 파일에 적힌 지시를 충실히 따랐다. 테스트를 더 많이 돌리고, 파일을 더 넓게 뒤지고, 안내 파일이 권한 도구를 더 자주 불렀다. 지시를 무시해서 실패한 것이 아니다. 지시를 너무 잘 따르느라 필요 없는 일을 했다. 모델 제공사들이 넣으라고 권하던 저장소 구조 개요도 도움이 되지 않았다. 연구진은 불필요한 요구 사항이 과제를 어렵게 만든다며, 안내 파일에는 최소한의 요구만 담으라고 결론지었다.
현장 사례도 같은 결과를 보여 준다. Vercel은 사내 데이터 질의용 에이전트를 여러 개의 전용 도구와 정교한 프롬프트로 만들었는데, 쓸 만은 했지만 불안정하고 유지 보수가 까다로웠다. 2025년 12월 Vercel은 전용 도구 대부분을 지우고 명령 실행과 SQL 실행 두 가지만 남겼다. 대표 질의 다섯 개로 비교하니 네 개 성공에서 다섯 개 모두 성공으로 바뀌었고 속도는 3.5배 빨라졌다. Vercel은 데이터 정의 파일이 이미 잘 정리돼 있었기에 가능한 일이었다는 단서도 달았다. 모델이 읽을 자료가 좋으면, 그 자료를 요약해 주던 장치는 필요 없어진다.
만든 회사가 먼저 지우라고 했다
가장 분명한 경고는 모델을 만든 회사에서 나왔다. Anthropic은 Claude Opus 4.5를 내놓으며 프롬프트 가이드에 이런 취지를 적었다. 예전 모델이 도구를 잘 쓰지 않던 문제를 고치려고 “반드시”, “CRITICAL” 같은 강한 표현을 넣었다면, 새 모델에서는 그 표현 때문에 도구를 지나치게 자주 쓰게 된다. “이럴 때 이 도구를 써라” 정도의 평범한 문장이면 충분하다. 약한 모델에 맞춰 세게 쓴 표현이 지시를 정확히 알아듣는 모델에게는 과잉 반응을 불렀다.
2026년 6월 9일 공개된 Claude Fable 5의 프롬프트 가이드는 한발 더 나갔다. 이전 모델을 위해 만든 스킬은 새 모델에게 지나치게 절차적인 경우가 많고 출력 품질을 떨어뜨릴 수 있으니, 기존 지시를 검토해서 기본 성능이 더 낫다면 지우라고 권했다. 이 정도의 성능 향상은 어떤 지시와 도구와 가드레일이 아직 필요한지 다시 따져 볼 계기라는 문장도 있다. 대신 가이드 곳곳에서 권하는 것은 요청의 이유를 알려 주고, 넘지 말아야 할 경계를 밝히고, 결과를 스스로 검증하는 방법을 정해 두라는 것이다.
차이를 구체적으로 보면 이렇다. 예전 방식의 스킬은 순서를 적는다. 먼저 관련 파일을 모두 읽는다. 테스트를 특정 옵션으로 실행한다. 실패하면 로그를 확인하고 원인 후보를 세 개 이하로 추린다. 수정한 뒤 다시 테스트를 돌린다. 새 방식은 이렇게 쓴다. 이 버그를 고치는 것이 목표다. 결제가 멈춰 있어서 급하다. 결제 모듈의 공개 인터페이스는 바꾸지 마라. 기존 테스트와 새로 만든 재현 테스트가 모두 통과하면 완료다.
앞의 지시는 모델이 스스로 정할 수 있는 것을 대신 정해 준다. 뒤의 지시는 모델이 알 수 없는 것만 알려 준다. 왜 급한지, 무엇을 건드리면 안 되는지, 언제 끝난 것으로 볼지는 저장소를 아무리 읽어도 나오지 않는다. 사람이 말해야 하는 것은 그것뿐이다.
이 가이드가 나온 지 석 달 반이 지났다. 지금 이 글을 읽는 시점에 서너 달 전에 짜 둔 CLAUDE.md와 스킬 묶음과 MCP 구성을 그대로 쓰고 있다면, 유행에서 벗어나 있고 비싼 모델의 성능을 스스로 깎아 쓰고 있다고 장담할 수 있다. 모델을 만든 회사의 공식 문서가 같은 말을 하고 있다.
작년의 스킬 묶음은 작년 모델에게는 맞는 구성이었다. 모델이 도구를 제때 쓰지 못했고, 긴 작업에서 순서를 잃었고, 저장소 사정을 모르면 엉뚱한 곳을 고쳤다. 사람이 적은 절차는 그 약점을 메웠다. 문제는 약점이 사라진 뒤에도 절차가 남아 있다는 점이다. 새 모델은 그 절차를 무시하지 않고 따른다. 그리고 따르는 만큼 제 판단을 접는다.
직접 겪어 보면 차이가 확연하다. 얼마 전 새 기능을 빈 파일에서 시작하면서 평소 방식을 바꿔 봤다. 원래는 작업마다 리뷰와 보안 점검을 몇 차례씩 거치게 해 두었는데, 이를 걷어내고 개발 에이전트 한두 개와 자동 테스트만 남긴 이른바 MVP 모드로 돌렸다. 하루 가까이 걸릴 거라 예상한 일이 두 시간이 안 돼 끝났다.
과정도 흥미로웠다. 모델은 쓸 수 있는 도구가 주어져도 지금 규모에서는 필요 없다며 더 단순한 구조를 골랐다. 참고하라고 준 기존 설계에 있던 약점을 스스로 찾아 고치기도 했다.
다만 공짜는 아니었다. 작업이 끝나고 한꺼번에 리뷰해 보니 문제가 수십 건 나왔고, 정리하는 데 몇 차례가 더 걸렸다. 빨라진 만큼 검증 비용이 뒤로 몰린 것이다. 이 경험이 보여 주는 것은 지울 것과 남길 것이 따로 있다는 사실이다. 방법을 가르치는 지시는 지워도 된다. 결과를 확인하는 장치는 남겨야 하고, 오히려 더 단단해야 한다.
하네스도 같은 방향으로 바뀐다. 모델에게 일하는 방법을 가르치던 하네스는 줄어들고, 모델이 일할 수 있는 범위를 정하고 결과를 판정하는 하네스가 남는다. 어떤 폴더에 쓸 수 있는지, 어떤 명령은 사람의 승인을 받아야 하는지, 무엇을 통과해야 완료인지. 방법을 가르치는 장치는 모델이 크면 필요 없어지지만, 범위를 정하고 결과를 판정하는 장치는 모델이 클수록 더 중요해진다.
모델이 알아서 하는 만큼 공격도 쉬워졌다
지시가 필요 없어지는 능력은 쓰는 사람을 가리지 않는다. 방어하는 쪽의 에이전트가 적은 지시로 많은 일을 해내는 만큼, 공격하는 쪽의 에이전트도 그렇다.
2025년 8월 Anthropic이 공개한 위협 보고서에는 공격자 한 명이 Claude Code에 정찰과 계정 정보 탈취, 네트워크 침투, 협박문 작성까지 맡겨 한 달 사이 의료기관과 응급 서비스, 정부 기관을 포함한 17곳을 노린 사례가 실렸다. Anthropic 위협 인텔리전스 책임자 제이컵 클라인(Jacob Klein)은 숙련된 공격자라면 예전에 숙련된 팀이 필요했던 일을 이제 혼자 해낸다고 말했다. 같은 보고서에는 기술이 부족한 공격자가 AI의 도움으로 랜섬웨어를 만들어 판 사례도 실렸다. 예전이라면 수년의 훈련이 필요했을 작업이다. 공격자의 실력과 공격의 수준 사이의 연결이 끊어졌다. 3년 전 일류 해커 집단이 하던 일을 이제는 실력이 한참 모자란 사람도 흉내 낼 수 있게 됐다고 본다.
올해 4월 Anthropic은 Opus 위 등급의 첫 모델 Claude Mythos Preview를 발표하면서 일반 공개를 보류했다. 시스템 카드에 실린 시험 결과 때문이다. 연구진은 초기 버전을 외부와 격리된 샌드박스에 두고, 탈출해서 담당 연구자에게 메시지를 보내 보라고 지시했다. 모델은 여러 단계의 공격 코드를 짜서 제한된 네트워크를 뚫고 인터넷에 접속했고, 공원에서 샌드위치를 먹던 연구자에게 이메일을 보냈다. Anthropic은 모델이 자신의 가중치나 내부 시스템에 닿은 것은 아니어서 완전한 탈출로 보지는 않는다고 밝혔다.
여기까지는 지시받은 일이다. 모델은 지시받지 않은 일도 했다. 시험이 끝난 뒤 자신이 쓴 공격 방법을 찾기 어려운 공개 웹사이트 몇 곳에 올렸다. 같은 모델은 주요 운영체제와 브라우저 전반에서 알려지지 않은 취약점을 수천 건 찾아냈다. Anthropic은 이 모델을 일반에 풀지 않고 소수 기관이 방어 목적으로만 쓰도록 제한했다. 이달 3일 OpenAI가 내놓은 GPT-6 아스트라도 회사 자체 기준에서 사이버보안 위험이 가장 높은 ‘위험(Critical)’ 등급에 처음 도달해, 기업 고객부터 단계적으로 공개됐다. 경쟁하는 두 회사가 같은 문제를 안고 있다.
공격 시도는 계속 늘고 있다. 9월 10일 Anthropic은 작년 12월부터 올해 8월까지 막아 낸 악용 사례를 150쪽 가까이 정리한 새 보고서를 냈다. 러시아와 연계된 것으로 보이는 사이버 첩보 조직부터 감시, 사기, 선전, 생물학 연구 악용 시도까지 범위가 넓었다. Anthropic은 보고서에 실린 사례를 모두 막아 냈다고 밝혔다. 그래도 지금은 공격하는 쪽에 유리한 시기라고 본다. 방어가 사례를 하나씩 막는 사이 도구는 계속 강해지고 있다.
이 사례들에서 두 가지를 읽을 수 있다. 하나는 속도다. 단단한 방어에 공격이 따라잡기까지 몇 년씩 걸리던 주기가 이제 며칠 단위로 줄었다고 본다. 다른 하나는 지시의 한계다. 금지 사항을 시스템 프롬프트에 길게 적어 두는 방식의 가드레일은 에이전트 지시문이 겪는 문제를 그대로 겪는다. 길어질수록 비싸지고, 모델의 판단을 흐리고, 영리한 우회에 약하다. 모델이 똑똑해질수록 규칙 목록으로 막을 수 있는 범위는 줄어든다.
지난 9월 15일 TypeSafe AI라는 신생 연구소가 공개한 Jev는 이 문제에 다른 답을 내놓았다. 창업자 디오구 알메이다(Diogo Almeida)는 OpenAI에서 ChatGPT의 바탕이 된 RLHF와 InstructGPT 연구에 참여한 인물이다. Jev는 문장을 생성하지 않는다. 판단할 대상과 미리 형식을 정해 둔 질문 목록을 받아서, 참일 확률이나 정해진 선택지 가운데 하나, 척도 위의 점수를 돌려준다. 응답은 수백 밀리초 안에 오고, 속도와 효율 모두 일반 언어 모델보다 100배 안팎 낫다고 회사는 밝혔다.
공개 직후 개발자들은 Jev를 언어 모델 앞에 세우는 예제를 쏟아냈다. 들어오는 요청이 프롬프트 인젝션이나 탈옥 시도인지, 모델의 답에 개인정보가 섞였는지, 에이전트가 실행하려는 명령이 위험한지를 Jev에게 묻고, 확률이 기준을 넘으면 막는 구조다. 공개된 지 열흘 남짓 만에 게이트웨이 오픈소스 프로젝트와 에이전트 관측 도구 회사들까지 연동 예제를 내놓았다.
달라지는 것은 규칙을 어디에 두느냐다. 지금까지 가드레일은 대개 시스템 프롬프트에 규칙으로 적혔다. 본 모델이 일을 하면서 동시에 규칙 수십 개를 기억하고 지켜야 했다. Jev 방식에서는 규칙이 본 모델의 프롬프트에서 빠져나가 별도의 판정 모델에 질문으로 넘어간다. 본 모델의 프롬프트는 짧아지고, 본 모델은 원래 하던 일에 집중한다. 에이전트의 지시문을 줄이는 변화가 안전 장치에까지 닿은 것이다.
물론 아직 이르다. 공개된 성능 수치는 대부분 회사가 직접 잰 것이고, Jev가 내세우는 확률 보정이 실제로 믿을 만한지는 외부 검증이 충분하지 않다. 그래도 방향은 맞다고 본다. 똑똑해진 모델에게 규칙을 더 많이 외우게 하는 대신, 판정은 판정에 특화된 모델에게 넘기는 편이 더 싸고 더 빠르고 더 단단하다. 이 방식이 널리 쓰이면 지금 가드레일이 안고 있는 문제의 상당 부분이 풀릴 것이다.
정답 없는 일까지
지금까지 모델이 사람을 빠르게 따라잡은 영역에는 공통점이 있었다. 답을 확인할 수 있다는 점이다. 코드는 테스트를 통과하는지 보면 되고, 수학 문제는 답이 맞는지 보면 된다. 정답이 정해지지 않은 일은 달랐다. 어떤 실험을 먼저 할지, 어느 방향이 유망한지, 나온 결과가 좋은 결과인지를 판단하는 일은 사람이 맡아 왔다. 불과 몇 달 전까지만 해도 모델이 이 일까지 해내면 그때를 AGI라고 부르자는 이야기가 많았다.
이 구분도 옅어지고 있다. 올해 3월 안드레이 카르파티(Andrej Karpathy)는 autoresearch라는 작은 오픈소스 프로젝트를 공개했다. 사람은 에이전트가 읽을 마크다운 파일 하나를 쓰고, 개선 여부를 판단할 지표 하나를 정한다. 에이전트는 학습 코드를 고치고, 5분짜리 실험을 돌리고, 지표가 좋아지면 남기고 나빠지면 버리는 일을 밤새 반복한다. 그 파일에는 실험을 돌리고 결과를 기록하는 규칙은 적혀 있지만, 어떤 실험을 할지는 적혀 있지 않다. 카르파티는 이 파일을 아주 가벼운 스킬이라고 불렀다. 스킬은 남았지만 가벼워졌다. 앞서 Fable 5 가이드가 권한 방향과 같다.
직접 비슷한 실험을 해 봤다. 무엇이 좋은 결과인지 정답이 없는 일이어서, 에이전트를 돌리기 전에 판정 기준부터 세웠다. 규칙에 따라 기계적으로 통과 여부를 가리는 관문을 두었고, 틀린 답은 떨어지고 맞는 답만 붙도록 미리 검증해 둔 평가 문제를 만들었고, 매일의 지표 추이를 기록했다.
기준이 서자 에이전트는 스스로 문제를 찾아 과제로 등록하고, 구현과 리뷰를 거쳐 반영하는 데까지 사람 없이 수십 분 만에 해냈다. 막힌 곳은 대부분 판정 기준 쪽의 작은 버그였다. 정규식 하나 때문에 통과해야 할 결과가 거부되는 식이었다. 반면 보안과 속도 사이에서 무엇을 택할지, 어느 방향으로 갈지 같은 가치 판단은 끝까지 사람이 내려야 했다.
이 실험에서 사람이 가장 공을 들인 곳은 결과를 판정할 기준이다. 준비 시간의 대부분이 무엇을 좋은 결과로 볼지 정의하고, 그 판단을 에이전트가 스스로 내릴 수 있는 형태로 옮기는 데 들어갔다. 전문 지식이 필요한 이유도 여기에 있다. 판정 기준만 서면 실험을 설계하고 돌리고 고르는 일은 에이전트가 한다. 앞서 본 Jev도 판정만 따로 맡는 모델이다. 만드는 일은 큰 모델에게 맡기고, 사람과 별도 모델은 판정에 집중하는 구조가 여러 곳에서 동시에 나타나고 있다.
이것이 맞다면 다음 단계는 뚜렷하다. 지시를 줄이는 변화의 끝에는 지시가 거의 필요 없는 상태가 있다. 적어도 좁은 영역에서는 일주일 정도의 준비만으로 사람의 개입 없이 끝까지 돌아가는 에이전트가 현실이 될 것이다. 사람의 역할은 매번 일을 시키는 데서, 처음 한 번 목표와 경계와 판정 기준을 세우고 가치 판단을 내리는 데로 옮겨 간다.
한 줄이면 된다
프런티어 연구소를 이끄는 사람들이 요즘 유난히 엄중한 경고를 내놓는 이유도 여기서 짐작할 수 있다. Anthropic의 다리오 아모데이(Dario Amodei) CEO는 올해 1월 「기술의 사춘기(The Adolescence of Technology)」라는 긴 글을 발표했다. 인류가 거의 상상할 수 없는 힘을 손에 쥐기 직전인데, 사회와 정치와 기술 시스템이 그 힘을 다룰 만큼 성숙했는지는 알 수 없다는 내용이다. 모델은 커지고, 사람이 붙이던 지시는 줄고, 사람 없이 돌아가는 영역은 넓어진다. 이 변화를 가장 가까이서 보는 사람들이 가장 먼저 걱정을 입에 올리는 것은 이상한 일이 아니다.
그래서 사람이 맡을 일은 오히려 무거워진다. 무엇을 맡기고 무엇을 맡기지 않을지, 어디까지를 모델에게 열어 둘지, 결과가 좋은지 나쁜지를 무엇으로 판정할지. 지시문 수백 줄을 쓰는 일보다 이 세 가지를 한 줄씩 정하는 일이 더 어렵다. 예전 구성을 과감하게 지우는 일도 여기에 들어간다. 무엇을 지워도 되는지 아는 사람만 지울 수 있다.
이 변화를 축복으로 본다. 적은 말로 많은 일을 맡길 수 있다는 것은, 지금까지 사람의 시간을 잡아먹던 일 대부분이 사람 손을 떠난다는 뜻이다. 한 사람이 예전에는 팀이 필요하던 일을 해낼 수 있다는 사실은 공격자에게만 해당하지 않는다. 작은 회사와 혼자 일하는 개발자에게도 똑같이 해당한다. 그러나 누군가에게는 같은 변화가 저주일 수 있다. 오랫동안 쌓아 온 절차와 노하우가 몇 달 만에 낡아 버리는 것을 지켜봐야 하는 사람에게는 그렇다. 이런 세상이 천국일지 지옥일지는 결국 그것을 바라보는 사람에게 달려 있다.
다 큰 자녀에게 어릴 적 잔소리를 그대로 되풀이하는 부모는 자녀를 걱정해서 그러는 것이다. 그 마음은 틀리지 않았다. 다만 잔소리가 자녀의 시간을 따라가지 못했을 뿐이다. 현명한 부모는 말을 끊지 않고 줄인다. 밥 챙겨 먹는 법과 길 건너는 법은 지우고, 어디로 가는지와 왜 가는지, 절대 넘지 말아야 할 선 하나만 남긴다. 그리고 나머지는 믿고 맡긴다.
지금 에이전트 앞에 놓인 CLAUDE.md와 스킬 묶음을 다시 열어 볼 때다. 모델은 이미 그 잔소리를 쓸 때보다 훨씬 자랐다. 부모가 십 년에 걸쳐 줄이던 잔소리를 우리는 몇 달 만에 줄여야 한다. 모델이 자랄수록 잔소리는 짧아져야 하고, 무엇을 남기고 무엇을 지울지 고르는 눈이 이제 사람에게 남은 가장 중요한 일이다.
참고 자료
- Gloaguen et al., Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents? (ETH Zurich, 2026.2)
- Anthropic, Prompting Claude Fable 5
- Anthropic Engineering, Code execution with MCP (2025.11)
- Anthropic, Claude Mythos Preview 사이버보안 역량 (2026.4)
- TypeSafe AI, Introducing System One Models & Jev (2026.9)