좋은 하네스는 스킬을 더 붙이지 않는다
같은 AI를 더 잘 쓰는 방법에 대해, 최근 나온 세 개의 숫자는 서로 충돌하는 것처럼 보인다.
Impossible Research의 Schema 하네스는 ARC-AGI-3 공개 게임에서 평균 98.98%를 기록했다. 연구팀이 함께 제시한 Claude Code 기준선은 42.83%였다. 새 모델을 학습한 결과가 아니라, 모델이 환경을 관찰하고 가설을 기록하고 다음 행동을 검증하는 실행 구조를 바꾼 결과라고 설명한다.
반면 SWE-Skills-Bench는 AI 코딩 에이전트에 재사용 지침 묶음인 ‘스킬’을 추가해도 49개 중 39개는 통과율을 높이지 못했다고 보고했다. 평균 개선은 1.2%에 불과했고, 세 개는 오히려 성능을 최대 10% 낮췄다. 최악의 경우 통과율은 그대로인데 토큰만 451% 늘었다.
한쪽에서는 모델 바깥의 장치가 성능을 두 배 넘게 끌어올리고, 다른 쪽에서는 모델 바깥에 붙인 장치 대부분이 별 도움이 되지 않는다. 차이는 ‘얼마나 많이 붙였는가’가 아니라 무엇을 바꿨는가에 있다.
하네스는 실행을 바꾸고 스킬은 문맥을 늘린다
하네스와 스킬은 자주 같은 말처럼 섞인다. 둘 다 모델 가중치 밖에 있고, 모델에게 더 나은 행동을 시키기 때문이다. 그러나 작동하는 층위는 다르다.
스킬은 대체로 “이 일을 할 때는 이렇게 하라”는 지침, 예시, 참고 자료를 컨텍스트에 넣는다. 모델이 이미 아는 일반론을 다시 설명하거나 현재 프로젝트와 맞지 않는 버전의 절차를 주면, 읽어야 할 문맥만 늘고 판단은 흐려진다. SWE-Skills-Bench에서 성능을 해친 스킬도 오래된 지침이 실제 프로젝트 맥락과 충돌한 경우였다.
좋은 하네스는 조언을 더하지 않는다. 모델이 지금 무엇을 알고 있는지 외부 상태로 남기고, 다음 행동이 현실을 어떻게 바꿨는지 다시 보여주며, 예상과 결과가 어긋나면 규칙을 수정하게 한다. 기억해야 할 것을 파일과 로그로 옮기고, 맞았는지 틀렸는지를 테스트로 돌려준다.
Schema가 강조하는 것도 이 차이다. 에이전트는 게임 화면을 보고 즉흥적으로 움직이는 대신, 관찰한 개체와 규칙을 실행 가능한 세계 모델로 만든다. 행동 전에 다음 상태를 예측하고, 실제 상태와 비교하며, 틀리면 표현이나 규칙을 고친다. 모델에게 “더 논리적으로 생각하라”는 말을 반복하는 것이 아니라 추론이 반박될 수 있는 고리를 만든다.
98.98%를 범용 지능의 돌파로 읽어서는 안 된다. 이 수치는 ARC-AGI-3 공개 세트 25개 궤적의 평균이며 연구팀의 자체 평가다. 비공개 세트에서도 같은 격차가 유지되는지, 독립 재현에서도 같은 결과가 나오는지는 아직 확인되지 않았다. 그래도 이 사례가 보여주는 운영 원리는 유효하다. 모델의 생각을 믿는 것보다 생각이 현실과 부딪치게 만드는 편이 강하다.
비싼 모델의 비용도 토큰 가격보다 구조가 결정했다
Cognition의 Fusion 실험도 같은 방향을 가리킨다. 회사는 FrontierCode 1.1에서 3,000회 자체 평가를 돌려, 비싼 리드 모델이 계획과 판정을 맡고 저렴한 보조 에이전트가 구현을 맡는 구조를 비교했다. Fable 5만 썼을 때는 회당 4.03달러에 60.8점이었지만, Sidekick을 붙이자 1.86달러에 60.7점이었다. 점수는 거의 같고 비용은 54% 줄었다.
핵심은 단순히 싼 모델에게 더 많이 시킨 것이 아니었다. 두 리드 모델의 평균 위임 횟수는 비슷했다. 차이는 언제 무엇을 맡겼는지였다. Fable은 제약, 예외, 완료 조건을 담은 짧은 위임문을 일찍 넘겼고, 결과가 오면 차이를 검토했다. 평균 리드 턴은 11.5회로 Opus의 26.5회보다 적었고, Fable 주도 실행의 81%에서는 리드가 코드를 한 번도 직접 고치지 않았다.
이 역시 모든 작업에 적용되는 공식은 아니다. 짧은 일이나 원인 추적이 한 줄로 이어지는 디버깅은 쪼개서 맡길 부분이 적었다. 좋은 하네스는 무조건 위임하라는 규칙이 아니라, 비싼 판단과 싼 실행의 경계를 작업에 맞게 바꾸는 구조다.
그래서 AI 시스템을 개선할 때 먼저 물어야 할 질문은 “어떤 스킬을 더 설치할까”가 아니다. 모델의 오류를 드러내는 상태, 피드백, 위임, 검증의 고리가 있는가다. 그렇다면 어떤 스캐폴딩은 남기고, 어떤 스킬은 버려야 하는가?
첫 기준은 그 장치가 모델에게 문장을 더 주는지, 현실에서 온 차이를 돌려주는지다. “계획을 세우고 검토하라”는 지침은 모델이 이미 알고 있을 가능성이 높다. 반면 현재 브랜치, 실패한 테스트, 남은 예산, 직전 승인, 실제 API 응답은 모델이 스스로 알 수 없다. 오래가는 하네스는 일반 지식을 가르치기보다 작업의 현재 상태를 공급한다.
이 기준을 실제 시스템에 적용하면 남겨야 할 구조는 네 층으로 좁혀진다. 상태를 밖에 두고, 실패 가능한 검증을 연결하고, 결과 단위로 위임하며, 권한과 중지 조건을 명시하는 것이다.
상태는 대화를 길게 만드는 대신 밖으로 나와야 한다
에이전트가 긴 대화 안에서 모든 사실을 기억하게 하면 컨텍스트가 곧 작업장이 된다. 시간이 갈수록 같은 파일을 다시 읽고, 이미 기각한 가설을 되살리며, 오래된 지시와 새 사실을 한꺼번에 처리한다. 더 큰 컨텍스트 창은 이 문제를 늦출 수 있지만 없애지는 못한다.
좋은 하네스는 상태를 모델 밖의 작은 정본으로 압축한다. 지금의 목표, 이미 확인한 사실, 열린 가설, 실행 결과, 남은 불확실성을 사람이 읽을 수 있고 기계가 갱신할 수 있는 형태로 둔다. 다음 턴에는 전체 대화를 다시 먹이는 대신 이 상태와 필요한 증거만 불러온다. Schema의 실행 가능한 세계 모델은 게임에 맞춘 사례지만, 원리는 코드 작업의 테스트 결과나 영업 에이전트의 고객 상태에도 같다.
검증은 ‘한 번 더 생각해’가 아니라 실패 가능한 판정이어야 한다
AI에게 자기 답을 검토하라고 하면 같은 추론을 다른 문장으로 반복할 수 있다. 검증이 되려면 모델의 자신감과 독립된 판정면이 필요하다. 코드는 테스트와 정적 분석, 데이터 파이프라인은 스키마와 합계 불변식, 콘텐츠는 출처·누출·형식 게이트, 외부 실행은 API 읽기 결과와 권한 로그가 그 역할을 한다.
중요한 것은 판정이 다음 행동을 바꾸는 것이다. 오류를 기록만 하고 같은 경로를 계속 실행하면 관찰 도구일 뿐 하네스가 아니다. 예상 상태와 실제 상태의 차이가 표현 수정, 재계획, 중지 가운데 하나로 이어져야 피드백 고리가 닫힌다.
위임의 단위는 역할이 아니라 검증 가능한 결과다
“너는 시니어 개발자다” 같은 역할 프롬프트는 위임문이 아니다. 누가 무엇을 판단하고, 무엇을 만들며, 어떤 제약을 지키고, 무엇을 근거로 완료를 판정할지가 있어야 한다. Cognition의 실험에서 비용을 줄인 것은 보조 에이전트의 존재 자체보다 리드가 구현 방법을 받아쓰지 않고 제약과 완료 조건을 건넨 방식이었다.
좋은 위임은 컨텍스트도 분리한다. 보조 에이전트는 맡은 범위의 파일과 증거만 읽고 결과와 검증 기록을 돌려준다. 리드는 모든 세부사항을 자기 컨텍스트로 다시 가져오지 않고 차이와 위험만 본다. 반대로 리드가 보고받은 파일을 전부 다시 읽고 직접 고친다면 멀티에이전트는 병렬성이 아니라 중복 비용이 된다.
여기에는 중지 조건도 포함된다. 권한이 없거나, 같은 실패가 반복되거나, 비용 한도를 넘거나, 가정이 깨졌을 때 사람에게 돌려보내야 한다. 자율성은 계속 움직이는 능력이 아니라 어디서 멈춰야 하는지 아는 경계까지 포함한다.
남길 스킬은 모델이 원래 알 수 없는 것을 담는다
SWE-Skills-Bench에서도 모든 스킬이 실패한 것은 아니다. 일곱 개의 전문 스킬은 통과율을 최대 30% 높였다. 범용 모델의 상식으로 대신하기 어려운 특정 도메인의 규칙과 절차를 제공한 경우였다. 이 결과는 스킬을 없애라는 결론보다 스킬이 차지할 자리를 좁혀준다.
남길 가치가 큰 것은 회사 내부 데이터, 개인의 취향, 브랜드 고유 형식, 특정 도구의 접근법, 규제된 절차, 정확한 조직 내 승인 순서다. 공개 인터넷과 모델 가중치에 들어 있을 수 없는 정보다. 반대로 “좋은 글을 쓰는 법”, “버그를 체계적으로 찾는 법”, “코드를 깔끔하게 만드는 법”처럼 일반적인 능력을 보충하는 스킬은 모델 버전이 바뀔 때마다 효용을 다시 증명해야 한다.
스킬에는 유통기한이 있다. 어제 모델의 약점을 고친 지시가 오늘 모델의 더 나은 전략을 방해할 수 있다. 프로젝트 버전이 바뀌면 정확했던 명령도 틀린 명령이 된다. 그래서 스킬 저장소는 지식 자산의 개수로 평가하면 안 된다. 동일 작업을 스킬이 있을 때와 없을 때 돌려 품질, 실패율, 토큰, 시간을 비교하고, 이득을 입증하지 못한 스킬은 제거해야 한다.
모델이 바뀌어도 남는 것은 시스템의 학습이다
프런티어 모델은 계속 좋아지고 가격도 바뀐다. 특정 모델의 사고 습관을 장황한 지시로 교정하는 데 투자하면 다음 버전에서 다시 시작할 가능성이 크다. 반면 평가 세트, 결정적 게이트, 상태 정본, 권한 경계, 실행 증거에 투자하면 어떤 모델을 넣어도 비교할 기반이 남는다.
이것이 좋은 하네스가 스킬을 줄이는 이유다. 모델에게 더 많은 방법론을 외우게 하지 않고, 현실을 볼 수 있는 눈과 틀렸을 때 돌아올 길을 만든다. 필요한 전문 지식만 얇게 주고, 나머지는 상태·도구·테스트·권한으로 바깥에 둔다.
AI의 다음 경쟁력은 가장 긴 지침서가 아니다. 가장 빨리 오류를 발견하고, 가장 싸게 일을 나누며, 가장 분명하게 멈출 수 있는 실행 구조다.
주요 출처: Impossible Research, Schema Harness 및 ARC-AGI-3 Schema Gameplay Trajectories; Cognition, We replaced Opus 4.8 with Fable 5, and Devin’s bill went down; Tingxu Han 외, SWE-Skills-Bench, 2026년 3월 16일 제출; Every, The Case Against Skills. Schema와 Cognition의 수치는 각 연구팀·회사의 공개 세트 자체 평가이며, SWE-Skills-Bench는 소프트웨어 엔지니어링 스킬만 다룬 동료심사 전 프리프린트입니다. 하네스와 스킬의 구분, 상태·검증·위임·중지의 네 층은 이 증거를 바탕으로 한 이 글의 분석입니다.