> ## Content Index
> Fetch the complete content index at: https://zerodraftlab.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 월 1,000 PR의 뒷면: 에이전트가 앱을 직접 확인하게 만든다
- URL: https://zerodraftlab.com/agent-verification-before-scale/
- Published: 2026-09-26T02:15:10.000Z
- Updated: 2026-09-26T02:15:10.000Z
- Author: JooMong
- Tags: 무료

9월 25일 X 피드에는 Lauren Tan이 한 달에 PR 1,000건을 머지한다는 [한국어 소개 글](https://x.com/USAnt%5FIDEA/status/2103289608473874725?ref=zerodraftlab.com)이 돌았다. 글은 에이전트 여러 개를 거느린 장면을 앞세운다. 연결된 [영상 게시물](https://x.com/LunaTechAI/status/2102932672096170356?ref=zerodraftlab.com)도 비슷하다. 원본 강연의 질문은 숫자보다 앞에 있다. 에이전트가 작성한 코드가 돌아간다고 어떻게 확인할 것인가.

> [강연을 소개한 X 게시물](https://x.com/USAnt%5FIDEA/status/2103289608473874725?ref=zerodraftlab.com)

> [강연 영상이 실린 X 게시물](https://x.com/LunaTechAI/status/2102932672096170356?ref=zerodraftlab.com)

강연 주최 측 [Maven의 원본 안내](https://maven.com/p/e23d9c/how-cursor-turned-ai-agents-into-better-engineers?ref=zerodraftlab.com)에는 2026년 8월 12일 행사이며 발표자를 Cursor의 Member of Technical Staff로 적었다. 9월에 다시 퍼진 게시물은 그녀를 SpaceX AI 엔지니어로 소개한다. 따라서 강연에서 말한 지난달의 PR 수치를 현재 회사의 실적으로 옮겨 적을 수는 없다. [공개된 강연 음성 인식 녹취](https://mikesblogdesign.com/grokbotteam/?ref=zerodraftlab.com)에서 Tan은 지난달 약 1,000건을 올렸고, 어느 날 아침에는 에이전트가 합친 PR 약 20건을 main에서 사후 검토했다고 말한다. 이 수치는 발표자의 자기 보고이며 독립적인 저장소 집계나 품질 측정이 아니다.

## 앱을 실행하지 못하는 에이전트는 사람을 기다린다

Tan은 자신도 처음에는 에이전트가 성능 문제를 그럴듯하게 추측했지만 원인을 잘못 짚는 일을 겪었다고 설명한다. 사람이 앱을 실행하고 화면이나 오류를 복사해 돌려주면, 사람의 확인 속도가 에이전트의 작업 속도를 묶는다. 그래서 브라우저 개발자 도구, CPU 트레이스, 힙 스냅샷, iOS 시뮬레이터 등 사용자가 실제로 접하는 환경을 에이전트가 직접 다루게 하는 검증 스킬을 만들었다고 한다. 코드를 제출한 뒤 앱을 켜서 결과를 확인하는 고리가 먼저 생긴 것이다.

앱을 실행할 수 있어도 어디를 눌러야 할지 모르면 효과가 작다. Tan이 소개한 feature map에는 기능의 위치, 화면에서 접근하는 순서, 관련 코드와 선택자가 들어간다. 사용자가 "왼쪽 사이드바가 느리다"고 말했을 때 에이전트가 어느 화면과 파일을 찾아야 하는지 알려주는 지도다. 그녀는 실패를 볼 때마다 P-Stack에 지침을 더하고, 지침을 바꾼 뒤에는 eval로 같은 과제를 다시 시켜 실제 행동이 달라지는지 확인한다고 설명한다.

## 반복되는 실수는 저장소에서 막는다

강연 후반부의 Dune은 GrokBot 코드베이스를 에이전트가 다루기 쉽게 재편한 설계 이름이다. Tan은 그 환경에서 React `useEffect`와 코드 주석을 금지하는 CI 규칙까지 둔다고 밝혔다. 모든 React 프로젝트에 적용할 권고가 아니다. 그녀의 팀이 겪은 우회와 오해를 그 저장소에서 기계적으로 막는 선택이다. 발표에서는 이 구조로 옮기는 데 600건 넘는 PR과 많은 토큰을 썼다고도 말한다. 1,000건이라는 월간 수치 앞에 긴 정리 비용이 있었다.

강연의 순서는 병렬 에이전트 수를 늘리는 법보다 실무적이다. 실제 화면에서 재현할 수 있게 하고, 어느 기능을 다루는지 알려주고, 지침이 먹히는지 시험하고, 자주 틀리는 길을 CI에서 닫는다. 그러고 나서야 자동 병합의 범위를 넓혔다고 Tan은 설명한다. 다만 발표만으로 버그율, 되돌림 비율, 팀 전체의 순생산성을 알 수는 없다. 다른 팀이 배울 수 있는 것은 PR 수치 자체보다 어떤 증거를 자동 병합의 조건으로 삼았는지다.