AI의 진짜 비용은 토큰이 아니라 확신에 찬 오답이다
회사가 AI 도입 비용을 계산할 때 가장 먼저 보는 숫자는 토큰 사용량이다. 모델별 단가를 비교하고, 월 예산을 정하고, 비싼 호출을 싼 모델로 옮긴다. 모두 필요한 일이다.
하지만 더 비싼 비용은 청구서에 찍히지 않는다. 틀린 판단이 그럴듯한 문서가 되어 조직 안을 이동하는 비용이다.
AI가 만든 문서는 빠르다. 목차가 있고, 표가 있고, 문장이 단정하다. 질문을 받으면 곧바로 근거처럼 보이는 설명도 붙인다. 그래서 내용의 정확성과 무관하게 작성자가 충분히 조사했다는 인상을 만든다. 예전에는 20쪽짜리 전략 문서를 만드는 데 걸린 시간이 최소한의 마찰이었다. 이제 그 마찰은 사라졌지만, 검증까지 자동으로 끝난 것은 아니다.
매끄러운 문서는 검증의 증거가 아니다
제품 전략가 Leah Tharin은 AI의 진짜 비용을 다룬 글에서 익명 사례 세 가지를 소개한다. 한 Series A CEO는 고객 조사를 Claude에 맡기고 그 결과를 회사 전략으로 확정했다. 200명 규모 B2B SaaS의 CEO는 예산표 하나를 ChatGPT에 넣어 20쪽짜리 전략 문서를 만들었다. 한 PM은 전체 사용자 수를 특정 기능 사용자 수로 잘못 읽어 리디자인 효과를 85% 과대평가했다.
이 사례들은 독립적으로 감사된 통계가 아니다. 저자가 현장에서 관찰한 익명 사례다. 그래도 세 장면이 가리키는 고장은 같다. AI가 틀린 숫자를 만든 것이 아니라, 사람이 불완전한 입력을 넣고 검증하지 않은 출력을 조직의 사실로 승격했다.
문제는 환각만이 아니다. 모델은 사용자가 “전환율은 15%다”라고 쓰면 그 숫자의 출처를 알 수 없다. 실험 결과인지, 대시보드를 잘못 읽은 것인지, 회의에서 누군가 말한 추정치인지 구분하지 못한다. 주어진 전제를 사실로 받아들이고 그 위에서 가장 자연스러운 다음 문장을 만든다.
설명은 오답을 더 믿게 만들 수도 있다
2025년 CHI에 발표된 Microsoft Research의 사전 등록 통제실험은 308명을 대상으로 LLM 답변의 설명, 출처, 불일치가 신뢰에 미치는 영향을 살폈다. 설명이 붙으면 참가자들은 정답뿐 아니라 오답에도 더 의존했다. 반대로 출처가 제시되거나 설명 안의 불일치가 드러나면 잘못된 답에 대한 의존이 줄었다.
설명이 있다는 사실과 설명이 맞다는 사실은 다르다. 그러나 사람은 유창한 인과관계를 만나면 검토가 끝났다고 느끼기 쉽다. AI가 낸 답에 “근거도 설명해줘”라고 한 번 더 묻는 것만으로는 안전장치가 되지 않는 이유다. 같은 모델이 자신의 첫 답을 방어하는 문장을 더 길게 만들 수 있기 때문이다.
또 다른 CHI 2025 연구는 지식노동자 319명에게서 936개의 실제 AI 사용 사례를 모았다. 연구진은 AI에 대한 신뢰가 높을수록 비판적 사고 노력이 줄고, 자신의 과업 능력에 대한 자신감이 높을수록 비판적 사고가 늘어나는 연관을 관찰했다. AI 시대에 필요한 능력은 프롬프트를 길게 쓰는 기술만이 아니다. 결과가 이상하다는 것을 알아볼 수 있는 도메인 판단력이다.
여기서 비용의 단위가 바뀐다. 토큰 비용은 호출 직후 보인다. 잘못된 ICP를 따라 만든 제품, 과대평가된 실험을 따라 투입한 두 달, 틀린 전략에 정렬된 조직의 비용은 몇 달 뒤에 나타난다. 전자는 몇 달러지만 후자는 사람과 자본의 방향을 바꾼다.
그 방향을 실제로 바꾸는 힘은 AI에게서 나오지 않는다. AI의 문장을 조직의 사실로 승인한 사람과, 그 승인이 통과한 절차에서 나온다. 그래서 이 문제의 핵심은 더 좋은 프롬프트가 아니라 확신이 만들어지고 유통되는 방식이다.
확신은 개인의 성격이 아니라 조직의 공급망이다
한 문서가 의사결정을 바꾸기까지는 여러 손을 거친다. 누군가 데이터를 꺼내고, 누군가 의미를 붙이고, 누군가 문장으로 정리하고, 마지막 사람이 예산이나 일정을 승인한다. 이 과정에서 원래의 불확실성은 조금씩 지워진다. “아마 그럴 것”은 보고서에서 “그렇다”가 되고, 회의 자료에서는 “우리가 아는 사실”이 된다.
AI는 이 공급망을 새로 만든 것이 아니다. 다만 속도를 높이고 흔적을 줄였다. 예전에는 숫자를 잘못 읽은 사람이 계산 과정을 남겼고, 문서를 만든 사람이 왜 그렇게 썼는지 기억했다. 이제는 질문 한 줄과 매끄러운 결과 사이의 변환 과정이 보이지 않는다. 문장은 더 단정해졌지만, 누가 무엇을 확인했는지는 오히려 흐려진다.
가령 “전환율은 15%다”라는 문장이 있다고 하자. 모델은 이 숫자가 실험 결과인지, 지난달 대시보드인지, 회의에서 나온 추정인지 모른다. 그러나 그 숫자로 시장 규모와 성장 계획을 설명할 수는 있다. 설명이 길어질수록 처음의 미확인 숫자는 더 많은 결론을 지탱하고, 나중에는 되돌리기 어려운 전제가 된다.
앞서 본 308명 대상 실험에서 설명이 정답과 오답 모두에 대한 의존을 높였다는 결과가 중요한 이유도 여기에 있다. 사람은 설명을 보면 근거가 추가됐다고 느끼지만, 실제로는 하나의 미확인 전제가 더 많은 문장을 얻었을 뿐일 수 있다. 반대로 출처와 설명 내부의 불일치가 보이면 잘못된 답에 대한 의존이 줄었다. 신뢰를 안전하게 만드는 것은 더 매끄러운 설명이 아니라, 설명이 깨질 수 있는 지점을 보이게 하는 일이다.
좋은 조직은 답보다 반증 경로를 남긴다
이 관점에서 책임은 모든 문장을 다시 조사하는 노동이 아니다. 무엇을 직접 확인했고, 무엇을 계산했으며, 무엇을 아직 가설로 두었는지 구분하는 일이다. 중요한 숫자에는 링크 하나보다 계보가 필요하다. 어떤 원자료에서, 어떤 기간과 분모로, 누가 꺼냈고, 그 숫자가 어떤 결정을 바꾸려 하는지가 보여야 한다.
2026년에 공개된 AI 글쓰기 계획 검토 실험은 이 방향을 보조한다. 참가자에게 AI 계획의 가정을 직접 분석하게 했을 때, 인지부하를 늘리지 않으면서 과의존이 가장 크게 줄었다. 아직 동료심사 전 preprint라 일반 법칙으로 볼 수는 없다. 그래도 “다시 확인하세요”라는 경고보다 “이 계획이 성립하려면 무엇이 참이어야 하는가”라는 질문이 더 강한 마찰을 만든다는 점은 선명하다.
반증 경로가 남아 있으면 오류는 실패로 끝나지 않는다. 어떤 전제가 무너졌는지 알 수 있고, 다음 문서에서 같은 전제를 더 일찍 의심할 수 있다. 반대로 결론만 남으면 조직은 틀린 이유를 배우지 못한 채 사람이나 모델만 바꾼다.
마찰을 넣으면 AI의 속도를 잃지 않을까
여기에는 당연한 반론이 있다. 매번 출처와 가정을 확인하면 AI로 얻은 속도를 다시 잃는 것 아니냐는 질문이다. 실제로 모든 이메일과 초안에 같은 검증 절차를 적용하면 그렇다. 검증이 관료제가 되면 사람은 형식만 채우고, 중요한 의심은 더 잘 숨겨진다.
그래서 경계는 “AI를 썼는가”가 아니라 “이 문장이 무엇을 움직이는가”에 놓여야 한다. 표현을 다듬는 문장과 가격을 바꾸는 문장은 같은 검증 비용을 요구하지 않는다. 되돌리기 쉬운 초안에는 속도를 허용하고, 채용·해고·의료·법무·대규모 예산처럼 되돌리기 어려운 판단에는 더 많은 증거를 요구해야 한다.
이것은 AI에 대한 불신이 아니다. 회계에서 큰 금액에 더 강한 통제를 두고, 코드에서 위험한 변경에 더 깊은 리뷰를 요구하는 것과 같다. 속도를 포기하는 대신 실패 비용에 맞춰 마찰을 배치하는 일이다.
지식노동자의 역할은 작성자에서 증거의 관리자로 바뀐다
319명의 지식노동자에게서 936개의 실제 사례를 모은 CHI 연구는 생성형 AI가 비판적 사고를 없애기보다 그 위치를 바꾼다고 설명했다. 직접 문장을 만드는 노력은 줄지만, 정보 검증과 응답 통합, 과업 관리의 중요성은 커진다. 앞으로의 지식노동자는 모든 문장을 직접 쓰는 사람보다 어떤 문장이 사실이 될 자격이 있는지 관리하는 사람에 가까워진다.
이 변화는 AI 활용 능력의 기준도 바꾼다. 프롬프트를 잘 쓰고 문서를 빨리 만드는 능력만으로는 부족하다. 자신이 무엇을 알고 무엇을 가정하는지, 어떤 증거가 나오면 결론을 바꿀지 말할 수 있어야 한다. 확신을 크게 만드는 사람보다 확신의 한계를 정확히 표시하는 사람이 더 믿을 만해진다.
토큰은 계속 싸질 것이다. 문서는 더 빨리 만들어지고, 설명은 더 그럴듯해질 것이다. 그래서 희소해지는 것은 생성 능력이 아니라 판단의 계보다. AI를 잘 쓰는 조직은 가장 많은 답을 만드는 조직이 아니라, 어떤 답이 사실이 될 자격이 있는지 끝까지 추적할 수 있는 조직이다.
주요 출처: Leah Tharin의 현장 에세이, Microsoft Research의 CHI 2025 연구 2편, 2026년 인지적 강제장치 실험 preprint. 익명 사례는 저자의 관찰로만 인용했으며 독립 검증된 통계로 취급하지 않았습니다.