같은 날 나온 Opus 5.5와 GPT-6 Sol — 둘 다 값을 내렸고 서로를 재지 않았다
같은 날 공개된 Opus 5.5와 GPT-6 Sol의 공식 발표를 대조했다. API 가격은 Sol이 절반이지만, 두 회사는 서로의 신모델을 같은 시험에서 재지 않았다. 점수와 비용을 어디까지 비교할 수 있는지 살핀다.
2026년 9월 22일 하루에 두 모델이 나왔다. Anthropic의 Claude Opus 5.5와 OpenAI의 GPT-6 Sol이다. 이 글은 둘을 나란히 놓는다. 원문은 OpenAI의 Introducing GPT-6 Sol and Luna와 Anthropic의 Introducing Claude Opus 5.5다.
먼저 결론을 적는다. 둘 다 값을 내렸고, 둘 다 서로의 신모델을 재지 않았다. 같은 이름의 벤치마크가 두 발표에 같이 나오는 건 둘뿐이고, 그 둘에서는 Opus 5.5가 앞선다. 값은 Sol이 정확히 절반이다.
아래는 두 발표문과 각 사의 가격·모델 문서를 읽고 정리한 것이다. 원문이 말하는 것, 내가 직접 확인한 것, 내 해석을 구분해서 적는다. Opus 5.5 단독 변경점은 앞선 글에서 다뤘으니 여기서는 비교에 필요한 만큼만 다시 쓴다.
먼저 확인한 것
- Anthropic Models API에
claude-opus-5-5가 2026-09-21 16:24 UTC 생성으로 올라와 있다. 공개는 9월 22일이다. - OpenAI 개발자 문서의
gpt-6-sol페이지는 스냅샷 날짜 없이gpt-6-sol하나만 둔다. 컨텍스트 1,050,000, 최대 입력 922,000, 최대 출력 128,000, 지식 컷오프 2026년 4월 20일. - TechCrunch에 따르면 Anthropic 발표가 OpenAI보다 90분 앞섰다. 둘 다 미리 준비된 발표라, 서로의 신모델 수치가 상대 표에 없는 이유가 여기서 설명된다.
가격은 Sol이 정확히 절반이다
백만 토큰당 미국 달러다. 두 회사 공식 가격 페이지 기준이다.
- 입력 / 출력 — Opus 5.5 $4 / $20, GPT-6 Sol $2 / $10.
- 캐시 읽기 — Opus 5.5 $0.20, Sol $0.20. 같다. 비율은 다르다. Anthropic은 입력가의 0.05배, OpenAI는 0.1배다.
- 캐시 쓰기 — Opus 5.5 5분 $5 / 1시간 $8, Sol $2.5.
- 배치 — Opus 5.5 $2 / $10, Sol $1 / $5. OpenAI는 Flex도 같은 값이다.
- Fast mode — Opus 5.5 $8 / $40, Sol $4 / $20. 둘 다 표준의 2배다.
세 가지가 눈에 띈다.
첫째, Sol의 $2 / $10은 Claude Sonnet 5의 값이다. VentureBeat가 짚은 대로다. OpenAI는 Sol을 Opus가 아니라 Sonnet 자리에 놓았다.
둘째, Opus 5.5의 $4 / $20은 GPT-5.6 Sol의 값이다. 두 달 전 OpenAI 플래그십의 가격이 이번 Anthropic의 가격이고, OpenAI는 그 값을 다시 절반으로 잘랐다.
셋째, 긴 컨텍스트 요금이 다르다. OpenAI는 입력 272K 토큰을 넘는 요청 전체에 입력 2배, 출력 1.5배를 물린다. Sol이 1M 컨텍스트라고 해도 272K 넘게 넣으면 $4 / $15가 된다. Anthropic은 1M 전 구간이 같은 값이다. 긴 문서를 통째로 넣는 작업에서는 Sol의 가격 우위가 절반으로 줄거나 사라진다.
둘 다 이 가격이 영구라고 말한다. Anthropic은 발표문에서, OpenAI는 VentureBeat에 대변인 확인으로. OpenAI 발표문 자체에는 "GPT-5.6 프로모션 가격 대비 50% 인하"라고만 적혀 있다.
두 발표문은 서로를 재지 않았다
이게 이 글에서 가장 중요한 사실이다.
Anthropic 표의 열은 Opus 5.5, Fable 5.1, Opus 5, GPT-6 Astra, GPT-5.6 Sol 다섯이다. GPT-6 Sol은 없다. 각주는 GPT 수치가 "OpenAI가 보고한 대로"라고 적는다.
OpenAI 표의 비교 대상은 Claude Opus 5, Fable 5.1, Fable 5다. Opus 5.5는 없다. 마지막 줄에 "경쟁 모델 평가는 공개 보고서에서 가져왔고, Fable 5.1 점수가 없으면 Fable 5 점수를 썼다"고 적혀 있다.
그러니 "Opus 5.5 대 GPT-6 Sol"을 같은 하네스에서 돌린 공개 결과는 아직 없다. VentureBeat도 같은 말을 한다. 아래 비교는 두 발표문이 각자 보고한 숫자를 옆에 놓은 것이고, 그게 허용되는 근거는 두 표가 공유하는 모델(Opus 5, Fable 5.1, Astra, GPT-5.6 Sol)의 수치가 서로 일치한다는 점뿐이다.
겹치는 벤치마크 둘
두 발표문에 같은 이름·같은 판으로 나오는 벤치마크는 둘이다.
AutomationBench 1.0.6. 47개 도구로 영업·마케팅·재무·지원·인사 워크플로를 끝까지 수행하는 테스트다. Zapier가 운영한다.
- Opus 5.5: 40.0% (Zapier 얼리 액세스 평가, 폴백 없음)
- GPT-6 Astra (max): 41.4%
- GPT-6 Sol (xhigh): 33.2%, 과제당 $0.27
- Fable 5.1 + Opus 5 폴백 (max): 31.4%
- Opus 5 (max): 26.9%
OpenAI는 Sol이 "Opus 5 max를 과제당 비용 9%로 앞선다"고 쓴다. 맞다. 다만 그 Opus 5는 두 달 전 모델이고, 같은 리더보드에서 Opus 5.5는 Sol보다 6.8점 높다. Astra는 Opus 5.5보다 1.4점 높다.
FrontierCode 1.1 Main. 실제 코드베이스에 머지 가능한 변경을 만드는지, 테스트 품질·범위 절제·코드 스타일까지 채점한다.
- Opus 5.5: 54.4% (medium effort에서 54.6%)
- GPT-6 Astra (max): 53.3%
- Fable 5.1: 50.3%
- GPT-6 Sol (max): 49.3%, 과제당 $2.14
- GPT-5.6 Sol (max): 47.5%
OpenAI는 Sol이 "Fable 5.1 xhigh를 훨씬 낮은 비용으로 맞춘다"고 쓴다. 그런데 OpenAI 차트에서 Fable 5.1 xhigh는 48.7%이고 medium은 50.9%다. xhigh가 medium보다 낮은 이상한 점수인데, OpenAI는 그 낮은 쪽을 비교 대상으로 골랐다. 이 두 수치는 Kingy AI가 OpenAI 차트 데이터에서 옮긴 것이다. 발표문 본문에는 차트 이미지만 있어서 나는 직접 읽지 못했고, 지적 자체도 Kingy AI의 것이다.
여기부터 내 해석이다. 겹치는 두 벤치마크에서 Opus 5.5는 Sol보다 5–7점 높고, Astra와는 앞서거니 뒤서거니다. 즉 성능 축에서 Opus 5.5의 상대는 Sol이 아니라 Astra다. 가격 축에서 Opus 5.5의 상대는 Sol이다. 두 회사가 서로 다른 축에 신모델을 놓아서, 정면 비교가 어색해졌다.
한쪽에만 있는 벤치마크
나머지는 한 발표문에만 있어서 직접 비교가 안 된다. 각 사가 무엇을 내세우는지만 보인다.
Anthropic만 — Terminal-Bench 4.0(Opus 5.5 66.4%, Astra 57.9%, GPT-5.6 Sol 37.3%), CursorBench 4.0(57.8%), GDPval-AA v2.1(Elo 1846 대 Astra 1542), Terminal-Bench-Science(58.7%, Astra는 64.6%로 더 높다), Humanity's Last Exam(67.7%), Chartography(89.0%), OSWorld 2.0 partial(81.8%).
OpenAI만 — DeepSWE v1.1(Sol max 68.8%, Fable 5 xhigh 69.9%), Agents' Last Exam(Sol max 56.4%, Opus 5 최고 55.9%), OSWorld 2.0 offline(Sol xhigh 60.5%, Opus 5 medium 60.3%), 자체 사실성 평가.
OSWorld 2.0은 양쪽에 있지만 Anthropic은 "partial", OpenAI는 "offline set의 partial reward, v2026.08.08"이라고 적어서 같은 판인지 확인이 안 된다. 81.8 대 60.5를 그대로 비교하지 않는다.
Terminal-Bench 4.0은 Anthropic이 Astra를 거의 9점 앞서는 표인데 OpenAI 발표문엔 없다. DeepSWE는 OpenAI가 Fable에 1.1점 차로 붙는 표인데 Anthropic 발표문엔 없다. 각자 유리한 표를 냈다는 뜻이고, 이건 두 회사 모두 그렇다.
비용을 말하는 방식이 다르다
OpenAI는 과제당 달러를 적는다. AutomationBench $0.27, FrontierCode $2.14, DeepSWE $2.74, OSWorld $3.25. effort별로 다섯 단계 전부 값이 붙어 있다.
Anthropic은 비율만 적는다. "Astra 대비 약 20%의 비용", "GPT-5.6 Sol 대비 약 3분의 1". 절대 금액은 어디에도 없다.
내 해석이다. 달러를 적는 쪽이 검증하기 쉽다. 반면 비율은 상대의 가격이 바뀌면 같이 흔들린다. Anthropic이 발표한 지 90분 뒤 OpenAI가 Sol 값을 절반으로 잘랐으니, Anthropic 발표문의 "GPT-5.6 Sol 대비 3분의 1"은 그날 오후부터 이미 낡은 비교다. 다음 발표에서 어느 쪽이 방식을 바꾸는지 보면 된다.
같은 방향으로 움직인 것
서로를 안 쟀지만 두 발표는 같은 방향을 가리킨다.
- 기본 effort가 둘 다 medium이다. Opus 5.5는 Opus 5의 high에서 내려왔다. Sol도 medium이 기본이다. 낮은 effort에서 이전 세대 high를 맞춘다는 주장도 양쪽에 있다.
- 글이 짧아졌다. Anthropic은 "결론을 앞에, 전문용어를 덜". OpenAI는 "더 명확하게, 은어 줄이고, 저가치 세부 줄이고, 조금 짧게". OpenAI는 같은 프롬프트에 5.6 Sol과 6 Sol이 답한 걸 나란히 두는데, 6 Sol 쪽이 "뭘 확인했고 뭘 안 했는지"를 말한다는 점을 장점으로 꼽는다. Anthropic의 비교 탭이 내세운 것과 같은 성질이다.
- 캐시가 싸졌다. Opus 5.5는 캐시 읽기를 입력가의 0.1배에서 0.05배로 내렸다. OpenAI는 effort와 도구 목록을 바꿔도 캐시가 안 깨지게 했고, 명시적 캐시 경계를 추가했다. GitHub가 이 개선으로 Copilot의 신규 처리 토큰을 절반 이하로 줄였다고 한다.
- 정직성 지표를 냈다. OpenAI는 코딩 기만율 1.3%(5.6 Sol 10.4%), 고장난 검색 도구 미고지 5.4%(77.8%)를 적었다. Anthropic은 경계 침범 시도가 Opus 5 대비 85% 줄었다고 적었다. 측정 방식이 달라 숫자를 비교할 순 없지만, 둘 다 "덜 속인다"를 릴리스 항목으로 넣었다.
다른 방향으로 움직인 것
- thinking을 끌 수 있는가. Sol은
reasoning.effort: none이 있다. Opus 5.5는 thinking을 끌 수 없고disabled가 400이다. Anthropic은 Fable 5.1의 제약을 Opus에도 걸었고, OpenAI는 반대로 끄는 옵션을 남겼다. - 강제 툴 호출. Opus 5.5는
tool_choice: any/tool이 400이다. Sol은 함수 호출을 지원하되 Chat Completions에서는 effort none일 때만 된다는 단서가 붙는다. 방향이 다른 제약이다. - 긴 컨텍스트 요금. 위에 적은 대로 OpenAI는 272K 초과 할증, Anthropic은 평탄.
- 플랫폼. Opus 5.5는 출시일에 Bedrock·Vertex·Foundry·Claude Platform on AWS 전부. Sol은 OpenAI API·Codex·ChatGPT Work이고, 가격 페이지에 "Bedrock의 OpenAI 모델은 AWS 통해 동일가"라는 줄이 있다. Azure는 발표문·가격 페이지 어디에도 없다.
확인하지 못한 것과 경계
같은 하네스 결과가 없다. 이 글의 모든 숫자는 두 회사가 각자 보고한 것이다. Opus 5.5와 GPT-6 Sol을 한 곳에서 돌린 공개 결과는 2026-09-24 현재 없다. 두 표를 옆에 놓는 것은 공유 모델 수치가 일치한다는 근거 위에서만 성립한다.
벤치마크는 재현하지 않았다. 나는 어느 쪽도 돌리지 않았다. Anthropic 점수는 프로덕션 안전장치를 켠 채 측정했고 개입된 과제는 Opus 4.8·5로 폴백한 점수다. OpenAI 점수는 연구 환경이나 API에서 측정했고 프로덕션 ChatGPT와 다를 수 있다고 적혀 있다.
FrontierCode의 Fable 5.1 수치가 두 표에서 다르다. Anthropic 표는 50.3%, OpenAI 차트는 medium 50.9% / xhigh 48.7%다. effort 설정 차이로 보이지만 확인하지 못했다.
OpenAI 정렬 수치는 2차 자료 간에 어긋난다. 고장난 검색 도구 미고지율을 VentureBeat는 5.4%, Kingy AI는 4.9%로 적었다. 발표문 본문에는 차트 이미지만 있어 숫자를 직접 읽지 못했다. 위에 적은 5.4%는 VentureBeat 값이다.
"영구 가격". OpenAI 발표문에는 없고 대변인이 VentureBeat에 말한 것이다.
읽고 남은 것
두 발표를 붙여 읽으면 남는 건 하나다. 양쪽 다 "더 똑똑하다"가 아니라 "같은 일을 더 싸게"를 팔고 있다. Anthropic은 Fable급을 Opus 값에, OpenAI는 Astra급을 Sonnet 값에.
그리고 둘 다 상대의 신모델을 재지 않았다. 90분 차이로 나왔으니 못 잰 것이지 안 잰 게 아닐 수 있다. 그래도 결과는 같다. 지금 "어느 게 낫냐"에 답하려면 두 회사 표가 아니라 제3자의 같은 하네스 결과를 기다리거나, 자기 워크로드로 직접 돌려야 한다.
직접 돌릴 사람에게 필요한 좌표는 이것이다. Anthropic 쪽은 claude-opus-5-5, thinking 항상 켜짐, effort 기본 medium. OpenAI 쪽은 gpt-6-sol, effort none부터 max까지, 기본 medium, 272K 넘으면 할증.
Source notes
- Primary source: Introducing GPT-6 Sol and Luna (OpenAI), 2026-09-22 — 2026-09-24 열람. 벤치마크 표·협업 스타일 비교·정렬 항목 이름은 본문, 정렬 수치는 차트 이미지라 본문에서 직접 읽지 못함
- Introducing Claude Opus 5.5 (Anthropic), 2026-09-22 — 표의 열 구성과 각주, 비용 비율 문구
- OpenAI gpt-6-sol 모델 문서, OpenAI API pricing — 컨텍스트·출력·effort·272K 할증·배치·Fast mode
- Anthropic Pricing, What's new in Claude Opus 5.5
- VentureBeat — 영구 가격 대변인 확인, Sonnet 5 가격 대응, "같은 하네스 결과 없음" 지적. TechCrunch — 90분 시차
- Kingy AI — 3자 블로그. effort별 점수·비용 표와 Fable 5.1 xhigh 비교 대상 지적. 1차 자료가 아니므로 숫자는 OpenAI 차트와 대조한 것만 인용
- 모델 ID·생성 시각은 Anthropic Models API로 2026-09-23 직접 조회. 벤치마크는 어느 쪽도 재현하지 않음