> ## Content Index
> Fetch the complete content index at: https://zerodraftlab.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# 같은 날 나온 Opus 5.5와 GPT-6 Sol — 둘 다 값을 내렸고 서로를 재지 않았다
- URL: https://zerodraftlab.com/opus-5-5-vs-gpt-6-sol/
- Published: 2026-10-01T00:00:00.000Z
- Updated: 2026-09-30T23:59:59.000Z
- Description: 같은 날 공개된 Opus 5.5와 GPT-6 Sol의 공식 발표를 대조했다. API 가격은 Sol이 절반이지만, 두 회사는 서로의 신모델을 같은 시험에서 재지 않았다. 점수와 비용을 어디까지 비교할 수 있는지 살핀다.
- Author: JooMong
- Tags: 무료

2026년 9월 22일 하루에 두 모델이 나왔다. Anthropic의 **Claude Opus 5.5**와 OpenAI의 **GPT-6 Sol**이다. 이 글은 둘을 나란히 놓는다. 원문은 OpenAI의 [Introducing GPT-6 Sol and Luna](https://openai.com/index/introducing-gpt-6-sol-and-luna/?ref=zerodraftlab.com)와 Anthropic의 [Introducing Claude Opus 5.5](https://www.anthropic.com/news/claude-opus-5-5?ref=zerodraftlab.com)다.

먼저 결론을 적는다. **둘 다 값을 내렸고, 둘 다 서로의 신모델을 재지 않았다.** 같은 이름의 벤치마크가 두 발표에 같이 나오는 건 둘뿐이고, 그 둘에서는 Opus 5.5가 앞선다. 값은 Sol이 정확히 절반이다.

아래는 두 발표문과 각 사의 가격·모델 문서를 읽고 정리한 것이다. 원문이 말하는 것, 내가 직접 확인한 것, 내 해석을 구분해서 적는다. Opus 5.5 단독 변경점은 앞선 글에서 다뤘으니 여기서는 비교에 필요한 만큼만 다시 쓴다.

## 먼저 확인한 것

- Anthropic Models API에 `claude-opus-5-5`가 2026-09-21 16:24 UTC 생성으로 올라와 있다. 공개는 9월 22일이다.
- OpenAI 개발자 문서의 `gpt-6-sol` 페이지는 스냅샷 날짜 없이 `gpt-6-sol` 하나만 둔다. 컨텍스트 1,050,000, 최대 입력 922,000, 최대 출력 128,000, 지식 컷오프 2026년 4월 20일.
- TechCrunch에 따르면 Anthropic 발표가 OpenAI보다 **90분** 앞섰다. 둘 다 미리 준비된 발표라, 서로의 신모델 수치가 상대 표에 없는 이유가 여기서 설명된다.

## 가격은 Sol이 정확히 절반이다

백만 토큰당 미국 달러다. 두 회사 공식 가격 페이지 기준이다.

- **입력 / 출력** — Opus 5.5 $4 / $20, GPT-6 Sol **$2 / $10**.
- **캐시 읽기** — Opus 5.5 $0.20, Sol $0.20\. **같다.** 비율은 다르다. Anthropic은 입력가의 0.05배, OpenAI는 0.1배다.
- **캐시 쓰기** — Opus 5.5 5분 $5 / 1시간 $8, Sol $2.5.
- **배치** — Opus 5.5 $2 / $10, Sol $1 / $5\. OpenAI는 Flex도 같은 값이다.
- **Fast mode** — Opus 5.5 $8 / $40, Sol $4 / $20\. 둘 다 표준의 2배다.

세 가지가 눈에 띈다.

첫째, **Sol의 $2 / $10은 Claude Sonnet 5의 값이다.** VentureBeat가 짚은 대로다. OpenAI는 Sol을 Opus가 아니라 Sonnet 자리에 놓았다.

둘째, **Opus 5.5의 $4 / $20은 GPT-5.6 Sol의 값이다.** 두 달 전 OpenAI 플래그십의 가격이 이번 Anthropic의 가격이고, OpenAI는 그 값을 다시 절반으로 잘랐다.

셋째, **긴 컨텍스트 요금이 다르다.** OpenAI는 입력 272K 토큰을 넘는 요청 전체에 입력 2배, 출력 1.5배를 물린다. Sol이 1M 컨텍스트라고 해도 272K 넘게 넣으면 $4 / $15가 된다. Anthropic은 1M 전 구간이 같은 값이다. 긴 문서를 통째로 넣는 작업에서는 Sol의 가격 우위가 절반으로 줄거나 사라진다.

둘 다 이 가격이 영구라고 말한다. Anthropic은 발표문에서, OpenAI는 VentureBeat에 대변인 확인으로. OpenAI 발표문 자체에는 "GPT-5.6 프로모션 가격 대비 50% 인하"라고만 적혀 있다.

## 두 발표문은 서로를 재지 않았다

이게 이 글에서 가장 중요한 사실이다.

**Anthropic 표**의 열은 Opus 5.5, Fable 5.1, Opus 5, GPT-6 Astra, GPT-5.6 Sol 다섯이다. GPT-6 Sol은 없다. 각주는 GPT 수치가 "OpenAI가 보고한 대로"라고 적는다.

**OpenAI 표**의 비교 대상은 Claude Opus 5, Fable 5.1, Fable 5다. Opus 5.5는 없다. 마지막 줄에 "경쟁 모델 평가는 공개 보고서에서 가져왔고, Fable 5.1 점수가 없으면 Fable 5 점수를 썼다"고 적혀 있다.

그러니 "Opus 5.5 대 GPT-6 Sol"을 같은 하네스에서 돌린 공개 결과는 **아직 없다**. VentureBeat도 같은 말을 한다. 아래 비교는 두 발표문이 각자 보고한 숫자를 옆에 놓은 것이고, 그게 허용되는 근거는 두 표가 공유하는 모델(Opus 5, Fable 5.1, Astra, GPT-5.6 Sol)의 수치가 서로 일치한다는 점뿐이다.

## 겹치는 벤치마크 둘

두 발표문에 같은 이름·같은 판으로 나오는 벤치마크는 둘이다.

**AutomationBench 1.0.6.** 47개 도구로 영업·마케팅·재무·지원·인사 워크플로를 끝까지 수행하는 테스트다. Zapier가 운영한다.

- Opus 5.5: **40.0%** (Zapier 얼리 액세스 평가, 폴백 없음)
- GPT-6 Astra (max): 41.4%
- GPT-6 Sol (xhigh): **33.2%**, 과제당 $0.27
- Fable 5.1 + Opus 5 폴백 (max): 31.4%
- Opus 5 (max): 26.9%

OpenAI는 Sol이 "Opus 5 max를 과제당 비용 9%로 앞선다"고 쓴다. 맞다. 다만 그 Opus 5는 두 달 전 모델이고, 같은 리더보드에서 Opus 5.5는 Sol보다 6.8점 높다. Astra는 Opus 5.5보다 1.4점 높다.

**FrontierCode 1.1 Main.** 실제 코드베이스에 머지 가능한 변경을 만드는지, 테스트 품질·범위 절제·코드 스타일까지 채점한다.

- Opus 5.5: **54.4%** (medium effort에서 54.6%)
- GPT-6 Astra (max): 53.3%
- Fable 5.1: 50.3%
- GPT-6 Sol (max): **49.3%**, 과제당 $2.14
- GPT-5.6 Sol (max): 47.5%

OpenAI는 Sol이 "Fable 5.1 xhigh를 훨씬 낮은 비용으로 맞춘다"고 쓴다. 그런데 OpenAI 차트에서 Fable 5.1 xhigh는 48.7%이고 medium은 50.9%다. xhigh가 medium보다 낮은 이상한 점수인데, OpenAI는 그 낮은 쪽을 비교 대상으로 골랐다. 이 두 수치는 Kingy AI가 OpenAI 차트 데이터에서 옮긴 것이다. 발표문 본문에는 차트 이미지만 있어서 나는 직접 읽지 못했고, 지적 자체도 Kingy AI의 것이다.

*여기부터 내 해석이다.* 겹치는 두 벤치마크에서 Opus 5.5는 Sol보다 5–7점 높고, Astra와는 앞서거니 뒤서거니다. 즉 성능 축에서 Opus 5.5의 상대는 Sol이 아니라 Astra다. 가격 축에서 Opus 5.5의 상대는 Sol이다. 두 회사가 서로 다른 축에 신모델을 놓아서, 정면 비교가 어색해졌다.

## 한쪽에만 있는 벤치마크

나머지는 한 발표문에만 있어서 직접 비교가 안 된다. 각 사가 무엇을 내세우는지만 보인다.

**Anthropic만** — Terminal-Bench 4.0(Opus 5.5 66.4%, Astra 57.9%, GPT-5.6 Sol 37.3%), CursorBench 4.0(57.8%), GDPval-AA v2.1(Elo 1846 대 Astra 1542), Terminal-Bench-Science(58.7%, Astra는 64.6%로 더 높다), Humanity's Last Exam(67.7%), Chartography(89.0%), OSWorld 2.0 partial(81.8%).

**OpenAI만** — DeepSWE v1.1(Sol max 68.8%, Fable 5 xhigh 69.9%), Agents' Last Exam(Sol max 56.4%, Opus 5 최고 55.9%), OSWorld 2.0 offline(Sol xhigh 60.5%, Opus 5 medium 60.3%), 자체 사실성 평가.

OSWorld 2.0은 양쪽에 있지만 Anthropic은 "partial", OpenAI는 "offline set의 partial reward, v2026.08.08"이라고 적어서 같은 판인지 확인이 안 된다. 81.8 대 60.5를 그대로 비교하지 않는다.

Terminal-Bench 4.0은 Anthropic이 Astra를 거의 9점 앞서는 표인데 OpenAI 발표문엔 없다. DeepSWE는 OpenAI가 Fable에 1.1점 차로 붙는 표인데 Anthropic 발표문엔 없다. 각자 유리한 표를 냈다는 뜻이고, 이건 두 회사 모두 그렇다.

## 비용을 말하는 방식이 다르다

OpenAI는 과제당 달러를 적는다. AutomationBench $0.27, FrontierCode $2.14, DeepSWE $2.74, OSWorld $3.25\. effort별로 다섯 단계 전부 값이 붙어 있다.

Anthropic은 비율만 적는다. "Astra 대비 약 20%의 비용", "GPT-5.6 Sol 대비 약 3분의 1". 절대 금액은 어디에도 없다.

*내 해석이다.* 달러를 적는 쪽이 검증하기 쉽다. 반면 비율은 상대의 가격이 바뀌면 같이 흔들린다. Anthropic이 발표한 지 90분 뒤 OpenAI가 Sol 값을 절반으로 잘랐으니, Anthropic 발표문의 "GPT-5.6 Sol 대비 3분의 1"은 그날 오후부터 이미 낡은 비교다. 다음 발표에서 어느 쪽이 방식을 바꾸는지 보면 된다.

## 같은 방향으로 움직인 것

서로를 안 쟀지만 두 발표는 같은 방향을 가리킨다.

- **기본 effort가 둘 다 medium이다.** Opus 5.5는 Opus 5의 high에서 내려왔다. Sol도 medium이 기본이다. 낮은 effort에서 이전 세대 high를 맞춘다는 주장도 양쪽에 있다.
- **글이 짧아졌다.** Anthropic은 "결론을 앞에, 전문용어를 덜". OpenAI는 "더 명확하게, 은어 줄이고, 저가치 세부 줄이고, 조금 짧게". OpenAI는 같은 프롬프트에 5.6 Sol과 6 Sol이 답한 걸 나란히 두는데, 6 Sol 쪽이 "뭘 확인했고 뭘 안 했는지"를 말한다는 점을 장점으로 꼽는다. Anthropic의 비교 탭이 내세운 것과 같은 성질이다.
- **캐시가 싸졌다.** Opus 5.5는 캐시 읽기를 입력가의 0.1배에서 0.05배로 내렸다. OpenAI는 effort와 도구 목록을 바꿔도 캐시가 안 깨지게 했고, 명시적 캐시 경계를 추가했다. GitHub가 이 개선으로 Copilot의 신규 처리 토큰을 절반 이하로 줄였다고 한다.
- **정직성 지표를 냈다.** OpenAI는 코딩 기만율 1.3%(5.6 Sol 10.4%), 고장난 검색 도구 미고지 5.4%(77.8%)를 적었다. Anthropic은 경계 침범 시도가 Opus 5 대비 85% 줄었다고 적었다. 측정 방식이 달라 숫자를 비교할 순 없지만, 둘 다 "덜 속인다"를 릴리스 항목으로 넣었다.

## 다른 방향으로 움직인 것

- **thinking을 끌 수 있는가.** Sol은 `reasoning.effort: none`이 있다. Opus 5.5는 thinking을 끌 수 없고 `disabled`가 400이다. Anthropic은 Fable 5.1의 제약을 Opus에도 걸었고, OpenAI는 반대로 끄는 옵션을 남겼다.
- **강제 툴 호출.** Opus 5.5는 `tool_choice: any/tool`이 400이다. Sol은 함수 호출을 지원하되 Chat Completions에서는 effort none일 때만 된다는 단서가 붙는다. 방향이 다른 제약이다.
- **긴 컨텍스트 요금.** 위에 적은 대로 OpenAI는 272K 초과 할증, Anthropic은 평탄.
- **플랫폼.** Opus 5.5는 출시일에 Bedrock·Vertex·Foundry·Claude Platform on AWS 전부. Sol은 OpenAI API·Codex·ChatGPT Work이고, 가격 페이지에 "Bedrock의 OpenAI 모델은 AWS 통해 동일가"라는 줄이 있다. Azure는 발표문·가격 페이지 어디에도 없다.

## 확인하지 못한 것과 경계

**같은 하네스 결과가 없다.** 이 글의 모든 숫자는 두 회사가 각자 보고한 것이다. Opus 5.5와 GPT-6 Sol을 한 곳에서 돌린 공개 결과는 2026-09-24 현재 없다. 두 표를 옆에 놓는 것은 공유 모델 수치가 일치한다는 근거 위에서만 성립한다.

**벤치마크는 재현하지 않았다.** 나는 어느 쪽도 돌리지 않았다. Anthropic 점수는 프로덕션 안전장치를 켠 채 측정했고 개입된 과제는 Opus 4.8·5로 폴백한 점수다. OpenAI 점수는 연구 환경이나 API에서 측정했고 프로덕션 ChatGPT와 다를 수 있다고 적혀 있다.

**FrontierCode의 Fable 5.1 수치가 두 표에서 다르다.** Anthropic 표는 50.3%, OpenAI 차트는 medium 50.9% / xhigh 48.7%다. effort 설정 차이로 보이지만 확인하지 못했다.

**OpenAI 정렬 수치는 2차 자료 간에 어긋난다.** 고장난 검색 도구 미고지율을 VentureBeat는 5.4%, Kingy AI는 4.9%로 적었다. 발표문 본문에는 차트 이미지만 있어 숫자를 직접 읽지 못했다. 위에 적은 5.4%는 VentureBeat 값이다.

**"영구 가격".** OpenAI 발표문에는 없고 대변인이 VentureBeat에 말한 것이다.

## 읽고 남은 것

두 발표를 붙여 읽으면 남는 건 하나다. **양쪽 다 "더 똑똑하다"가 아니라 "같은 일을 더 싸게"를 팔고 있다.** Anthropic은 Fable급을 Opus 값에, OpenAI는 Astra급을 Sonnet 값에.

그리고 둘 다 상대의 신모델을 재지 않았다. 90분 차이로 나왔으니 못 잰 것이지 안 잰 게 아닐 수 있다. 그래도 결과는 같다. 지금 "어느 게 낫냐"에 답하려면 두 회사 표가 아니라 제3자의 같은 하네스 결과를 기다리거나, 자기 워크로드로 직접 돌려야 한다.

직접 돌릴 사람에게 필요한 좌표는 이것이다. Anthropic 쪽은 `claude-opus-5-5`, thinking 항상 켜짐, effort 기본 medium. OpenAI 쪽은 `gpt-6-sol`, effort none부터 max까지, 기본 medium, 272K 넘으면 할증.

[이메일로 다음 글 받기](#/portal/signup)

---

Source notes

- Primary source: [Introducing GPT-6 Sol and Luna (OpenAI)](https://openai.com/index/introducing-gpt-6-sol-and-luna/?ref=zerodraftlab.com), 2026-09-22 — 2026-09-24 열람. 벤치마크 표·협업 스타일 비교·정렬 항목 이름은 본문, 정렬 수치는 차트 이미지라 본문에서 직접 읽지 못함
- [Introducing Claude Opus 5.5 (Anthropic)](https://www.anthropic.com/news/claude-opus-5-5?ref=zerodraftlab.com), 2026-09-22 — 표의 열 구성과 각주, 비용 비율 문구
- [OpenAI gpt-6-sol 모델 문서](https://developers.openai.com/api/docs/models/gpt-6-sol?ref=zerodraftlab.com), [OpenAI API pricing](https://developers.openai.com/api/docs/pricing?ref=zerodraftlab.com) — 컨텍스트·출력·effort·272K 할증·배치·Fast mode
- [Anthropic Pricing](https://platform.claude.com/docs/en/about-claude/pricing?ref=zerodraftlab.com), [What's new in Claude Opus 5.5](https://platform.claude.com/docs/en/models/opus-5-5/whats-new-opus-5-5?ref=zerodraftlab.com)
- [VentureBeat](https://venturebeat.com/technology/openai-releases-gpt-6-sol-and-luna-models-slashing-api-costs-50-or-more?ref=zerodraftlab.com) — 영구 가격 대변인 확인, Sonnet 5 가격 대응, "같은 하네스 결과 없음" 지적. [TechCrunch](https://techcrunch.com/2026/09/22/openai-launches-gpt-6-sol-and-luna/?ref=zerodraftlab.com) — 90분 시차
- [Kingy AI](https://kingy.ai/blog/gpt-6-sol-luna-specs-benchmarks-pricing-comparison/?ref=zerodraftlab.com) — 3자 블로그. effort별 점수·비용 표와 Fable 5.1 xhigh 비교 대상 지적. 1차 자료가 아니므로 숫자는 OpenAI 차트와 대조한 것만 인용
- 모델 ID·생성 시각은 Anthropic Models API로 2026-09-23 직접 조회. 벤치마크는 어느 쪽도 재현하지 않음