같은 날 나왔지만 서로를 재지 않았다
Opus 5.5 발표문의 벤치마크 표에는 다섯 칸이 있다. Opus 5.5, Claude Fable 5.1, Claude Opus 5, GPT-6 Astra, GPT-5.6 Sol이다. OpenAI 쪽 경쟁 모델로는 이달 초에 나온 최상위 모델 GPT-6 Astra와, 이번에 교체된 한 세대 앞 GPT-5.6 Sol이 들어갔다. 같은 날 나온 GPT-6 Sol은 없다.
GPT-6 Sol 발표문도 마찬가지다. 비교 대상으로 나오는 Claude는 Opus 5, Fable 5, Fable 5.1이다. Opus 5.5는 한 번도 나오지 않는다. 발표 시점을 생각하면 당연한 일이다. 상대 모델이 공개되기 전에 표를 만들었으니 넣을 수가 없다.
문제는 이 빈칸을 메우려는 글들이다. 한쪽 표의 숫자와 다른 쪽 표의 숫자를 한 줄에 옮겨 적으면 그럴듯한 대결표가 나오지만, 두 회사는 같은 이름의 벤치마크를 서로 다른 판과 다른 설정으로 돌렸다. 뒤의 벤치마크 절에서 실제로 같은 벤치마크에 같은 모델이 전혀 다른 점수로 적힌 예를 보인다. 이 글은 두 표가 같은 기준을 쓴 것이 확인되는 자리에서만 숫자를 맞대고, 나머지는 각 회사가 무엇을 무엇과 비교했는지 그대로 옮긴다.
기본 사양을 한 표에
먼저 두 모델을 API로 부를 때 알아야 할 값들이다. Opus 5.5는 Anthropic의 발표문과 모델 문서, 요금 페이지에서, GPT-6 Sol은 OpenAI의 모델 페이지와 API 요금표에서 옮겼다. 가격은 모두 100만 토큰당 미국 달러다.
| 항목 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|
| API 모델 ID | claude-opus-5-5 | gpt-6-sol |
| 입력 / 출력 | $4 / $20 | $2 / $10 |
| 캐시 읽기 | $0.20 | $0.20 |
| 캐시 쓰기 | 5분 $5 · 1시간 $8 | $2.50 |
| 배치 | 입력 $2 · 출력 $10(절반) | 입력 $1 · 출력 $5(Batch · Flex 절반) |
| 빠른 모드 | 입력 $8 · 출력 $40, 최대 2.5배 속도 · Claude API에서만 | 표준 요금의 2배 |
| 컨텍스트 창 | 100만 토큰 | 1,050,000토큰(입력 최대 922,000) |
| 최대 출력 | 128K(Batches API는 베타 헤더로 300K까지) | 128,000 |
| 지식 기준 시점 | 2026년 6월 | 2026년 4월 20일 |
| 추론(생각) 기본값 | 적응형 · 항상 켜짐 · 기본 강도 medium | none · low · medium(기본) · high · xhigh · max |
| API 밖 제공처 | Amazon Bedrock, Claude Platform on AWS, Google Cloud, Microsoft Foundry | ChatGPT Work, Codex |
표에서 먼저 눈에 들어오는 줄은 두 개다. 입력 · 출력 단가는 정확히 두 배 차이가 나는데 캐시 읽기는 둘 다 $0.20으로 같다. 그리고 추론 줄이 다르다. GPT-6 Sol은 추론 강도를 none까지 내릴 수 있지만, Opus 5.5는 생각을 끌 수 없다. 이 두 줄이 뒤의 비용 계산과 API 이전에서 각각 다시 나온다.
토큰 단가는 Sol이 절반, 캐시 읽기는 같다
토큰 단가만으로 셈하면
입력 5만 토큰, 출력 5천 토큰짜리 요청 하나를 단가대로 셈하면 Opus 5.5는 입력 $0.20과 출력 $0.10을 더해 $0.30, GPT-6 Sol은 입력 $0.10과 출력 $0.05를 더해 $0.15다. 캐시를 쓰지 않는 한 토큰 단가만으로는 Sol이 딱 절반이다.
그런데 긴 시스템 프롬프트와 도구 정의를 매번 되풀이해 보내는 에이전트라면 사정이 달라진다. 입력의 대부분이 캐시에서 읽히면, 그 부분의 단가는 두 모델 모두 $0.20이다. 캐시 쓰기는 Sol이 $2.50, Opus 5.5가 5분 보관 $5로 두 배 차이가 그대로 남지만, 한 번 쓰고 여러 번 읽는 구조에서는 읽기 쪽 비중이 커진다. 이때 두 모델의 비용 차이는 주로 캐시에 들어가지 않는 새 입력과 출력에서 생긴다.
Sol은 긴 입력에 할증이 붙는다
OpenAI 모델 페이지에는 요금표 아래 조건이 하나 더 있다. 입력이 27만 2천 토큰을 넘는 요청은 그 요청 전체에 입력과 캐시 요금 2배, 출력 요금 1.5배를 매긴다. API 요금표의 긴 컨텍스트 칸도 입력 $4, 출력 $15로 적었다. 이 선을 넘는 순간 GPT-6 Sol의 입력 단가는 Opus 5.5의 표준 입력 단가와 같아진다. 코드 저장소 전체나 긴 문서 묶음을 한 번에 넣는 작업이라면 이 줄을 먼저 본다. Opus 5.5 쪽의 긴 입력 조건은 Anthropic 요금 페이지에서 따로 확인한다.
「작업당 비용」은 따로 잰다
토큰 단가는 절반의 이야기다. 같은 일을 끝내는 데 쓰는 토큰 수가 모델마다 다르기 때문이다. Anthropic의 대표 주장은 작업당 비용이다. 기본 설정에서 일반적인 작업량 기준으로 Opus 5.5가 Opus 5보다 40% 덜 든다고 적었다. 토큰 단가는 20% 내렸고, 과제당 쓰는 토큰이 줄어 합쳐서 40%가 된다는 설명이다. OpenAI는 GPT-6 Sol의 토큰 가격을 GPT-5.6 Sol의 프로모션 가격 대비 50% 내렸다고 적었고, 작업당 비용은 벤치마크마다 따로 밝혔다.
눈여겨볼 점은 두 주장의 기준이 모두 자기 회사의 이전 모델이라는 것이다. 40%와 50%를 나란히 놓고 어느 쪽이 더 싸졌는지 견주는 것은 의미가 없다. 내 작업에서 두 모델이 실제로 토큰을 얼마나 쓰는지는 같은 과제 몇 개를 양쪽에 돌려 사용량 기록을 비교하는 수밖에 없다.
벤치마크 — 겹치는 자리는 하나뿐
AutomationBench: 두 표가 같은 기준을 쓴 유일한 자리
여러 앱을 오가며 업무 흐름을 처리하는 능력을 재는 AutomationBench는 두 발표문에 모두 나온다. 그리고 두 표는 같은 모델 두 개에 같은 점수를 적었다. Claude Opus 5가 26.9%, Claude Fable 5.1이 31.4%다. 두 회사가 같은 순위표를 기준으로 삼았다고 볼 수 있는 근거가 여기 있어서, 이 벤치마크에서만큼은 두 표의 숫자를 한 줄에 놓아 볼 수 있다.
Anthropic 표에서 Opus 5.5는 40.0%다. OpenAI 발표문에서 GPT-6 Sol은 추론 강도 xhigh로 33.2%, 작업당 비용 $0.27이다. 숫자만 보면 Opus 5.5가 6.8%p 앞선다. 다만 조건이 셋 붙는다. Opus 5.5의 점수는 Zapier가 출시 전에 따로 돌린 평가에서 나왔고, 나머지는 공개 순위표 값이다. 또 Anthropic은 이 평가에 대체 모델을 두지 않아 안전장치가 개입한 과제를 실패로 셌다고 밝혔다. 그리고 Opus 5.5의 작업당 비용은 표에 없다. GPT-6 Sol(xhigh)이 이 벤치마크에서 Opus 5(max)보다 높은 점수를 Opus 5 작업당 비용의 9%로 냈다는 것이 OpenAI의 주장인데, 같은 비교를 Opus 5.5와 할 재료는 아직 없다.
OSWorld 2.0: 같은 이름, 다른 판
컴퓨터 사용 능력을 재는 OSWorld 2.0도 두 발표문에 다 있다. 그런데 여기서는 같은 모델이 전혀 다른 점수로 적혔다. Anthropic 표에서 Claude Opus 5는 74.0%인데, OpenAI 발표문에서는 추론 강도 medium의 Opus 5가 60.3%다. OpenAI는 v2026.08.08 판의 오프라인 세트에서 부분 점수를 쟀다고 밝혔고, Anthropic 표에는 부분 점수라는 표시만 붙어 있다. 판과 세트, 추론 강도가 다르면 같은 모델도 14%p 가까이 벌어진다.
그래서 Opus 5.5의 81.8%와 GPT-6 Sol의 60.5%를 한 줄에 놓으면 틀린 비교가 된다. OpenAI가 이 벤치마크에서 말한 것은 GPT-6 Sol(xhigh)이 Opus 5(medium)와 비슷한 점수를 약 80% 낮은 작업당 비용으로 냈다는 것까지다.
한쪽에만 있는 숫자들
나머지는 한쪽 표에만 있다. Anthropic 표에서 Opus 5.5는 에이전트 코딩 벤치마크 Terminal-Bench 4.0에서 66.4%(xhigh), 병합 가능한 코드를 재는 FrontierCode v1.1 Main에서 54.4%(max)로 표의 다섯 모델 가운데 가장 높다. 다만 과학 연구 과제를 재는 Terminal-Bench-Science 0.1(58.7% 대 64.6%)과 AutomationBench(40.0% 대 41.4%)에서는 GPT-6 Astra가 더 높다. GPT-6 Sol과 같은 가격대의 모델이 아니라 OpenAI의 최상위 모델과 겨룬 결과다.
OpenAI 발표문에서 GPT-6 Sol은 실제 코드베이스의 긴 소프트웨어 과제를 재는 DeepSWE v1.1에서 max 강도 68.8%로, Claude Fable 5의 최고 점수 69.9%(xhigh)에 1.1%p 모자란 점수를 작업당 비용 약 80% 낮게 냈다고 적었다. FrontierCode에서는 Claude Fable 5.1 xhigh와 비슷한 수준이라고만 적었고 본문에 숫자는 없다. 사실 정확도에서는 사용자가 오류를 지적했던 대화로 만든 내부 평가에서 GPT-5.6 Sol보다 실수가 절반 정도라고 밝혔는데, OpenAI 스스로 이 대화들이 평소 사용을 대표하지 않는다고 덧붙였다.
숫자보다 먼저 세 가지를 본다. 비교 대상이 같은 가격대의 모델인가, 추론 강도가 몇으로 맞춰졌는가, 그리고 경쟁사 모델 점수를 누가 쟀는가. 두 발표문 모두 경쟁사 점수는 공개 보고에서 가져왔다고 적었다.
API로 옮길 때 걸리는 곳
Opus 5.5: 이전 코드가 400 오류를 받는 네 자리
Anthropic 문서는 Opus 5에서 돌던 코드에 영향을 주는 호환성 변경 네 가지를 적었다. 모델 ID만 바꿔 끼우면 아래 자리에서 요청이 400 오류로 돌아온다.
- 생각을 끌 수 없다.
thinking을disabled로 보내거나budget_tokens로 예산을 정해 보내면 거절된다.{"type": "adaptive"}로 보내거나 필드를 뺀다. - 도구 강제 호출이 안 된다.
tool_choice의any와 특정 도구 지정이 거절되고,auto와none만 된다. 「반드시 이 함수를 불러라」에 기대던 구조화 출력 코드가 여기에 걸린다. - 생각 블록이 모델과 대화에 묶인다. 시스템 프롬프트나 도구, 앞선 메시지가 바뀐 뒤에 예전 생각 블록을 다시 보내면 거절된다. 2026년 8월 31일 이후 만든 계정에 기본으로 적용된다.
- 예전 컴퓨터 사용 도구 판이 거절된다.
computer_20251124대신computer_toolset_20260801을 쓴다(Claude API와 Google Cloud 기준).
기본 추론 강도가 Opus 5의 high에서 medium으로 내려간 것도 알아 둔다. 같은 코드가 더 짧게 생각하고 답할 수 있다.
GPT-6 Sol: 추론과 함수 호출을 같이 쓰려면 Responses API
GPT-6 Sol은 추론 강도를 여섯 단계로 고르고 기본은 medium이다. 걸리는 자리는 하나다. OpenAI 모델 페이지는 Chat Completions에서 함수 호출이 추론 강도 none일 때만 된다고 적었다. 예전 Chat Completions 코드로 도구를 부르면서 추론도 켜고 싶다면 Responses API로 옮겨야 한다. Realtime, Assistants, 파인튜닝도 이 모델에서는 지원하지 않는다.
모델 ID만 바꾼 요청을 테스트 환경에서 한 번씩 보내 본다. Opus 5.5는 thinking과 tool_choice 필드를, GPT-6 Sol은 어느 엔드포인트로 도구를 부르는지를 먼저 본다. Opus 5.5의 네 변경은 모두 요청 단계에서 400 오류로 드러나는 종류라 한 번 돌려 보면 찾는다.
보안 · 생물 작업은 다른 모델이 받는다
Opus 5.5에서 꼭 알아 둘 변화가 하나 더 있다. Anthropic은 Opus 5.5가 사이버 보안과 생물 분야에서 Claude Mythos 5.1에 견줄 만한 능력이 있어, 사이버 보안 · 생물 · 추출(distillation) 세 분야에 안전장치를 붙여 내놓았다고 밝혔다. 안전장치가 개입하면 요청은 오류 없이 다른 모델로 넘어간다. 사이버 보안 과제는 대부분 Opus 4.8이 받는다. 보안 업무를 하는 조직을 위한 사이버 검증 프로그램(Cyber Verification Program)은 Opus 5.5로 넓혀 세 단계로 운영한다고 했다.
보안 도구를 만들거나 취약점 분석을 자주 맡기는 사람이라면, Opus 5.5를 골랐는데 실제 답은 Opus 4.8이 한 것일 수 있다는 뜻이다. Anthropic은 벤치마크 표에서도 이 대체가 일어난 과제는 Opus 4.8과 Opus 5가 풀었고, 그 때문에 Opus 5.5의 점수가 낮게 나왔을 수 있다고 적었다.
또 하나, Opus 5.5는 Fable 5.1에서 처음 쓴 「보존된 생각(preserved thinking)」을 달고 나왔다. API 사용자가 앞선 대화 내용을 고쳐서 모델의 추론을 뽑아내는 것을 막는 장치로, 앞 절의 「생각 블록이 대화에 묶인다」는 변경과 같은 뿌리다. GPT-6 Sol 쪽은 GPT-5.6 Sol보다 정렬 평가 결과가 나아졌고, 특히 자기 코딩 작업에 대해 사실과 다르게 말하는 비율이 줄었다고 OpenAI가 밝혔다.
어디서 쓸 수 있나
API가 아니라 채팅 앱에서 쓰려는 경우다. GPT-6 Sol은 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 열렸다. OpenAI는 이 모델들이 아직 일반 채팅(Chat)에는 들어가지 않았다고 적었다. 무료와 Go 사용자는 데스크톱 앱에서 하위 모델 GPT-6 Luna를 쓸 수 있다.
Opus 5.5 발표문은 claude.ai의 어느 요금제에 열렸는지를 모델 이름으로 적지 않았다. Claude 요금 페이지의 Opus 줄은 무료 요금제 「아니오」, Pro · Max · Team · Enterprise 「예」다. 발표문에는 Pro, Max, Team, 좌석형 Enterprise의 5시간 사용 한도를 늘린다는 문장이 함께 있다. 하위 모델 Claude Sonnet 5.5와 Haiku 5.5는 몇 주 안에 따라 나온다고 했다.
무엇으로 가르나
두 모델을 한 줄로 줄 세울 근거는 공식 자료 안에 없다. 대신 일의 모양에 따라 먼저 써 볼 쪽은 비교적 분명하게 갈린다.
| 이런 일이라면 | 먼저 써 볼 쪽 | 근거 |
|---|---|---|
| 요청이 많고 새 입력 · 출력 비중이 큰 일 | GPT-6 Sol | 입력 · 출력 단가가 절반 |
| 생각이 필요 없는 짧은 분류 · 추출 | GPT-6 Sol | 추론 강도를 none까지 내릴 수 있다 |
| 한 요청에 27만 토큰 넘게 넣는 일 | 둘 다 따져 본다 | Sol은 이 선을 넘으면 요청 전체에 할증 |
| 여러 단계를 스스로 도는 에이전트 코딩 | Claude Opus 5.5 | Anthropic 표의 Terminal-Bench 4.0 · FrontierCode에서 다섯 모델 중 최고. 단 GPT-6 Sol과 직접 잰 값은 없음 |
| 여러 앱을 오가는 업무 자동화 | Claude Opus 5.5를 먼저, 비용은 따로 잰다 | AutomationBench 40.0% 대 33.2%. Opus 5.5 작업당 비용은 미공개 |
| 반드시 특정 함수를 부르게 해야 하는 코드 | GPT-6 Sol | Opus 5.5는 도구 강제 호출 불가 |
| 보안 분석 · 취약점 작업 | 조건 확인 뒤 | Opus 5.5는 대부분 Opus 4.8로 넘어간다 |
이 표는 출발점일 뿐이다. 발표문의 벤치마크는 각 회사가 고른 과제에서 각 회사가 고른 설정으로 잰 값이고, 내 일의 과제와는 다르다. 두 모델 모두 API로 몇 달러 안에서 시험해 볼 수 있으니, 실제로 맡길 과제 열 개 정도를 양쪽에 똑같이 돌려 결과와 사용량 기록을 나란히 놓고 고르는 것이 가장 확실하다. 이때 추론 강도를 같은 이름(medium끼리)으로 맞추고, 캐시를 쓰는 구조라면 두 번째 요청부터 잰다.
자주 묻는 것
Opus 5.5와 GPT-6 Sol 중 어느 쪽이 더 똑똑한가요?
공식 자료로는 답할 수 없다. 두 모델은 2026년 9월 22일 같은 날 나왔고, Anthropic 발표문은 GPT-6 Sol을, OpenAI 발표문은 Opus 5.5를 비교 대상에 넣지 않았다. 두 표가 같은 기준을 쓴 것이 확인되는 AutomationBench에서는 Opus 5.5가 40.0%, GPT-6 Sol(xhigh)이 33.2%지만, Opus 5.5 점수는 출시 전 별도 평가에서 나온 값이고 작업당 비용은 공개되지 않았다.
Opus 5.5와 GPT-6 Sol의 API 가격은 얼마인가요?
100만 토큰당 Claude Opus 5.5는 입력 $4, 출력 $20, GPT-6 Sol은 입력 $2, 출력 $10이다. 캐시 읽기는 둘 다 $0.20으로 같다. GPT-6 Sol은 입력이 27만 2천 토큰을 넘는 요청에 요청 전체 기준으로 입력 2배, 출력 1.5배를 매긴다. 2026년 9월 23일 두 회사 공식 요금표 기준이다.
Opus 5로 쓰던 코드를 그대로 Opus 5.5로 바꿔도 되나요?
안 되는 자리가 있다. Opus 5.5는 생각을 끌 수 없어서 thinking을 disabled나 budget_tokens로 보내면 400 오류가 나고, tool_choice의 any와 특정 도구 지정도 지원하지 않는다. 생각 블록은 모델과 대화에 묶이고, 예전 컴퓨터 사용 도구 판(computer_20251124)은 Claude API와 Google Cloud에서 거절된다.
GPT-6 Sol에서 함수 호출이 안 돼요.
OpenAI 모델 페이지는 GPT-6 Sol이 Chat Completions에서 추론 강도를 none으로 둘 때만 함수 호출을 지원한다고 적었다. 추론을 켠 채로 도구를 부르려면 Responses API를 쓴다.
무료로 써 볼 수 있나요?
GPT-6 Sol은 ChatGPT Work와 Codex에서 Plus 이상 유료 요금제에 열렸고, 무료와 Go 사용자는 데스크톱 앱에서 GPT-6 Luna를 쓸 수 있다. Claude 요금 페이지의 Opus 줄은 무료 요금제에서 「아니오」다. 두 모델 모두 API는 쓴 만큼 낸다.
참고 자료
- Anthropic. Introducing Claude Opus 5.5 (2026-09-22) — 가격, 벤치마크 표와 각주, Opus 5 대비 비용 주장, 안전장치와 대체 모델, 보존된 생각, 제공처. anthropic.com
- Anthropic. What's new in Claude Opus 5.5 — 호환성 변경 네 가지, 캐시 · 배치 · 빠른 모드 요금, 기본 추론 강도. platform.claude.com
- Anthropic. Models overview — 모델 ID, 컨텍스트 창, 최대 출력, 지식 기준 시점, 제공 플랫폼. platform.claude.com
- Anthropic. Claude 요금 — 요금제별 Opus 제공 여부, 캐시 요금. claude.com
- OpenAI. Introducing GPT-6 Sol and Luna — 가격 인하, AutomationBench · DeepSWE · OSWorld 2.0 · FrontierCode 비교, 사실 정확도 평가, 제공 범위. openai.com
- OpenAI. GPT-6 Sol 모델 페이지 — 모델 ID, 컨텍스트 창과 최대 입력 · 출력, 추론 강도, 함수 호출 조건, 긴 입력 할증. developers.openai.com
- OpenAI. API Pricing — 표준 · 긴 컨텍스트 · Batch · Flex · 빠른 모드 요금. developers.openai.com