API 토큰 가격
항목Claude Opus 5GPT-5.6 Sol차이
| 입력 100만 토큰 | 5달러 | 5달러 | 동일 |
| 캐시 입력 100만 토큰 | 0.50달러 | 0.50달러 | 동일 |
| 5분 캐시 쓰기 | 6.25달러 | 6.25달러 | 동일 |
| 출력 100만 토큰 | 25달러 | 30달러 | Opus 5가 5달러 저렴 |
| 출력 가격 차이 | 기준 | 20% 비쌈 | Opus 기준 |
| 컨텍스트 길이 | 100만 토큰 | 105만 토큰 | GPT가 5만 토큰 큼 |
| 최대 출력 | 12만 8,000토큰 | 12만 8,000토큰 | 동일 |
| 장문 입력 할증 | 100만 토큰까지 기본 단가 | 27만 2,000토큰 초과 시 할증 | Opus 5 유리 |
Claude Opus 5는 입력 100만 토큰당 5달러, 출력 25달러다. GPT-5.6 Sol은 입력 가격은 같지만 출력이 30달러로 20% 비싸다. 캐시 입력은 둘 다 0.50달러다. (Claude Platform Docs)
GPT-5.6 Sol은 한 요청의 입력이 27만 2,000토큰을 넘으면 해당 요청 전체에 입력 2배, 출력 1.5배 가격이 적용된다. 이 구간에서는 입력이 100만 토큰당 10달러, 출력은 45달러가 되는 셈이다. 반면 Opus 5는 100만 토큰 컨텍스트 전체를 기본 단가로 처리한다. (Claude Platform Docs)
코딩 벤치마크 점수 차이
문제는 Anthropic이 Opus 5 발표 자료에서 GPT-5.6과 직접 비교할 수 있는 공통 벤치마크 점수를 충분히 공개하지 않았다는 점이다.
OpenAI 공식 발표에는 GPT-5.6과 Claude Opus 4.8, Claude Fable 5를 같은 표에서 평가한 결과가 있다. 하지만 Claude Opus 5 점수는 해당 표에 없다. 따라서 아래 수치를 Opus 5와의 직접 대결로 해석하면 안 된다.
코딩 평가GPT-5.6 SolClaude Fable 5Claude Opus 4.8Sol과 Opus 4.8 차이
| Artificial Analysis Coding Agent Index 1.1 | 80.0 | 77.2 | 72.5 | +7.5점 |
| SWE-Bench Pro | 64.6% | 80.0% | 69.2% | -4.6%p |
| DeepSWE 1.1 | 72.7% | 69.7% | 59.0% | +13.7%p |
| Terminal-Bench 2.1 | 88.8% | 83.1% | 78.9% | +9.9%p |
점수만 놓고 보면 GPT-5.6 Sol은 Opus 4.8보다 Coding Agent Index, DeepSWE, Terminal-Bench에서 앞선다. SWE-Bench Pro에서는 Opus 4.8보다 4.6%포인트 낮고, Fable 5보다 15.4%포인트 낮다. (OpenAI)
평가별 수치 차이
- Coding Agent Index: Sol 80.0, Opus 4.8 72.5
Sol이 절대 점수 7.5점, 상대적으로 약 10.3% 높다. - Terminal-Bench 2.1: Sol 88.8%, Opus 4.8 78.9%
Sol이 9.9%포인트 높다. - DeepSWE 1.1: Sol 72.7%, Opus 4.8 59.0%
Sol이 13.7%포인트 높다. - SWE-Bench Pro: Sol 64.6%, Opus 4.8 69.2%
Sol이 4.6%포인트 낮다. - SWE-Bench Pro에서 Fable 5 비교: Sol 64.6%, Fable 5 80.0%
Sol이 15.4%포인트 낮다.
GPT-5.6이 모든 코딩 벤치에서 우위인 것은 아니다. 터미널 조작과 장기 엔지니어링에서는 강하지만, SWE-Bench Pro에서는 Anthropic 모델이 높은 점수를 기록했다. (OpenAI)
Opus 5의 정확한 점수는 아직 구분해서 봐야 한다
Anthropic 공식 문서는 Opus 5가 Opus 4.8보다 큰 폭으로 개선됐으며, 장시간 에이전트 코딩, 다중 파일 기능 개발, 대규모 리팩터링, 코드 리뷰와 버그 탐지 능력이 향상됐다고 설명한다. 하지만 문서에는 GPT-5.6 표와 바로 대조할 수 있는 Opus 5의 SWE-Bench Pro, DeepSWE, Terminal-Bench 2.1 점수가 제시되지 않았다. (Claude Platform)
Anthropic이 공개한 파트너 평가는 다음 수준이다.
- CursorBench에서 Fable 5 바로 아래 수준
- Cognition FrontierCode 1.1에서 Fable급 성능에 접근
- 복잡한 디버깅과 근본 원인 분석에서 강점
- Opus 4.8 대비 장시간 에이전트 작업 능력 향상
다만 구체적인 원점수가 공개되지 않아 GPT-5.6 Sol의 80점, 88.8% 같은 수치와 직접 계산할 수 없다. (Anthropic)
따라서 “Opus 5가 GPT-5.6보다 코딩 점수가 높다” 또는 그 반대로 단정할 근거는 아직 부족하다.
실제 토큰 비용 계산
입력 10만·출력 2만 토큰
모델입력 비용출력 비용합계
| Claude Opus 5 | 0.50달러 | 0.50달러 | 1.00달러 |
| GPT-5.6 Sol | 0.50달러 | 0.60달러 | 1.10달러 |
동일한 토큰을 사용하면 Opus 5가 약 9.1% 저렴하다.
입력 20만·출력 5만 토큰
모델입력 비용출력 비용합계
| Claude Opus 5 | 1.00달러 | 1.25달러 | 2.25달러 |
| GPT-5.6 Sol | 1.00달러 | 1.50달러 | 2.50달러 |
Opus 5가 작업당 0.25달러, 약 10% 저렴하다.
입력 30만·출력 5만 토큰
이 구간부터 GPT-5.6 Sol의 27만 2,000토큰 초과 할증이 적용된다.
모델적용 단가총비용
| Claude Opus 5 | 입력 5달러·출력 25달러 | 2.75달러 |
| GPT-5.6 Sol | 입력 10달러·출력 45달러 | 5.25달러 |
동일한 토큰 수라면 GPT-5.6 Sol이 2.50달러 더 비싸며, Opus 5보다 약 90.9% 높은 비용이 발생한다. 대형 저장소를 한 요청에 넣는 작업에서는 이 차이가 상당히 크다. (Claude Platform Docs)
입력 100만·출력 10만 토큰
모델총비용
| Claude Opus 5 | 7.50달러 |
| GPT-5.6 Sol | 14.50달러 |
계산은 다음과 같다.
- Opus 5: 입력 5달러 + 출력 2.50달러
- GPT-5.6 Sol: 할증 입력 10달러 + 할증 출력 4.50달러
긴 컨텍스트를 실제로 가득 사용하는 경우 GPT-5.6 Sol은 Opus 5보다 7달러, 약 93.3% 비싸다.
가격표만 보면 놓치는 토크나이저 차이
Claude 4.7 이후 모델은 새로운 토크나이저를 사용한다. Anthropic 문서에 따르면 같은 텍스트라도 이전 토크나이저보다 약 30% 많은 토큰이 생성될 수 있으며, 실제 증가는 코드와 언어에 따라 달라진다. Opus 5도 이 토크나이저를 사용한다. (Claude Platform Docs)
즉, 단가만 보면 Opus 5의 출력이 25달러이고 GPT-5.6 Sol이 30달러라 Opus가 저렴하다. 하지만 동일한 코드를 처리할 때 Opus 5에서 토큰 수가 더 많이 계산된다면 일부 가격 차이가 줄어들 수 있다.
가령 GPT-5.6이 출력 10만 토큰을 사용할 때 Opus 5가 동일 작업에 12만 토큰을 쓴다고 가정하면 다음과 같다.
- Opus 5: 12만 × 25달러/100만 = 3달러
- GPT-5.6 Sol: 10만 × 30달러/100만 = 3달러
이 경우 명목 단가는 Opus 5가 낮아도 실제 출력 비용은 같아진다. 따라서 반드시 API 사용 내역에서 모델별 실측 토큰을 확인해야 한다.
벤치마크와 비용을 함께 해석하면
GPT-5.6 Sol이 강하게 나온 부분
GPT-5.6 Sol은 Terminal-Bench 2.1에서 88.8%, DeepSWE에서 72.7%, Coding Agent Index에서 80점을 기록했다. 터미널 명령 실행, 도구 조합, 장시간 코드베이스 작업에서는 공개 점수가 강하다. (OpenAI)
OpenAI는 Coding Agent Index에서 GPT-5.6 Sol이 Fable 5보다 2.8점 높으면서 출력 토큰은 절반 미만, 실행 시간은 절반 미만, 추정 비용은 약 3분의 1 낮았다고 밝혔다. 이 수치는 동일 평가 내 비용·토큰 비교라는 점에서 단순 API 단가보다 의미가 크다. (OpenAI)
Claude 계열이 강하게 나온 부분
SWE-Bench Pro에서는 GPT-5.6 Sol이 64.6%, Opus 4.8이 69.2%, Fable 5가 80.0%다. 실제 저장소 이슈 해결 평가에서는 Anthropic 모델이 더 높은 점수를 보였다. (OpenAI)
Opus 5의 공통 평가 점수는 공개 자료가 부족하지만, Anthropic은 Opus 4.8보다 장시간 코딩과 근본 원인 분석이 크게 개선됐다고 밝히고 있다. 따라서 Opus 4.8 점수를 Opus 5의 성능으로 그대로 사용해서도 안 된다. (Claude Platform)
결론
현재 공개 수치로 확인되는 결과는 다음과 같다.
판단 항목유리한 모델
| 기본 입력 단가 | 동일 |
| 기본 출력 단가 | Claude Opus 5 |
| 27만 2,000토큰 이상 요청 | Claude Opus 5 |
| Coding Agent Index 공개 점수 | GPT-5.6 Sol |
| Terminal-Bench 공개 점수 | GPT-5.6 Sol |
| DeepSWE 공개 점수 | GPT-5.6 Sol |
| SWE-Bench Pro 계열 | Claude 계열 |
| Opus 5와 Sol의 완전한 직접 비교 | 아직 판단 불가 |
짧거나 중간 규모의 코딩 요청에서는 Opus 5가 명목상 약 9~10% 저렴하다. 27만 2,000토큰을 넘는 대규모 요청에서는 GPT-5.6 할증 때문에 Opus 5의 비용 우위가 크게 벌어진다.
반면 현재 공개된 수치형 코딩 벤치마크에서는 GPT-5.6 Sol이 Terminal-Bench와 DeepSWE에서 강하다. Opus 5의 동일 벤치 점수가 충분히 공개되지 않았으므로, 현시점에서 가장 정확한 표현은 “GPT-5.6은 공개 코딩 점수가 강하고, Opus 5는 기본 출력 단가와 대규모 컨텍스트 비용이 유리하다”이다.
'[IT] 이야기 > [AI] 이야기' 카테고리의 다른 글
| 바이브 코딩 툴 비교: Cursor·Claude Code·Codex·Lovable·Kimi Code 핵심 차이 (0) | 2026.07.27 |
|---|---|
| 클로드 코드 오퍼스 5 출시, 달라진 기능과 가격·성능 정리 (0) | 2026.07.25 |
| GPT-5.6 가성비 순위 분석: Codex Value Radar 표를 제대로 읽는 방법 (0) | 2026.07.24 |
| Cursor vs Codex vs Claude Code, 모델을 빼고 IDE만 비교하면 승자는? (0) | 2026.07.24 |
| 클로드 코드 Opus 5 유출 정보 정리: Honeycomb 코드명부터 출시일 루머까지 (0) | 2026.07.24 |
댓글