Claude Opus 5.5가 2026년 9월 22일 공개됐다. Claude Code를 자주 쓴다면 특히 눈여겨볼 업데이트다. 가격은 Opus 5보다 낮아졌고 속도는 빨라졌으며, 코딩 벤치마크에서는 GPT-6 Astra와 직접 비교할 만한 결과도 나왔다.
핵심 변화부터 정리
Claude Opus 5.5는 Anthropic의 새로운 Claude 5.5 계열 첫 모델이다.
단순히 성능만 높인 모델은 아니다. API 토큰 가격을 20% 낮추고, 캐시 읽기 가격은 60% 낮추면서 출력 속도는 Opus 5보다 30% 이상 높였다.
Anthropic은 기본 설정의 일반적인 워크로드에서 실제 작업 비용이 Opus 5보다 약 40% 낮아졌다고 설명한다.
항목Claude Opus 5.5Claude Opus 5
| 입력 100만 토큰 | $4 | $5 |
| 출력 100만 토큰 | $20 | $25 |
| 캐시 읽기 | $0.20 | $0.50 |
| 캐시 쓰기 | $5 | $6.25 |
| 출력 속도 | Opus 5 대비 30%+ 향상 | 기준 |
| 일반 작업 비용 | 약 40% 절감 | 기준 |
※ 2026년 9월 23일 Anthropic 공식 발표 기준.
특히 Claude Code처럼 같은 코드베이스와 컨텍스트를 반복적으로 참조하는 에이전트 작업에서는 캐시 읽기 가격이 $0.50에서 $0.20으로 내려간 부분이 중요하다.
Claude Opus 5.5는 어떤 모델인가
Anthropic은 Opus 5.5를 Claude 5.5 제품군의 첫 번째 모델이자 새로운 주력 모델로 공개했다.
방향은 꽤 명확하다.
긴 시간 동안 이어지는 복잡한 작업, 에이전트 코딩, 컴퓨터 사용, 지식 작업을 더 적은 토큰과 비용으로 처리하는 것이다.
Anthropic에 따르면 Opus 5.5는 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 제공하면서 Opus 5보다 일반적인 실행 비용을 약 40% 낮췄다.
API 모델명은 다음과 같다.
claude-opus-5-5
Claude Platform뿐 아니라 AWS, Google Cloud, Microsoft Azure에서도 제공된다.
Claude Code에서 Opus 5.5가 중요한 이유
Opus 5.5의 변화가 가장 직접적으로 체감될 가능성이 높은 곳이 Claude Code다.
Claude Code는 단순히 코드 한두 줄을 생성하는 방식보다 프로젝트 전체를 읽고, 여러 파일을 수정하고, 터미널 명령을 실행하면서 긴 작업을 이어가는 형태에 가깝다.
이런 작업에서는 모델의 벤치마크 점수뿐 아니라 세 가지가 중요하다.
- 작업을 끝까지 완료할 수 있는가
- 몇 번의 도구 호출과 수정으로 끝내는가
- 전체 과정에서 토큰을 얼마나 사용하는가
Opus 5.5는 이 세 부분을 동시에 개선하는 방향으로 설계됐다.
Anthropic이 소개한 초기 테스트 사례 중에는 20만 줄 규모 코드베이스를 3시간 이내에 감사하고 수정한 사례도 있다. 같은 작업에서 Opus 5는 20시간 이상 걸렸으며 2.5배 많은 토큰을 사용했다고 한다.
또 다른 초기 테스트에서는 68만 줄 규모 코드 마이그레이션을 하루 이내에 완료한 사례도 공개됐다.
다만 이런 사례는 Anthropic이 공개한 초기 사용자 사례이므로 독립적인 표준 벤치마크 결과와는 구분해서 볼 필요가 있다.
Claude Opus 5.5 토큰 가격
API 가격은 이번 업데이트에서 상당히 중요한 부분이다.
가격 항목Opus 5.5Opus 5변화
| 입력 1M 토큰 | $4 | $5 | 20%↓ |
| 출력 1M 토큰 | $20 | $25 | 20%↓ |
| Cache Read 1M | $0.20 | $0.50 | 60%↓ |
| Cache Write 1M | $5 | $6.25 | 20%↓ |
예를 들어 캐시를 제외하고 입력 1억 토큰과 출력 2천만 토큰을 사용한다고 단순 계산해보면 다음과 같다.
Opus 5.5
입력:
$4 × 100 = $400
출력:
$20 × 20 = $400
합계는 $800이다.
Opus 5
입력:
$5 × 100 = $500
출력:
$25 × 20 = $500
합계는 $1,000이다.
같은 토큰 양이라면 기본 토큰 단가만으로 20% 차이가 난다.
하지만 Anthropic이 말하는 실제 작업 비용 감소폭은 약 40%다. 단순 단가뿐 아니라 Opus 5.5가 동일 작업을 완료하는 데 사용하는 토큰과 호출 횟수가 감소했기 때문이다.
Fast Mode도 추가됐다
속도가 더 중요하다면 Claude Code와 Claude Platform에서 Opus 5.5 Fast mode를 사용할 수 있다.
Anthropic은 최대 2.5배 빠른 속도를 제시한다.
대신 가격도 올라간다.
Opus 5.5 모드입력 1M출력 1M
| 일반 | $4 | $20 |
| Fast mode | $8 | $40 |
Fast mode는 정확히 두 배의 토큰 단가를 지불하고 응답 속도를 최대 2.5배까지 높이는 구조다.
따라서 모든 Claude Code 작업에서 Fast mode를 켜기보다는 개발자가 결과를 기다리는 시간이 직접적인 비용이 되는 작업에서 효율을 따져볼 필요가 있다.
코딩 벤치마크 비교
이번 발표에서 가장 눈에 띄는 부분은 에이전트 코딩 성능이다.
Anthropic이 공개한 주요 결과를 정리하면 다음과 같다.
벤치마크Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 Main | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | - | 41.7% |
| GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
여기서 주의할 점이 있다.
위 표는 Anthropic 공식 발표에 정리된 결과이며 일부 GPT 모델 수치는 OpenAI가 발표한 결과를 Anthropic이 인용했다.
따라서 모든 모델이 완전히 동일한 추론 설정과 실행 환경에서 한 번에 테스트된 결과라고 단순 해석하면 안 된다.
그래도 Claude Code 사용자가 관심을 가질 만한 변화는 분명하다.
Terminal-Bench 4.0
Terminal-Bench 4.0은 터미널 환경에서 복잡한 다단계 작업을 얼마나 잘 수행하는지를 평가한다.
Anthropic이 공개한 표에서는:
Opus 5.5: 66.4%
Opus 5: 52.3%
GPT-6 Astra: 57.9%
GPT-5.6 Sol: 37.3%
를 기록했다.
Anthropic은 기본 effort의 Opus 5.5가 최대 effort의 Opus 5보다 높은 성능을 내면서 작업 비용은 약 5분의 1 수준이라고 설명한다.
GPT-6 Astra와 비교해서도 비슷한 수준의 작업 성능을 약 40% 수준의 비용으로 달성한다고 설명하고 있다.
FrontierCode v1.1
FrontierCode는 에이전트가 실제 코드베이스에서 만든 변경사항이 실제로 병합될 수준인지를 평가하는 데 초점을 둔다.
Anthropic이 별도로 공개한 default effort, 즉 Medium 설정 결과에서는 Opus 5.5가 **54.6%**를 기록했다.
GPT-6 Astra의 공개 최고 점수는 **53.3%**다.
Anthropic은 이 조건에서 Opus 5.5가 GPT-6 Astra의 공개 점수보다 높은 결과를 약 5분의 1 수준의 작업당 비용으로 달성했다고 설명한다.
단, 회사별 벤치마크 설정과 추론 effort가 다를 수 있으므로 1.3%포인트 차이만으로 두 모델 전체의 우열을 판단하는 것은 적절하지 않다.
CursorBench 4.0
CursorBench는 실제 Cursor 사용 세션에서 가져온 모호하고 여러 파일에 걸친 코딩 작업을 평가한다.
Anthropic 발표에서 Medium effort Opus 5.5는 **52.5%**를 기록했다.
비교 대상으로 공개된 결과는:
Fable 5.1 Max: 51.8%
Opus 5 Max: 46.6%
GPT-5.6 Sol 최고 결과: 41.7%
다.
Anthropic은 Opus 5.5가 GPT-5.6 Sol보다 약 11%포인트 높은 점수를 내면서 작업당 비용은 약 3분의 1이라고 설명한다.
GPT-6 Astra와 비교하면?
2026년 9월 기준 최고급 코딩 모델을 비교할 때 Opus 5.5와 GPT-6 Astra는 상당히 흥미로운 조합이다.
API 기본 토큰 가격부터 차이가 크다.
항목Claude Opus 5.5GPT-6 Astra
| 입력 1M 토큰 | $4 | $10 |
| 출력 1M 토큰 | $20 | $50 |
| 기본 가격 비율 | 기준 | 약 2.5배 |
| 포지션 | 고성능 코딩·에이전트 | GPT-6 최상위 |
토큰 단가만 보면 GPT-6 Astra가 Opus 5.5보다 입력과 출력 모두 약 2.5배 비싸다.
그런데 일부 코딩 벤치에서는 Opus 5.5가 Astra와 비슷하거나 더 높은 공개 결과를 기록했다.
반대로 AutomationBench에서는 Astra가 41.4%, Opus 5.5가 40.0%로 Astra가 조금 높다.
결국 벤치 하나만 가지고 두 모델 전체를 판단하기보다 내가 실제로 사용하는 코드베이스와 작업 유형으로 직접 평가하는 것이 중요해졌다.
GPT-6 Sol과 가격을 비교하면?
GPT-6 Sol까지 넣으면 이야기가 조금 달라진다.
모델입력 1M출력 1M
| GPT-6 Sol | $2 | $10 |
| Claude Opus 5.5 | $4 | $20 |
| GPT-6 Astra | $10 | $50 |
기본 토큰 단가만 보면 GPT-6 Sol이 가장 저렴하다.
Opus 5.5는 GPT-6 Sol의 정확히 2배, GPT-6 Astra는 Opus 5.5의 2.5배 수준이다.
따라서 모델 선택은 단순 가격표만 보는 것보다 작업 완료율 × 사용 토큰 × 작업 시간을 함께 계산해야 한다.
비싼 모델이 적은 시행착오로 한 번에 작업을 끝낸다면 실제 작업 비용은 낮아질 수 있고, 반대로 토큰 가격이 저렴하더라도 반복 수정이 많으면 전체 비용이 올라갈 수 있다.
Opus 5.5가 이번 발표에서 강조하는 것도 바로 이 부분이다.
1M 컨텍스트가 Claude Code에서 의미하는 것
Opus 5.5는 최대 100만 토큰 컨텍스트를 지원한다.
Claude Code에서 대형 프로젝트를 다룬다면 단순 숫자 이상의 의미가 있다.
큰 코드베이스에서는 여러 파일과 문서, 테스트 결과, 기존 대화 내용을 동시에 참고해야 한다.
컨텍스트가 충분하지 않으면 이전 정보를 압축하거나 버려야 하고, 이 과정에서 모델이 이미 확인했던 내용을 다시 읽거나 앞선 판단을 놓칠 가능성이 생긴다.
반대로 긴 컨텍스트를 무조건 많이 사용하는 것도 비용 측면에서는 좋은 전략이 아니다.
그래서 Opus 5.5의 1M 컨텍스트와 함께 $0.20/1M 토큰까지 낮아진 Cache Read 가격을 같이 보는 것이 중요하다.
Opus 5에서 가장 크게 달라진 부분
숫자를 정리하면 변화가 더 명확하다.
가격
입력 $5 → $4
출력 $25 → $20
Cache Read $0.50 → $0.20
속도
Opus 5 대비 출력 속도 30% 이상 향상
Fast mode 사용 시 최대 2.5배 속도
코딩
Terminal-Bench 4.0:
52.3% → 66.4%
FrontierCode v1.1:
48.0% → 54.4%
CursorBench 4.0:
46.6% → 57.8%
단순히 'Opus 5보다 조금 좋아진 5.5'로 보기에는 변화 폭이 크다.
특히 가격을 낮추면서 에이전트 코딩 성능을 높였다는 점이 이번 세대의 핵심이다.
Claude Code 사용자는 무엇을 봐야 할까
Claude Code를 실제 개발에 사용한다면 벤치마크 1~2점보다 아래 항목을 확인하는 편이 현실적이다.
첫째, 대규모 코드 수정 횟수다.
한 번의 지시로 여러 파일을 일관성 있게 수정할 수 있는지가 중요하다.
둘째, 반복 작업이다.
테스트 실패 → 수정 → 다시 테스트하는 과정이 얼마나 줄어드는지 확인해야 한다.
셋째, 토큰 사용량이다.
Opus 5.5의 토큰 단가는 Opus 5보다 20% 낮지만 Anthropic이 주장하는 실제 작업 비용 감소는 약 40%다.
모델이 작업 자체를 더 효율적으로 끝내기 때문이다.
넷째, Fast mode의 가치다.
개인 프로젝트에서는 일반 모드가 경제적일 수 있다. 반대로 개발자의 대기 시간이 비용으로 연결되는 팀 환경이라면 Fast mode의 두 배 가격도 충분히 비교할 가치가 있다.
모든 벤치에서 Opus 5.5가 가장 높은 것은 아니다
Opus 5.5 발표에서 좋은 숫자만 보면 모든 작업에서 가장 강한 모델처럼 느껴질 수 있다.
실제로는 그렇지 않다.
AutomationBench에서는 GPT-6 Astra가 41.4%, Opus 5.5가 40.0%다.
벤치마크별 평가 대상도 다르고 reasoning effort와 에이전트 환경도 다르다.
Anthropic 역시 현재 수준의 모델에서는 작은 벤치마크 점수 차이가 실제 사용 경험의 차이를 정확하게 보여주는 지표가 되기 어려워지고 있다고 설명한다.
따라서 Opus 5.5의 의미는 '모든 벤치마크 1위'가 아니라 높은 에이전트 코딩 성능을 이전보다 훨씬 낮은 비용으로 제공한다는 것에 가깝다.
Claude Opus 5.5를 사용할 수 있는 곳
2026년 9월 23일 기준 Opus 5.5는 다음 환경에서 제공된다.
- Claude
- Claude Code
- Claude Platform/API
- Amazon Web Services
- Google Cloud
- Microsoft Azure
API에서는 다음 모델명을 사용한다.
claude-opus-5-5
Claude Code와 Claude Platform에서는 최대 2.5배 빠른 Fast mode도 사용할 수 있다.
또 Anthropic은 Pro, Max, Team 요금제의 5시간 사용량 제한을 확대했다고 밝혔다.
짧은 마무리
Claude Opus 5.5에서 가장 눈에 띄는 변화는 단순한 벤치마크 상승이 아니다.
입력 $4, 출력 $20, 캐시 읽기 $0.20이라는 가격에 에이전트 코딩 성능을 크게 끌어올렸다는 점이 핵심이다.
특히 Claude Code 사용자에게는 캐시 비용 감소, 30% 이상 빨라진 출력, Fast mode, 장시간 코딩 작업 효율 개선이 직접적인 변화다.
GPT-6 Astra와 비교하면 기본 토큰 가격은 상당히 낮으면서 일부 코딩 벤치마크에서는 비슷하거나 더 높은 공개 결과도 나왔다. 반면 GPT-6 Sol은 Opus 5.5보다 다시 절반 수준의 기본 토큰 가격을 갖는다.
결국 2026년 하반기 코딩 모델 경쟁은 단순히 '누가 벤치마크 1위인가'보다 하나의 실제 개발 작업을 끝내는 데 얼마의 시간과 토큰이 필요한가로 비교하는 편이 더 현실적이다.
'[IT] 이야기 > [AI] 이야기' 카테고리의 다른 글
| GPT-6 Sol·Luna 벤치마크 분석, Astra·GPT-5.6·Claude와 비교하면 무엇이 달라졌나 (0) | 2026.09.23 |
|---|---|
| Meta Muse란? 기능·사용법·가격·한국 지원·보안까지 정리 (0) | 2026.09.23 |
| GPT-6 Sol 총정리: Astra·GPT-5.6 Sol·GPT-5.5 가격과 벤치마크 비교 (0) | 2026.09.23 |
| GPT-6 Astra Computer Use 꼭 써보세요, 챗봇과는 사용 방식이 다릅니다 (0) | 2026.09.08 |
| GPT-6 Astra 개발자 관점 정리|API 가격부터 105만 토큰 컨텍스트까지 (0) | 2026.09.08 |
댓글