Claude Opus 5로 추정되는 ‘Honeycomb EAP’가 Cursor 모델 목록에 잠시 등장하면서 출시설이 다시 커지고 있다. 확인된 화면 정보부터 추정 사양, Fable 5 벤치마크와 예상 위치까지 사실과 루머를 나눠 정리했다.
현재까지 확인된 내용과 추정 구분
내용판단근거
| Honeycomb EAP가 Cursor에 등장 | 비교적 신뢰도 높음 | 복수의 화면 캡처와 사용자 보고 |
| Anthropic 연구 모델로 표시 | 화면에서 확인 | Cursor 모델 설명 |
| 100만 토큰 컨텍스트 | 화면에서 확인 | 모델 선택기 표시 |
| Extra High 추론 모드 | 화면에서 확인 | 모델 선택기 표시 |
| Honeycomb이 Claude Opus 5 | 확정 아님 | 커뮤니티 추정 |
| 2026년 7월 출시 | 확정 아님 | 이전 EAP 사례에 기반한 예상 |
| Opus 5 공식 벤치마크 점수 | 공개되지 않음 | 모델 카드·공식 문서 없음 |
| Fable 5보다 빠르거나 저렴함 | 추정 | 제품 등급상 가능성만 제기 |
| Fable 5보다 성능이 높음 | 근거 부족 | Fable은 Opus보다 상위 등급 |
가장 중요한 점은 Honeycomb EAP의 존재와 Honeycomb이 Opus 5라는 주장은 서로 다른 단계의 정보라는 것이다.
Honeycomb이라는 모델이 Cursor에 표시된 정황은 확인되지만, Anthropic은 아직 이를 Claude Opus 5라고 발표하지 않았다. 따라서 현재는 ‘Opus 5 확정 유출’보다는 ‘Opus 5 후보로 추정되는 연구 모델 등장’이라고 표현하는 편이 정확하다. (Hacker News)
Honeycomb EAP는 어디서 발견됐나
2026년 7월 8~9일 무렵 일부 사용자의 Cursor 모델 선택기에 Claude Honeycomb EAP라는 이름이 등장했다.
공개된 화면에서는 다음과 같은 설명을 확인할 수 있었다.
- Anthropic 연구 모델
- Early Access Preview
- 요청별 제어 기능
- 안전 관련 폴백
- 100만 토큰 컨텍스트
- Extra High Effort
- 장시간 실행 프리뷰 설정
해당 항목은 오래 유지되지 않고 모델 목록에서 사라졌다. Cursor 공식 포럼과 Hacker News, X 등에 화면과 목격담이 올라왔지만 Cursor와 Anthropic 모두 Honeycomb의 정체를 공식적으로 설명하지 않았다. (Hacker News)
EAP는 일반적으로 ‘Early Access Program’ 또는 ‘Early Access Preview’를 뜻한다. 정식 출시 전 제한된 사용자에게 제공하는 테스트 단계로 볼 수 있지만, EAP에 등장한 모델이 반드시 같은 이름으로 출시되는 것은 아니다.
Honeycomb이 Opus 5로 추정되는 이유
Opus 계열만 5세대로 넘어가지 않았다
2026년 7월 23일 기준 Anthropic의 공개 모델에는 Fable 5와 Sonnet 5가 있지만, Opus 계열은 Opus 4.8이 최신이다.
Anthropic 공식 모델 문서와 Google Cloud용 Claude 모델 목록에도 다음 모델만 표시된다.
- Claude Fable 5
- Claude Sonnet 5
- Claude Opus 4.8
- Claude Opus 4.7
- Claude Opus 4.6
- Claude Opus 4.5
- Claude Haiku 4.5
claude-opus-5라는 공식 API 모델 ID는 확인되지 않는다. 이 빈자리를 이유로 커뮤니티에서는 Honeycomb을 Opus 5의 테스트 버전으로 보고 있다. (Claude Platform Docs)
다만 세대 번호의 빈자리만으로 모델명을 확정할 수는 없다. 과거 테스트용 코드명이 예상과 다른 정식 모델명으로 출시된 사례도 있기 때문이다.
Opus 4.8로 연결되는 안전 폴백
Honeycomb EAP 설명에는 안전 관련 폴백이 포함된 것으로 알려졌다. 일부 공개 화면과 분석에서는 특정 요청이 감지되면 Opus 4.8로 전환되는 구조가 언급됐다. (vallettasoftware.com)
이 구조가 실제라면 Honeycomb은 Opus 4.8보다 새로운 모델일 가능성이 있다. 구형 모델을 테스트하면서 최신 Opus로 폴백하는 것보다, 더 강한 실험 모델이 안전 문제 발생 시 검증된 모델로 요청을 넘기는 구조가 자연스럽기 때문이다.
하지만 이것 역시 Honeycomb이 Opus 4.8보다 강할 가능성을 보여줄 뿐, 정식 명칭이 Opus 5라는 증거는 아니다.
Fable 5도 고위험 사이버보안이나 생물학 요청으로 분류되면 Opus 4.8로 연결될 수 있다. Anthropic은 Fable 5에 별도의 안전 분류기를 적용하며, 차단된 요청이 Opus 4.8로 전환될 수 있다고 공식적으로 설명한다. (Anthropic)
따라서 Honeycomb은 Opus 5가 아니라 다음과 같은 모델일 수도 있다.
- 새로운 Fable 계열 실험 모델
- 안전 필터를 시험하는 연구 모델
- Opus 4.9
- Opus 5 프리뷰
- 정식 출시되지 않는 내부 평가 모델
100만 토큰 컨텍스트는 강력한 증거일까
Honeycomb EAP 화면에 표시된 100만 토큰 컨텍스트는 현재 Anthropic의 최상위 모델 흐름과 일치한다.
Fable 5, Opus 4.8, Sonnet 5는 이미 100만 토큰 컨텍스트를 지원한다. Fable 5는 최대 12만8천 토큰 출력과 항상 활성화되는 적응형 사고 기능도 제공한다. (Claude Platform Docs)
따라서 Honeycomb의 100만 토큰 표시는 새로운 모델이라는 정황은 될 수 있어도, Opus 5만의 특징은 아니다.
오히려 눈여겨볼 부분은 Extra High Effort다. Opus 4.8의 기본 추론 노력은 High이며, Honeycomb에는 그보다 높은 단계로 보이는 설정이 표시됐다. 실제 동작 방식과 토큰 사용량은 공개되지 않았지만, 장시간 코딩이나 복잡한 에이전트 작업을 겨냥한 모델일 가능성을 높이는 요소다. (Claude Platform Docs)
Opus 5 벤치마크 점수는 공개됐나
현재 신뢰할 수 있는 Claude Opus 5 또는 Honeycomb 공식 벤치마크 점수는 없다.
벤치마크Opus 5·Honeycomb 점수
| SWE-bench Verified | 공개되지 않음 |
| SWE-bench Pro | 공개되지 않음 |
| Terminal-Bench 2.1 | 공개되지 않음 |
| OSWorld-Verified | 공개되지 않음 |
| Humanity’s Last Exam | 공개되지 않음 |
| GPQA Diamond | 공개되지 않음 |
| BrowseComp | 공개되지 않음 |
| CursorBench | 공개되지 않음 |
| FrontierSWE | 공개되지 않음 |
| GDPval·지식 업무 평가 | 공개되지 않음 |
SNS나 일부 블로그에서 Opus 5의 점수라고 소개하는 숫자가 보이더라도 출처를 확인해야 한다.
Anthropic 공식 모델 카드, 공식 발표 페이지, API 문서에 없는 점수라면 다음 중 하나일 가능성이 크다.
- Fable 5 점수를 Opus 5 점수로 잘못 표기
- Opus 4.8 점수를 Opus 5로 오인
- 비공개 테스트 결과라고 주장하는 검증 불가능한 수치
- 예상 점수를 실제 측정값처럼 표현
- 다른 에이전트 하네스 결과를 모델 단독 성능으로 표시
특히 SWE-bench는 같은 모델이라도 도구, 프롬프트, 반복 횟수와 에이전트 환경에 따라 결과가 달라진다. 모델 이름과 점수만 적힌 표는 신뢰하기 어렵다.
Fable 5 벤치마크를 기준점으로 보면
Opus 5의 실제 점수는 없지만, 현재 Anthropic의 공개 최상위 모델인 Fable 5를 기준점으로 예상 위치를 살펴볼 수는 있다.
공개된 Fable 5 자료에서 자주 인용되는 주요 수치는 다음과 같다.
벤치마크Fable 5 공개 점수평가 영역
| SWE-bench Verified | 약 95.0% | 실제 저장소 버그 수정 |
| SWE-bench Pro | 약 80.3% | 고난도 소프트웨어 엔지니어링 |
| OSWorld-Verified | 약 85.0% | 컴퓨터 화면·도구 조작 |
| Humanity’s Last Exam, 도구 사용 | 약 64.5% | 전문지식·추론·검색 |
| Terminal-Bench 계열 | 평가 환경별 차이 큼 | 터미널 기반 작업 수행 |
Anthropic은 Fable 5를 일반 공개 모델 중 가장 강력한 모델로 소개하며, Opus보다 위에 있는 Mythos 등급으로 분류한다. Fable 5는 장시간 코딩, 대규모 마이그레이션, 복잡한 구현, 여러 날에 걸친 자율 작업을 주요 용도로 삼는다. (Anthropic)
여기서 주의할 점은 Fable 5가 단순히 ‘Opus 5보다 먼저 나온 모델’이 아니라, Anthropic의 공식 설명상 Opus 클래스보다 상위에 위치하는 모델이라는 사실이다. (Anthropic)
따라서 Opus 5가 출시되더라도 Fable 5를 전체적으로 넘어설 것이라고 단정하기 어렵다.
Opus 5와 Fable 5의 예상 관계
현재 모델 등급을 그대로 유지한다면 예상 구조는 다음과 같다.
예상 비교 항목Claude Opus 5Claude Fable 5
| 모델 등급 | Opus급 | Mythos급 |
| 정식 공개 여부 | 미공개 | 공개 |
| 주요 목적 | 고성능 범용·코딩·에이전트 | 최고난도 장기 에이전트 |
| 컨텍스트 | 100만 토큰 추정 | 100만 토큰 |
| 추론 설정 | Extra High 가능성 | 항상 활성화되는 적응형 사고 |
| 가격 | 미공개 | 입력 10달러·출력 50달러 |
| 안전 폴백 | Opus 4.8 가능성 | Opus 4.8 |
| 성능 위치 | Opus 4.8 이상 추정 | 일반 공개 Claude 최상위 |
| 공식 벤치마크 | 없음 | 공개 |
| Claude Code 용도 | 일상 고난도 작업 가능성 | 장시간 최고난도 프로젝트 |
Fable 5는 API 기준 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다. Opus 4.8은 각각 5달러와 25달러이므로 정확히 절반이다. (Claude Platform Docs)
Opus 5가 기존 Opus 가격대를 유지한다면 Fable 5보다 저렴하면서 성능 차이를 줄이는 역할을 맡을 가능성이 있다. 하지만 가격 정책은 전혀 공개되지 않았기 때문에 이는 제품 구성에 기반한 예상일 뿐이다.
예상 성능은 어느 정도일까
공식 점수가 없는 상태에서 구체적인 숫자를 예상하는 것은 위험하다. 다만 모델 계층을 기준으로 보면 다음 조건을 만족해야 Opus 5라는 이름이 설득력을 얻는다.
SWE-bench Pro
Opus 5라면 최소한 Opus 4.8보다 의미 있는 상승이 필요하다. Fable 5가 약 80% 수준으로 알려진 만큼, Opus 5가 Fable을 넘지 않으면서도 가까워지는 구도가 자연스럽다.
하지만 현재 “Opus 5가 SWE-bench Pro에서 몇 점”이라는 식의 수치는 모두 확인되지 않았다.
SWE-bench Verified
Verified는 상위 모델 사이의 점수 차이가 좁아져 변별력이 줄어드는 경향이 있다. Opus 5가 출시되더라도 이미 높은 수준에 도달한 이 평가에서는 체감 차이가 작게 나타날 수 있다.
실제 개발 성능을 보려면 SWE-bench Pro, Terminal-Bench, FrontierSWE와 장시간 에이전트 평가를 함께 확인해야 한다.
Terminal-Bench
Honeycomb의 Extra High Effort와 장시간 실행 옵션이 사실이라면 Terminal-Bench 계열에서 강점을 보일 가능성이 있다.
다만 높은 추론 수준은 비용과 응답 시간도 늘릴 수 있다. 단순 성공률뿐 아니라 다음 항목을 함께 봐야 한다.
- 과제당 평균 비용
- 평균 실행 시간
- 도구 호출 횟수
- 실패 후 복구율
- 불필요한 파일 수정 비율
- 테스트 통과 여부
- 안전 폴백 발생률
OSWorld
100만 토큰 컨텍스트보다 화면 인식, 클릭 정확도, 상태 유지와 오류 복구가 중요한 평가다.
Opus 5가 범용 에이전트를 목표로 한다면 OSWorld 점수가 주요 발표 항목에 들어갈 가능성이 크다. 하지만 현재 Honeycomb의 화면 사용 성능을 보여주는 공개 테스트는 없다.
Fable 5보다 Opus 5가 나을 수 있는 부분
Fable 5가 상위 모델이더라도 모든 작업에서 무조건 유리한 것은 아니다.
비용 대비 성능
Opus 5가 Opus 4.8의 가격대를 유지한다면 Fable 5의 절반 수준 가격으로 제공될 수 있다. 성능이 Fable 5에 근접한다면 일반적인 Claude Code 작업에서는 Opus 5가 더 효율적일 수 있다.
낮은 안전 필터 개입 가능성
Fable 5는 사이버보안과 생물학 관련 강한 안전 분류기를 사용한다. Anthropic은 정상적인 코딩이나 디버깅 요청도 일부 잘못 감지될 수 있다고 설명한다. 감지된 요청은 Opus 4.8로 전환될 수 있다. (Anthropic)
Opus 5가 기존 Opus 정책을 유지한다면 보안 코드 분석, 네트워크 디버깅, 바이오 소프트웨어 작업에서 Fable 5보다 일관적인 사용 경험을 제공할 가능성이 있다.
일반 개발 작업의 속도
Fable 5는 여러 날에 걸친 복잡한 작업을 목표로 한다. 작은 버그 수정이나 짧은 코드 리뷰에서는 높은 추론 비용이 오히려 비효율적일 수 있다.
Opus 5가 속도와 성능의 균형을 강화한다면 Claude Code의 기본 고성능 모델로 자리 잡을 수 있다.
Honeycomb 출시가 임박했다는 주장은 믿을 만할까
Fable 5가 정식 출시되기 전에도 Cursor에 EAP 형태로 등장했다는 주장이 있어, Honeycomb 역시 수 주 안에 공개될 것이라는 예상이 나오고 있다. 일부 분석은 2026년 7월 말 또는 8월 초를 예상한다. (vallettasoftware.com)
그러나 이것은 한 번의 과거 사례를 적용한 추정이다.
EAP 모델은 다음과 같이 처리될 수 있다.
- 수일 또는 수주 뒤 정식 출시
- 이름을 바꿔 출시
- 기존 모델 업데이트에 기능만 반영
- 제한된 파트너에게만 제공
- 테스트 후 완전히 취소
따라서 “Cursor에 등장했으니 2주 뒤 출시”라는 공식은 성립하지 않는다.
2026년 7월 23일 기준 Anthropic 뉴스룸에는 Fable 5, Sonnet 5, Opus 4.8 발표만 있으며 Opus 5나 Honeycomb 발표는 확인되지 않는다. 공식 Claude API와 Google Cloud 모델 목록에도 해당 모델 ID가 없다. (Anthropic)
출시되면 확인해야 할 벤치마크
Opus 5가 실제 공개될 경우 첫 발표 숫자만 보기보다 다음 항목을 함께 확인하는 편이 좋다.
코딩 성능
- SWE-bench Verified
- SWE-bench Pro
- SWE-bench Multilingual
- FrontierSWE
- FrontierCode
- Terminal-Bench 2.1
- CursorBench
에이전트·도구 사용
- OSWorld-Verified
- BrowseComp
- DeepSearchQA
- AutomationBench
- 장시간 작업 성공률
- 도구 호출 실패 복구율
추론·전문지식
- Humanity’s Last Exam
- GPQA Diamond
- 수학 경시대회 평가
- 과학 연구 평가
- 차트·문서 분석 평가
실제 사용 조건
- 입력·출력 토큰 가격
- 캐시 가격
- 최대 출력 길이
- Extra High 사용 시 추가 비용
- Claude Code 구독 포함 여부
- API·Bedrock·Vertex AI 지원 여부
- 데이터 보존 조건
- 안전 필터와 폴백 정책
같은 벤치마크라도 추론 노력 설정이 High인지 Extra High인지에 따라 결과와 비용이 달라질 수 있다. 반드시 점수 옆에 적용된 설정과 평가 하네스를 확인해야 한다.
현재 가장 현실적인 결론
Honeycomb EAP라는 미공개 Anthropic 모델이 Cursor에 잠시 나타난 정황은 비교적 분명하다. 100만 토큰 컨텍스트, Extra High Effort, 안전 폴백과 장시간 실행 관련 옵션도 화면을 통해 보고됐다. (vallettasoftware.com)
하지만 다음 내용은 아직 확정되지 않았다.
- Honeycomb이 Claude Opus 5라는 주장
- 정식 출시일
- API 모델 ID
- 가격
- Claude Code 제공 범위
- Opus 5 벤치마크 점수
- Fable 5와의 실제 성능 차이
- 100만 토큰 외 세부 사양
현재 공개 정보만 놓고 보면 Honeycomb은 Opus 5일 가능성이 있는 Anthropic 연구 모델이다. 가장 그럴듯한 시나리오는 Opus 4.8보다 강하고 Fable 5보다 저렴한 고성능 모델이지만, Anthropic이 모델 카드와 공식 명칭을 공개하기 전까지는 예상에 머문다.
짧은 마무리
Claude Opus 5 출시설은 단순한 SNS 글보다 한 단계 구체적인 근거를 확보했다. 실제 제품인 Cursor의 모델 목록에 Honeycomb EAP가 표시됐기 때문이다.
그렇다고 Honeycomb을 곧바로 Opus 5라고 확정할 수는 없다. 현재 믿을 수 있는 정보는 100만 토큰 컨텍스트와 Extra High Effort 표시 정도이며, 성능 점수와 가격은 전혀 공개되지 않았다. 벤치마크 숫자가 등장한다면 Anthropic 공식 모델 카드인지부터 확인해야 한다.
'[IT] 이야기 > [AI] 이야기' 카테고리의 다른 글
| Cursor vs Codex vs Claude Code, 모델을 빼고 IDE만 비교하면 승자는? (0) | 2026.07.24 |
|---|---|
| 클로드 코드 Opus 5 유출 정보 정리: Honeycomb 코드명부터 출시일 루머까지 (0) | 2026.07.24 |
| ChatGPT Work 100% 활용 방법: 자료 조사부터 문서 완성까지 맡기는 실전 가이드 (0) | 2026.07.23 |
| ChatGPT Codex GPT-5.6 Luna·Terra·Sol 코딩 심층 비교: 프론트엔드부터 제품 완성도까지 (0) | 2026.07.23 |
| Kimi K3 벤치마크 분석, GPT-5.6·Claude Fable 5에 도전장을 내밀다 (0) | 2026.07.21 |
댓글