2026년 7월 공개된 Kimi K3는 종합 지능과 에이전트 업무 벤치마크에서 GPT-5.6 Sol, Claude Fable 5 바로 아래까지 올라왔다. 주요 점수와 비용을 비교해 실제 경쟁력이 어느 정도인지 정리했다.
핵심 점수부터 비교
아래 수치는 2026년 7월 21일 확인 기준이며, 동일한 평가 기관인 Artificial Analysis 결과를 중심으로 비교했다. 벤치마크 점수는 실제 사용 환경과 완전히 같지는 않지만, 모델 간 상대적인 위치를 파악하는 데 유용하다.
모델Intelligence IndexGDPval-AA v2AA-Briefcase태스크당 비용
| Claude Fable 5 Max | 60점 | 1,760 Elo | 1,583 Elo | 2.75달러 |
| GPT-5.6 Sol Max | 59점 | 1,748 Elo | 1,495 Elo | 1.04달러 |
| Kimi K3 | 57점 | 1,668 Elo | 1,547 Elo | 0.94달러 |
| Claude Opus 4.8 Max | 56점 | 1,600 Elo | 공개 비교 자료 제한 | 1.80달러 |
| GPT-5.6 Terra Max | 55점 | 세부 점수 별도 확인 필요 | 세부 점수 별도 확인 필요 | 0.55달러 |
| GPT-5.6 Luna Max | 51점 | 세부 점수 별도 확인 필요 | 세부 점수 별도 확인 필요 | 0.21달러 |
종합 지능 점수만 보면 Claude Fable 5가 60점으로 1위, GPT-5.6 Sol이 59점으로 2위다. Kimi K3는 57점으로 3위에 올랐으며, Claude Opus 4.8의 56점을 앞섰다. 최고 모델과의 차이가 3점에 불과하다는 점이 Kimi K3가 주목받는 가장 큰 이유다. (Artificial Analysis)
Kimi K3는 어떤 모델인가
Moonshot AI는 Kimi K3를 2026년 7월 16일 공식 공개했다. 총 파라미터 규모는 2.8조 개이며, 약 100만 토큰의 컨텍스트 창과 이미지·텍스트 멀티모달 입력을 지원한다. (Artificial Analysis)
API 가격은 100만 토큰 기준으로 다음과 같다.
- 입력 토큰: 3달러
- 출력 토큰: 15달러
- 캐시 입력: 0.30달러
- Artificial Analysis 기준 태스크당 평균 비용: 0.94달러
Kimi K3는 처음부터 저가형 모델을 목표로 한 제품은 아니다. 이전 Kimi K2.6보다 가격이 높아졌지만, 상위권 성능을 내는 Claude Fable 5나 Claude Opus 4.8과 비교하면 비용 경쟁력은 여전히 강하다. (Artificial Analysis)
종합 지능에서는 Fable 5와 GPT-5.6 Sol이 우세
Artificial Analysis Intelligence Index에서 Kimi K3는 57점을 기록했다.
Claude Fable 5의 60점, GPT-5.6 Sol의 59점보다는 낮지만 Claude Opus 4.8의 56점과 GPT-5.6 Terra의 55점은 넘어섰다. Kimi K3를 최고 성능 모델이라고 부르기는 어렵지만, 프런티어 모델 바로 아래가 아니라 사실상 같은 경쟁 구간에 진입한 것으로 볼 수 있다. (Artificial Analysis)
순위모델Intelligence Index
| 1 | Claude Fable 5 Max | 60 |
| 2 | GPT-5.6 Sol Max | 59 |
| 3 | Kimi K3 | 57 |
| 4 | Claude Opus 4.8 Max | 56 |
| 5 | GPT-5.6 Terra Max | 55 |
| 6 | GPT-5.6 Luna Max | 51 |
다만 57점과 60점의 차이를 단순히 5% 정도의 성능 차이라고 해석하면 안 된다. 벤치마크 점수는 여러 추론·코딩·지식 평가를 합산한 지표이므로, 업무 종류에 따라 실제 체감 차이는 달라질 수 있다.
장기 업무에서는 GPT-5.6 Sol보다 앞선 결과도 있다
Kimi K3가 가장 인상적인 결과를 낸 분야는 장시간 이어지는 에이전트 업무와 지식 노동이다.
AA-Briefcase는 보고서, 분석 자료, 프레젠테이션처럼 여러 단계를 거쳐 결과물을 완성하는 능력을 평가한다. 이 항목에서 Kimi K3는 1,547 Elo를 기록해 Claude Fable 5의 1,583 Elo에 이어 2위에 올랐다.
GPT-5.6 Sol은 1,495 Elo로 Kimi K3보다 낮았다. 분석 품질 점수에서도 Kimi K3는 1,760 Elo, Claude Fable 5는 1,764 Elo로 사실상 비슷한 수준을 기록했다. (Artificial Analysis)
반대로 결과물의 시각적인 완성도와 프레젠테이션 품질에서는 GPT-5.6 Sol이 가장 높은 점수를 얻었다. 따라서 문서 분석과 장기 에이전트 업무에서는 Kimi K3가 강점을 보였지만, 파일 디자인과 최종 산출물 표현력까지 포함하면 GPT-5.6 Sol의 경쟁력이 여전히 높다. (Artificial Analysis)
코딩에서는 GPT-5.6 Sol이 선두
코딩 에이전트 벤치마크에서는 GPT-5.6 계열의 우위가 뚜렷하다.
Artificial Analysis Coding Agent Index에서 GPT-5.6 Sol은 80점으로 1위를 차지했다. GPT-5.6 Terra와 Claude Fable 5가 각각 77점으로 뒤를 이었고, GPT-5.6 Luna는 75점을 기록했다. (Artificial Analysis)
모델Coding Agent Index
| GPT-5.6 Sol | 80 |
| GPT-5.6 Terra | 77 |
| Claude Fable 5 | 77 |
| GPT-5.6 Luna | 75 |
| Kimi K3 | 종합 공개 수치 추가 확인 필요 |
Kimi K3 역시 코딩과 에이전트 작업을 주요 기능으로 내세우고 있지만, 현재 공개된 통합 코딩 지표만 보면 GPT-5.6 Sol을 넘어섰다고 말하기는 어렵다.
Kimi K3의 강점은 특정 프런트엔드 제작이나 자동화 작업에서 두드러진다. AutomationBench-AA에서는 53%를 기록하며 1위에 올랐다. 다만 특정 벤치마크 1위와 전체 코딩 능력 1위는 구분해서 봐야 한다. (Artificial Analysis)
GPT-5.6 Sol·Terra·Luna의 차이
GPT-5.6은 하나의 모델이 아니라 성능과 비용을 나눈 세 가지 등급으로 구성된다.
모델Intelligence Index태스크당 비용성격
| Sol | 59 | 1.04달러 | 최고 성능과 코딩 중심 |
| Terra | 55 | 0.55달러 | 중간 가격대 |
| Luna | 51 | 0.21달러 | 비용 효율 중심 |
Sol은 Claude Fable 5와 거의 같은 종합 점수를 내면서 태스크당 비용은 약 3분의 1 수준이다. Terra는 비용을 절반가량 낮춘 중간 모델이며, Luna는 성능보다 대량 처리와 비용 효율에 초점을 둔 구성이 분명하다. (Artificial Analysis)
흥미로운 점은 Artificial Analysis가 일부 성능·비용 구간에서 Terra보다 Sol 또는 Luna가 더 효율적이라고 분석했다는 것이다. 중간 등급이라고 해서 모든 상황에서 Terra가 가장 합리적인 선택은 아니라는 의미다.
Claude Fable 5와 Opus 4.8은 다른 모델이다
모델명을 정리할 때 주의할 부분이 있다. Claude Fable 5와 Claude Opus 4.8은 같은 모델이 아니다.
Fable 5는 Anthropic이 2026년 6월 공개한 상위 모델이며, 장기 추론과 복합적인 에이전트 업무, 비전 작업에 초점을 맞춘다. Opus 4.8은 이전 세대의 상위 모델로 비교표에서는 별도 항목으로 다뤄야 한다. (Anthropic)
현재 종합 점수는 Fable 5가 60점, Opus 4.8이 56점이다. 따라서 Kimi K3는 Opus 4.8을 넘어섰지만 Fable 5까지 추월한 것은 아니다.
Kimi K3가 던진 진짜 도전장
Kimi K3의 의미는 단순히 벤치마크 3위에 오른 데 있지 않다.
첫째, Claude Fable 5와 GPT-5.6 Sol이 형성한 최상위권과 점수 차이를 3점 이내로 좁혔다.
둘째, AA-Briefcase에서는 GPT-5.6 Sol보다 높은 결과를 기록해 장기 지식 업무에서 확실한 경쟁력을 보여줬다.
셋째, 태스크당 비용은 0.94달러로 Claude Fable 5의 2.75달러, Claude Opus 4.8의 1.80달러보다 낮다. 종합 성능과 비용을 함께 보면 기업용 에이전트와 대규모 자동화 환경에서 매력적인 선택지가 될 수 있다. (Artificial Analysis)
다만 Moonshot AI가 예고한 모델 가중치 공개는 확인 기준일 현재 계획 단계로 분류해야 한다. 실제 공개 범위와 라이선스가 확정되기 전까지 Kimi K3를 완전한 오픈소스 모델이라고 단정하는 것은 이르다. (Artificial Analysis)
짧은 마무리
Kimi K3는 Claude Fable 5와 GPT-5.6 Sol을 완전히 넘어선 모델은 아니다. 종합 성능과 코딩에서는 두 모델이 여전히 앞선다.
하지만 장기 지식 업무에서는 GPT-5.6 Sol을 앞섰고, Claude Opus 4.8보다 높은 종합 점수를 기록했다. 비용까지 고려하면 Kimi K3는 단순한 추격자가 아니라 상위 AI 모델 시장의 가격과 경쟁 구도를 흔들 수 있는 모델에 가깝다.
'[IT] 이야기 > [AI] 이야기' 카테고리의 다른 글
| ChatGPT Work 100% 활용 방법: 자료 조사부터 문서 완성까지 맡기는 실전 가이드 (0) | 2026.07.23 |
|---|---|
| ChatGPT Codex GPT-5.6 Luna·Terra·Sol 코딩 심층 비교: 프론트엔드부터 제품 완성도까지 (0) | 2026.07.23 |
| ChatGPT Codex Terra 모델을 Sol급에 가깝게 사용하는 설정과 프롬프트 (0) | 2026.07.20 |
| 챗GPT 활용법, 질문만 잘해도 결과가 달라진다 (0) | 2026.07.18 |
| Codex 10분 마스터: 처음 써볼 때 꼭 봐야 할 중요 기능 (0) | 2026.07.15 |
댓글