본문 바로가기
[IT] 이야기/[AI] 이야기

GPT-6 Sol·Luna 벤치마크 분석, Astra·GPT-5.6·Claude와 비교하면 무엇이 달라졌나

by 헤이나우
반응형

 

OpenAI가 2026년 9월 공개한 GPT-6 Sol과 GPT-6 Luna는 단순한 성능 상승보다 성능 대비 비용 효율에 초점이 맞춰져 있다. 공개 벤치마크와 API 가격을 함께 보면 Sol·Luna가 각각 어떤 작업에 초점을 둔 모델인지 더 분명하게 드러난다. (OpenAI)

아래 비교 이미지는 OpenAI가 공개한 자료를 바탕으로 여러 모델의 점수와 작업당 비용을 한 표로 정리한 이미지다. 다만 일부 수치는 OpenAI 공식 페이지의 현재 표기와 차이가 있어, 이 글에서는 2026년 9월 23일 확인한 OpenAI 공식 자료를 우선 기준으로 분석했다.

[여기에 사용자가 첨부한 GPT-6 Sol & Luna benchmark comparison 이미지 삽입]

이 표에서 먼저 봐야 할 핵심

구분GPT-6 SolGPT-6 LunaGPT-6 Astra

API 입력 가격 $2 / 100만 토큰 $0.10 / 100만 토큰 $10 / 100만 토큰
API 출력 가격 $10 / 100만 토큰 $0.50 / 100만 토큰 $50 / 100만 토큰
포지션 성능·비용 균형 초저비용·대량 처리 최고 성능 중심
AutomationBench 33.2% 20.7%* 41.4%
Agents' Last Exam 56.4% 50.9% 59.3%
DeepSWE 1.1 68.8% 66.6% 74.1%

*이미지에 표시된 수치 기준. 벤치마크는 effort level에 따라 결과와 작업당 비용이 달라질 수 있다.

API 가격은 2026년 9월 23일 OpenAI 공식 자료 기준이다. GPT-6 Sol은 입력 $2·출력 $10, GPT-6 Luna는 입력 $0.10·출력 $0.50이며, OpenAI는 이를 GPT-5.6 프로모션 가격보다 50% 낮춘 가격이라고 설명한다. (OpenAI)

이 이미지의 핵심은 '최고 점수'보다 비용 대비 성능이다

표만 보면 가장 진한 색으로 표시된 셀에 시선이 먼저 간다. 하지만 GPT-6 Sol과 Luna를 분석할 때는 단순히 각 행에서 누가 1등인지 보는 것보다 그 점수를 얻는 데 얼마가 들었는지를 함께 봐야 한다.

GPT-6 Astra는 여전히 상위 성능을 목표로 한 모델이다. OpenAI 역시 Astra를 가장 높은 성능을 제공하는 GPT-6 모델로 설명하고 있다. 반면 Sol과 Luna는 Astra에서 발전시킨 기술을 더 빠르고 저렴한 형태로 확장하는 역할을 맡는다. (OpenAI)

즉 GPT-6 제품군은 대략 다음과 같은 구조로 이해하는 편이 자연스럽다.

Astra → 최대 성능
Sol → 높은 성능과 비용의 균형
Luna → 낮은 비용으로 대량 처리

특히 Luna의 가격 구조를 보면 이런 방향이 상당히 명확하다.

GPT-6 Sol, 실제 변화는 어디서 보이나

GPT-6 Sol에서 눈에 띄는 부분 중 하나가 비즈니스 에이전트 작업이다.

AutomationBench 1.0.6에서 GPT-6 Sol은 xhigh effort 기준 **33.2%**를 기록했다. OpenAI가 공개한 비교에서는 Claude Opus 5 max의 26.9%보다 높은 점수였고, 작업당 비용은 Sol이 $0.27, Opus 5가 $3.05로 표시됐다. (OpenAI)

여기서 중요한 것은 단순한 33.2%라는 숫자가 아니다.

에이전트가 반복적으로 업무를 수행하는 환경에서는 모델 호출이 한두 번으로 끝나지 않는다. 도구 호출, 판단, 수정, 재시도 등이 반복되기 때문에 작업당 비용 차이가 실제 운영비 차이로 확대될 수 있다.

그래서 Sol의 포지션은 최고 점수만 노리는 모델이라기보다, 상당히 높은 수준의 추론 능력을 반복해서 사용할 수 있도록 비용 구조를 낮춘 모델에 가깝다.

전문 업무에서는 Astra와의 격차도 크지 않다

Agents' Last Exam V1은 장시간 이어지는 복잡한 전문 업무를 평가하는 벤치마크다.

첨부된 비교표에서는 다음과 같이 나타난다.

  • GPT-6 Astra: 59.3%
  • GPT-6 Sol: 56.4%
  • Claude Opus 5: 55.9%
  • GPT-5.6 Sol: 53.6%
  • GPT-6 Luna: 50.9%

OpenAI 공식 발표에서도 GPT-6 Sol의 max effort 점수를 56.4%로 제시하고 있다. (OpenAI)

Astra와 Sol의 점수 차이는 2.9%포인트다. 물론 하나의 벤치마크만으로 두 모델의 전체 성능 차이를 2.9%라고 해석하면 안 된다. 평가 항목과 effort 설정에 따라 결과가 달라지기 때문이다.

다만 전문적인 에이전트 작업에서도 Sol이 상위 모델과 비교할 만한 수준을 목표로 설계됐다는 점은 확인할 수 있다.

Luna는 점수보다 가격을 같이 봐야 한다

GPT-6 Luna는 이 표를 단순 점수 순으로 읽으면 상대적으로 눈에 띄지 않을 수 있다.

하지만 API 가격을 붙이면 이야기가 달라진다.

2026년 9월 23일 기준 GPT-6 Luna의 표준 API 가격은 입력 100만 토큰당 $0.10, 출력 100만 토큰당 $0.50이다. GPT-6 Sol의 $2/$10과 비교하면 토큰 단가 차이가 20배다. (OpenAI Developers)

그런데 DeepSWE 1.1에서는 OpenAI 공식 자료 기준 Luna max가 66.6%, Sol max가 68.8%를 기록했다. (OpenAI)

벤치마크 점수 차이는 2.2%포인트지만 API 기본 토큰 가격에는 큰 차이가 있다.

물론 여기서도 주의할 부분이 있다. API 토큰 가격 차이를 그대로 벤치마크 작업당 비용 차이라고 보면 안 된다. 모델별 추론량과 effort 설정, 실제 소비 토큰이 다르기 때문이다.

그럼에도 대량 자동화, 반복적인 코드 처리, 데이터 전처리처럼 호출 횟수가 많은 환경에서는 Luna의 낮은 단가가 상당히 중요한 변수가 될 수 있다.

코딩에서는 GPT-6 Astra가 여전히 강하다

첨부 이미지의 DeepSWE 1.1 결과에서는 GPT-6 Astra가 **74.1%**로 표시된다.

같은 표에서 주요 모델은 다음과 같다.

모델DeepSWE 1.1

GPT-6 Astra 74.1%
Claude Opus 5 73.7%
GPT-5.6 Sol 72.7%
Claude Fable 5.1 69.9%
GPT-6 Sol 68.8%
GPT-6 Luna 66.6%

흥미로운 부분은 GPT-6 Sol이 모든 코딩 벤치마크에서 이전 세대보다 무조건 높은 것은 아니라는 점이다.

DeepSWE만 보면 첨부 이미지에서 GPT-5.6 Sol이 GPT-6 Sol보다 높은 점수를 기록한다. 반면 FrontierCode에서는 GPT-6 Sol이 GPT-5.6 Sol보다 개선된 결과를 보였다고 OpenAI는 설명한다. (OpenAI)

따라서 "GPT-6이 나왔으니 모든 코딩 작업에서 GPT-5.6보다 높다"는 식으로 해석하는 것은 적절하지 않다.

벤치마크가 무엇을 측정하는지까지 함께 봐야 한다.

사실성은 숫자를 반대로 읽어야 한다

첨부 이미지에서 가장 헷갈리기 쉬운 항목이 Factuality다.

여기서는 숫자가 높을수록 좋은 것이 아니라 사실 오류가 포함된 답변 비율이 낮을수록 좋다.

이미지 기준으로는 다음과 같다.

  • GPT-6 Astra: 3.9%
  • GPT-6 Sol: 4.5%
  • GPT-6 Luna: 7.6%
  • GPT-5.6 Sol: 8.4%
  • GPT-5.6 Luna: 12.0%

따라서 이 항목에서는 Astra의 오류율이 가장 낮고 Sol이 그 뒤를 따른다.

OpenAI 역시 GPT-6 Sol이 이전 세대보다 사실 오류를 크게 줄였다고 설명한다. 다만 이 평가는 일반적인 모든 ChatGPT 대화를 그대로 대표하는 수치가 아니다. 사용자가 이전 모델의 사실 오류를 신고했던 비식별 대화를 기반으로 만든 내부 평가라는 점도 같이 봐야 한다. (OpenAI)

이 조건을 빼고 "GPT-6 Sol의 답변 중 4.5%는 틀린다"고 해석하면 벤치마크의 의미가 완전히 달라진다.

벤치마크 표를 볼 때 조심해야 할 부분

이 이미지는 여러 모델의 특징을 빠르게 비교하기에는 유용하지만, 몇 가지 한계가 있다.

첫째, 모델마다 effort level이 동일하지 않다. max, high, xhigh 등 서로 다른 설정에서 얻은 최고 점수가 섞여 있다.

둘째, 작업당 비용도 동일한 조건의 고정 가격이 아니다. 모델이 사용한 토큰과 추론량에 영향을 받는다.

셋째, OpenAI가 공개한 경쟁 모델 비교치는 공개된 외부 보고 자료를 사용한 경우가 있으며, 일부 모델은 완전히 동일한 평가 조건이 아닐 수 있다. OpenAI도 생산 환경의 ChatGPT와 연구 환경/API 평가 결과가 시스템 프롬프트와 사용 가능한 도구 차이 때문에 달라질 수 있다고 명시한다. (OpenAI)

마지막으로 첨부 이미지의 일부 수치는 현재 OpenAI 공식 페이지에서 확인되는 수치와 차이가 있다. 예를 들어 OSWorld 관련 값은 공식 페이지의 세부 조건과 이미지 표기가 완전히 일치하지 않는 부분이 확인된다. 따라서 이 이미지는 전체적인 비교 구조를 이해하는 참고 자료로 활용하고, 특정 벤치마크 수치를 인용할 때는 OpenAI 원문을 다시 확인하는 편이 안전하다. (OpenAI)

GPT-6 Sol과 Luna의 의미는 '더 싸진 프런티어 모델'

이번 발표에서 눈여겨볼 변화는 단순히 벤치마크 점수가 몇 % 올랐느냐가 아니다.

GPT-6 Sol은 높은 수준의 전문 작업과 에이전트 성능을 유지하면서 API 비용을 낮추는 방향이고, Luna는 그보다 훨씬 낮은 단가로 반복 작업을 처리하는 방향이 뚜렷하다. 반대로 최대 성능이 필요한 영역에는 Astra가 별도로 자리 잡고 있다.

결국 GPT-6 세대에서 중요한 질문은 "어떤 모델이 무조건 가장 좋은가?"가 아니라 "내 작업에 필요한 성능을 어느 비용에서 확보할 것인가?"에 더 가깝다.

벤치마크 점수와 함께 effort level, 작업당 비용, API 단가, 실제 사용 목적을 같이 봐야 이 표를 제대로 읽을 수 있다.

반응형

댓글