본문 바로가기
[IT] 이야기/[AI] 이야기

GPT-5.6 가성비 순위 분석: Codex Value Radar 표를 제대로 읽는 방법

by 헤이나우
반응형

Codex Value Radar 이미지는 GPT-5.6 모델별 IQ 점수와 평균 실행 비용을 조합해 가성비 순위를 보여준다. 다만 공식 벤치마크가 아닌 제3자 평가이므로 점수 계산 방식과 실제 작업 적합성을 함께 확인해야 한다.

이미지에서 먼저 확인할 핵심

  • 평가 모델 수: 19개
  • 가성비 1위: GPT-5.6 Luna max
  • 가장 높은 IQ 점수: 103.1%
  • 최고 IQ/$: 83.8
  • 가성비 계산 계수: α = 3.72
  • 데이터 업데이트 시각: 2026년 7월 22일 13시 58분
  • 표시된 모드: Price Only
  • 주의할 점: Codex Value Radar의 IQ와 평균 가격은 OpenAI가 발표한 공식 평가 지표가 아니다.

OpenAI 공식 자료에 따르면 GPT-5.6은 Sol, Terra, Luna 세 가지 등급으로 구성된다. Sol은 최상위 성능, Terra는 성능과 비용의 균형, Luna는 속도와 비용 효율을 중시하는 모델이다. 이미지에 나온 모델명 자체는 공식 GPT-5.6 제품군과 일치하지만, IQ 점수·평균 가격·종합 점수는 해당 사이트가 별도로 계산한 평가값이다. (OpenAI)

Codex Value Radar는 무엇을 비교하는 표인가

이 이미지는 단순한 성능 순위표가 아니다. 모델이 얻은 IQ 점수에서 사용 비용에 따른 감점을 적용해, 일정한 품질을 얼마나 저렴하게 확보할 수 있는지를 비교한다.

상단에는 다음 계산식이 표시돼 있다.

Score = IQ − 3.72 × Avg Price

즉, IQ 점수가 높아도 평균 비용이 크게 올라가면 최종 Score가 낮아질 수 있다. 반대로 절대 성능은 조금 낮더라도 비용이 충분히 저렴하면 가성비 순위에서 앞설 수 있다.

이미지에 적힌 설명대로 해석하면 비용이 1달러 증가할 때 IQ 점수가 약 3.7점 이상 높아져야 비용 증가를 상쇄할 수 있다.

예를 들어 GPT-5.6 Luna max의 계산값은 다음과 같다.

95.1 − 3.72 × 2.51
= 95.1 − 9.3372
= 약 85.8

표에 표시된 Score 85.7과 거의 일치한다. 소수점 처리나 원본 데이터의 정밀도 차이로 약간의 오차가 생긴 것으로 볼 수 있다.

표에 표시된 항목의 의미

항목의미읽을 때 주의할 점

IQ Score 사이트가 측정하거나 환산한 상대 성능 공식 OpenAI 성능 점수가 아님
Avg Price 평가 작업을 수행하는 데 사용된 평균 비용 공식 토큰 단가와 직접 비교하면 안 됨
Score IQ에서 비용 패널티를 뺀 종합 가성비 점수 계수 α 설정에 따라 순위가 달라짐
Rating Score 구간을 등급으로 표현 Supreme, Excellent 등의 자체 분류
IQ/$ 비용 1달러당 얻은 IQ 점수 저렴한 모델에 유리한 지표
Status 비용 효율 상태 Caution, Inefficient의 구체적 기준은 이미지에서 확인되지 않음

특히 Avg Price를 API 토큰 가격으로 오해하지 않는 것이 중요하다.

OpenAI 공식 API 요금은 2026년 7월 24일 확인 기준으로 100만 토큰당 입력·출력 가격을 따로 책정한다.

모델입력 100만 토큰캐시 입력출력 100만 토큰

GPT-5.6 Sol 5달러 0.50달러 30달러
GPT-5.6 Terra 2.50달러 0.25달러 15달러
GPT-5.6 Luna 1달러 0.10달러 6달러

위 요금은 표준 처리 방식과 일정 컨텍스트 길이를 기준으로 한 공식 API 가격이다. 이미지의 Avg Price는 1회 평가 또는 특정 작업 묶음을 처리하면서 발생한 평균 지출액으로 보이며, 공식 API 단가 그 자체는 아니다. (OpenAI)

상위 10개 모델 순위 분석

이미지에는 전체 19개 모델 가운데 상위 10개가 표시돼 있다.

순위모델IQ평균 가격ScoreIQ/$상태

1 GPT-5.6 Luna max 95.1% $2.51 85.7 37.8 Caution
2 GPT-5.6 Terra xhigh 93.8% $2.40 84.8 39.0 Caution
3 GPT-5.6 Terra max 101.8% $4.62 84.6 22.0 Caution
4 GPT-5.6 Sol medium 89.7% $3.62 76.3 24.8 Inefficient
5 GPT-5.5 xhigh 97.8% $5.83 76.1 16.8 Caution
6 GPT-5.6 Luna xhigh 81.7% $1.57 75.9 52.1 Inefficient
7 GPT-5.6 Sol high 91.1% $4.89 72.9 18.6 Caution
8 GPT-5.6 Sol max 103.1% $8.87 70.1 11.6 Caution
9 GPT-5.6 Sol low 76.3% $2.06 68.7 37.0 Inefficient
10 GPT-5.6 Luna high 72.3% $1.03 68.5 70.3 Inefficient

1위 GPT-5.6 Luna max

Luna max는 IQ 95.1%, 평균 가격 2.51달러, 종합 점수 85.7로 1위를 차지했다.

Luna는 공식적으로 비용에 민감한 대량 작업을 위한 등급이다. 여기에 max 추론 강도를 적용하면서 성능을 높이되, Sol 계열보다 낮은 기본 가격을 유지한 점이 순위에 유리하게 작용한 것으로 보인다. OpenAI 문서에서 max는 복잡한 문제에 더 많은 추론을 배정하는 설정으로 안내된다. (OpenAI Developers)

다만 1위라고 해서 모든 코딩 작업에서 가장 빠르거나 가장 정확하다는 의미는 아니다. 이 표에서 1위라는 것은 현재 계산식과 평가 데이터 안에서 IQ와 평균 비용의 균형이 가장 좋았다는 뜻이다.

2위 GPT-5.6 Terra xhigh

Terra xhigh는 평균 가격이 Luna max보다 0.11달러 낮고, IQ는 1.3%포인트 낮다. 두 모델의 Score 차이는 0.9점에 불과하다.

Luna max: 95.1 − 3.72 × 2.51 ≈ 85.7
Terra xhigh: 93.8 − 3.72 × 2.40 ≈ 84.9

가성비만 보면 두 모델은 상당히 가까운 선택지다. Luna max가 약간 높은 평가 품질을 제공한다면, Terra xhigh는 비용을 조금 줄이면서 비슷한 종합 점수를 확보하는 구성으로 해석할 수 있다.

3위 GPT-5.6 Terra max

Terra max는 IQ 101.8%로 표에서 두 번째로 높은 절대 성능을 기록했다. GPT-5.6 Sol max보다 IQ가 1.3%포인트 낮지만 평균 가격은 4.25달러 저렴하다.

이 차이 때문에 종합 점수에서는 Terra max가 84.6, Sol max가 70.1을 기록했다.

품질을 최우선으로 두되 Sol max의 비용이 부담스럽다면 Terra max가 중간 선택지로 보인다. OpenAI 역시 Terra를 낮은 가격에서 높은 성능을 제공하는 균형형 등급으로 설명한다. (OpenAI)

4위 GPT-5.6 Sol medium

Sol medium은 IQ 89.7%, 평균 가격 3.62달러로 Score 76.3을 기록했다.

Sol은 GPT-5.6 제품군의 최상위 등급이지만, medium 설정의 평가 점수는 Luna max나 Terra xhigh보다 낮다. 이 결과는 기본 모델 등급만 높다고 항상 더 높은 평가 결과가 보장되지는 않는다는 점을 보여준다.

작업 특성과 추론 강도에 따라 하위 등급의 높은 추론 설정이 상위 등급의 중간 설정보다 높은 점수를 낼 수 있다.

5위 GPT-5.5 xhigh

이전 세대인 GPT-5.5 xhigh는 IQ 97.8%로 높은 편이지만 평균 가격이 5.83달러에 달한다. 비용 감점이 커지면서 Score는 76.1로 내려갔다.

GPT-5.6 출시 자료에서 OpenAI는 Terra의 성능이 GPT-5.5와 경쟁할 수 있는 수준이라고 설명한다. 이미지에서도 Terra xhigh와 Terra max가 GPT-5.5 xhigh보다 높은 가성비 점수를 기록한다. 다만 두 결과는 평가 조건이 다를 수 있으므로 공식 성능 비교와 제3자 가성비 순위를 동일한 자료로 취급해서는 안 된다. (OpenAI)

6위 GPT-5.6 Luna xhigh

Luna xhigh는 IQ 81.7%로 절대 점수는 상위권보다 낮지만 평균 가격이 1.57달러로 저렴하다. IQ/$는 52.1로 1위 Luna max보다 높다.

그런데 Status는 Inefficient로 표시된다. 이는 단순히 IQ/$가 높다고 효율 상태가 좋아지는 것은 아니라는 의미다. 사이트가 특정 성능 기준이나 인접 설정과의 비교값을 Status 판정에 추가로 활용했을 가능성이 있다.

이미지만으로는 Status 산정 공식이 공개되지 않았으므로 정확한 원인은 단정하기 어렵다.

7위 GPT-5.6 Sol high

Sol high는 IQ 91.1%, 평균 가격 4.89달러, Score 72.9다. Luna max보다 IQ는 4%포인트 낮은데 비용은 2.38달러 더 높다.

이 평가 조건에서는 Sol high가 애매한 위치에 놓인다. 성능을 더 높이려면 Sol max가 있고, 가성비를 중시한다면 Terra나 Luna의 높은 추론 설정이 앞선다.

다만 실제 개발 환경에서는 긴 컨텍스트 처리, 도구 호출, 복잡한 에이전트 작업처럼 단일 IQ 지표에 반영되지 않은 기능이 선택에 영향을 줄 수 있다. 공식 문서에 따르면 GPT-5.6 Sol은 복잡한 전문 작업을 위한 최상위 모델이며, 105만 토큰 컨텍스트와 최대 12만8천 출력 토큰을 지원한다. (OpenAI Developers)

8위 GPT-5.6 Sol max

Sol max는 IQ 103.1%로 이미지에서 가장 높은 점수를 기록했다. 하지만 평균 가격도 8.87달러로 가장 높다.

103.1 − 3.72 × 8.87
= 103.1 − 32.9964
= 약 70.1

절대 성능은 1위지만 가성비 순위는 8위다. 이 모델은 비용 절감보다 결과 품질을 우선하는 작업에 가깝다.

다음과 같은 작업이라면 높은 비용을 감수할 이유가 생길 수 있다.

  • 여러 파일과 도구를 함께 다루는 복잡한 개발 작업
  • 오류 비용이 큰 코드 분석 및 검증
  • 긴 추론 과정이 필요한 설계 작업
  • 한 번의 결과 품질이 반복 실행 비용보다 중요한 작업
  • 성능 차이가 실제 매출이나 작업 시간에 직접 영향을 주는 업무

반대로 간단한 코드 수정이나 반복적인 자동화 작업이라면 Sol max를 항상 사용하는 방식은 비용 낭비가 될 수 있다.

반응형

9위 GPT-5.6 Sol low

Sol low는 평균 가격이 2.06달러로 Sol 계열 중 낮지만 IQ도 76.3%로 내려간다. 비용을 줄였음에도 Score는 68.7에 그쳤다.

이 결과만 보면 Sol의 추론 강도를 low까지 낮추는 것보다 Luna나 Terra의 높은 추론 설정을 사용하는 편이 유리하다.

OpenAI도 모델 마이그레이션 시 기존 추론 설정만 그대로 사용할 것이 아니라, 같은 설정과 한 단계 낮은 설정을 실제 대표 작업에서 비교하라고 안내한다. 모델별 효율은 작업 유형에 따라 달라질 수 있기 때문이다. (OpenAI Developers)

10위 GPT-5.6 Luna high

Luna high는 IQ 72.3%, 평균 가격 1.03달러다. 표에 표시된 상위 10개 중 가격이 가장 낮으며 IQ/$는 70.3으로 높다.

저렴한 비용으로 일정 수준의 작업을 대량 처리하는 용도에는 의미가 있다. 하지만 IQ가 낮아 복잡한 문제에서는 재시도와 수정 비용이 늘어날 수 있다.

모델 단가가 싸더라도 실패율이 높아 작업을 여러 번 반복한다면 전체 비용은 오히려 커진다. 실제 가성비를 판단할 때는 요청 한 번의 비용보다 성공한 결과 한 건을 얻는 총비용을 계산하는 편이 정확하다.

IQ/$가 높은데 순위는 낮을 수 있는 이유

IQ/$는 IQ Score를 평균 가격으로 나눈 값으로 보인다.

GPT-5.6 Luna high를 계산하면 다음과 같다.

72.3 ÷ 1.03 ≈ 70.2

이미지의 70.3과 거의 같다.

IQ/$는 비용 효율을 직관적으로 보여주지만, 아주 저렴한 모델에 유리한 구조다. 성능이 실무 기준에 미치지 못하더라도 가격이 낮으면 비율이 크게 올라갈 수 있다.

반면 종합 Score는 가격에 일정한 감점을 주는 방식이다.

지표유리한 모델한계

IQ Score 절대 성능이 높은 모델 비용을 반영하지 않음
IQ/$ 매우 저렴한 모델 최소 품질 기준을 반영하지 못함
Score 품질과 비용이 균형 잡힌 모델 α 값에 따라 순위가 변함

따라서 IQ/$만 보고 모델을 선택하기보다는 먼저 업무에 필요한 최소 성능을 정한 뒤, 그 기준을 통과한 모델끼리 비용을 비교하는 것이 현실적이다.

α = 3.72가 순위를 결정하는 방식

이 표에서 가장 중요한 숫자는 모델 점수보다 α 값일 수 있다.

α는 비용 1달러를 IQ 점수 몇 점으로 환산할지 정하는 계수다. 현재 이미지는 3.72를 사용한다.

α가 커지는 경우

비용에 더 큰 패널티가 붙는다.

  • Luna처럼 저렴한 모델이 유리해진다.
  • Sol max처럼 비싼 모델은 순위가 내려간다.
  • 절대 성능보다 비용 절감이 중요해진다.

α가 작아지는 경우

비용 패널티가 줄어든다.

  • Sol max와 Terra max처럼 IQ가 높은 모델이 유리해진다.
  • 모델 간 가격 차이의 영향이 작아진다.
  • 품질 우선 순위에 가까워진다.

이미지 상단 설명에 따르면 α는 IQ 범위와 비용 범위를 이용해 정규화한 값이다.

α = (최대 IQ − 최소 IQ) ÷ (최대 비용 − 최소 비용)

평가 대상이 바뀌거나 극단적으로 비싼 모델이 추가되면 최대·최소 범위도 달라진다. 그 결과 기존 모델의 데이터가 같더라도 α와 순위가 바뀔 수 있다.

따라서 이 순위는 절대적인 모델 서열이라기보다 해당 시점에 포함된 19개 구성과 계산식 안에서 만들어진 상대 순위로 보는 것이 적절하다.

GPT-5.6 Sol·Terra·Luna의 공식적인 차이

2026년 7월 24일 확인 기준으로 OpenAI는 세 모델을 다음과 같이 구분한다.

등급공식 포지션적합한 작업

Sol 복잡한 전문 작업을 위한 최상위 모델 고난도 개발, 연구, 에이전트 작업
Terra 성능과 비용의 균형형 일반 개발, 대량 업무, 운영 환경
Luna 빠르고 저렴한 효율형 반복 처리, 비용 민감 작업, 대량 요청

GPT-5.6 모델은 none, low, medium, high, xhigh, max와 같은 추론 강도를 지원한다. 추론 강도를 높이면 모델이 더 많은 탐색과 검증을 수행할 수 있지만, 응답 시간과 토큰 사용량도 함께 늘어날 수 있다. OpenAI는 medium을 균형 잡힌 출발점으로, low를 지연 시간에 민감한 작업에, max를 품질 우선의 어려운 작업에 사용하는 방식을 안내한다. (OpenAI Developers)

목적에 따른 모델 선택 기준

비용과 품질의 균형이 필요할 때

이미지 기준으로는 다음 두 구성이 가장 눈에 띈다.

  • GPT-5.6 Luna max
  • GPT-5.6 Terra xhigh

두 모델의 Score 차이가 크지 않으므로 실제 코드베이스에서 동일한 작업을 실행해 성공률과 수정 횟수를 비교하는 편이 좋다.

절대 성능이 가장 중요할 때

GPT-5.6 Sol max가 IQ 103.1%로 가장 높다.

비용이 크더라도 다음과 같은 경우에는 검토할 수 있다.

  • 결과 오류가 큰 손실로 이어지는 작업
  • 복잡한 코드베이스 전체 분석
  • 장시간 자율 실행이 필요한 에이전트 업무
  • 여러 도구와 파일을 동시에 다루는 작업

저비용 대량 처리가 필요할 때

GPT-5.6 Luna high와 Luna xhigh가 후보가 될 수 있다.

단순 코드 생성, 포맷 변환, 반복 분류처럼 성공 여부를 자동으로 검사할 수 있는 업무라면 낮은 단가가 장점이 된다. 실패한 결과를 사람이 직접 검토해야 하는 작업이라면 품질 저하로 발생하는 인건비까지 계산해야 한다.

기존 GPT-5.5를 사용하고 있을 때

이미지에서는 GPT-5.5 xhigh보다 GPT-5.6 Terra xhigh와 Terra max의 가성비 점수가 높다.

다만 전체 서비스를 즉시 교체하기보다 다음 방식이 안전하다.

  1. 실제 운영 프롬프트를 대표하는 테스트 세트를 만든다.
  2. 기존 GPT-5.5 결과를 기준선으로 저장한다.
  3. GPT-5.6 Terra와 Luna를 같은 조건에서 실행한다.
  4. 정답률, 실행 시간, 토큰 비용, 재시도 횟수를 기록한다.
  5. 성공한 작업 1건당 총비용을 비교한다.
  6. 차이가 확인된 뒤 일부 트래픽부터 전환한다.

이 순위표를 그대로 믿으면 안 되는 이유

IQ의 정의가 공식 지표와 다르다

이미지의 IQ는 일반적인 지능지수나 OpenAI 공식 벤치마크 이름이 아니다. 어떤 평가 항목을 조합했는지, 문제별 가중치를 어떻게 부여했는지 확인되지 않으면 점수만으로 모델의 전체 능력을 판단하기 어렵다.

OpenAI 공식 발표에는 코딩, 전문 업무, 과학, 컴퓨터 사용, 사이버 보안 등 여러 평가 결과가 각각 공개돼 있다. 하나의 통합 점수만으로 모든 작업의 성능을 설명하지는 않는다. (OpenAI)

평균 가격은 작업 구성에 따라 달라진다

같은 모델이라도 다음 조건에 따라 비용이 달라진다.

  • 입력 프롬프트 길이
  • 출력 코드 길이
  • 추론 강도
  • 도구 호출 횟수
  • 캐시 적용 여부
  • 실패 후 재시도 횟수
  • 장문 컨텍스트 사용 여부

특히 공식 문서에서는 일정 길이를 초과한 입력에 다른 가격 조건이 적용될 수 있다고 설명한다. 따라서 이미지의 평균 가격을 자신의 프로젝트 예상 비용으로 바로 대입해서는 안 된다. (OpenAI)

벤치마크와 실제 코드베이스는 다르다

벤치마크 문제는 정답과 평가 방식이 비교적 명확하다. 실제 개발 환경에서는 불완전한 요구사항, 기존 아키텍처, 사내 라이브러리, 테스트 부족, 권한 문제 등이 함께 작용한다.

표에서 점수가 높은 모델도 특정 프레임워크나 오래된 코드베이스에서는 기대만큼 좋은 결과를 내지 못할 수 있다.

모델 상태가 계속 바뀔 수 있다

API 별칭은 향후 업데이트된 스냅샷을 가리킬 수 있다. 일관된 결과가 필요한 서비스라면 공식 문서에서 제공하는 스냅샷 지원 여부를 확인하고 고정 모델명을 사용하는 방식을 검토해야 한다. GPT-5.6 Sol 공식 문서도 일관된 성능과 동작을 위해 스냅샷을 고정할 수 있다고 안내한다. (OpenAI Developers)

실무에서는 이렇게 검증하는 편이 좋다

가성비 모델을 고를 때는 사이트의 순위를 참고하되 자체 테스트를 함께 진행해야 한다.

테스트 항목

  • 코드가 한 번에 실행되는 비율
  • 단위 테스트 통과율
  • 사람이 수정한 코드 줄 수
  • 첫 응답까지 걸린 시간
  • 전체 작업 완료 시간
  • 평균 입력·출력 토큰
  • 도구 호출 횟수
  • 재시도 횟수
  • 성공한 작업 1건당 비용

간단한 비교 방식

10~30개의 대표 작업을 준비하고 각 모델에 같은 조건으로 실행한다.

실질 비용
= 전체 API 비용 ÷ 성공한 작업 수

예를 들어 A 모델이 요청당 1달러이고 성공률이 50%라면 성공한 결과 한 건에 약 2달러가 들어간다. B 모델이 요청당 1.50달러라도 성공률이 90%라면 성공 결과 한 건당 비용은 약 1.67달러다.

표면적인 호출 비용은 A 모델이 싸지만, 실제 가성비는 B 모델이 더 나을 수 있다.

이미지에서 얻을 수 있는 결론

이 표에서 가장 눈에 띄는 결과는 세 가지다.

첫째, 가장 강한 모델과 가장 가성비가 좋은 모델은 다르다. Sol max는 IQ 1위지만 종합 순위는 8위다.

둘째, 하위 등급의 높은 추론 설정이 상위 등급의 낮은 추론 설정보다 효율적일 수 있다. Luna max와 Terra xhigh가 Sol medium, high, low보다 높은 점수를 기록한다.

셋째, 모델 선택은 이름보다 작업 단위로 해야 한다. 간단한 반복 작업에는 Luna가, 균형 잡힌 운영 환경에는 Terra가, 실패 비용이 큰 고난도 작업에는 Sol이 더 적합할 수 있다.

짧은 마무리

Codex Value Radar 기준으로는 GPT-5.6 Luna max가 성능과 평균 비용의 균형에서 1위를 기록했다. 다만 이 결과는 자체 IQ 지표와 α 3.72를 적용한 상대 평가다. 실제 모델을 선택할 때는 공식 API 가격을 확인하고, 자신의 코드와 프롬프트로 성공률·재시도·총비용을 측정하는 과정이 필요하다.

 

Cursor vs Codex vs Claude Code, 모델을 빼고 IDE만 비교하면 승자는?

반응형

댓글