Codex에서 GPT-5.6 Sol·Terra·Luna 어떻게 고를까? 벤치마크 비교와 사용 가이드
Codex에서 Sol, Terra, Luna를 고를 때는 성능만 보면 부족하다. 코딩 난도, 비용, 응답 속도, 사용 가능한 요금제까지 함께 봐야 실제 작업에 맞는 모델을 고를 수 있다.
먼저 보는 선택 기준
구분SolTerraLuna
| 성격 | 가장 강한 코딩·추론 모델 | 성능과 비용의 균형형 | 가장 빠르고 저렴한 모델 |
| 추천 작업 | 복잡한 리팩터링, 아키텍처 변경, 어려운 버그 분석 | 일반 개발 작업, 코드 리뷰, 테스트 작성 | 반복 작업, 간단한 수정, 대량 처리 |
| API 가격 | 입력 $5 / 출력 $30 per 1M tokens | 입력 $2.50 / 출력 $15 per 1M tokens | 입력 $1 / 출력 $6 per 1M tokens |
| 컨텍스트 | 1.05M tokens | 1.05M tokens | 1.05M tokens |
| 최대 출력 | 128K tokens | 128K tokens | 128K tokens |
| Codex 제공 | Plus 이상은 Sol·Terra·Luna 선택 가능, Free·Go는 Terra 제공 | Codex에서 사용 가능 | Codex에서 사용 가능 |
확인 기준일: 2026년 7월 13일. OpenAI 공식 문서 기준으로 Sol, Terra, Luna는 OpenAI API와 Codex에서 사용할 수 있으며, Codex에서는 Free·Go 사용자가 Terra를, Plus·Pro·Business·Enterprise 사용자가 Sol·Terra·Luna를 선택할 수 있다. (OpenAI)
Sol, Terra, Luna의 차이는 무엇인가
Sol은 GPT-5.6 계열의 플래그십 모델이다. OpenAI API 문서에서도 복잡한 추론과 코딩에는 Sol을 먼저 추천한다. 어려운 코드베이스를 읽고 구조를 바꾸거나, 여러 파일에 걸친 버그를 추적하거나, 요구사항을 설계 수준으로 풀어야 할 때 적합하다. (OpenAI 개발자)
Terra는 성능과 비용 사이의 균형을 노린 모델이다. 매번 최고 성능이 필요하지 않은 코드 리뷰, 테스트 코드 작성, 일반적인 기능 구현에서는 Terra가 현실적인 선택이 될 수 있다. 특히 Codex에서 Free·Go 사용자에게 제공되는 모델이 Terra라는 점도 확인해야 한다. (OpenAI Help Center)
Luna는 가장 빠르고 비용 효율적인 모델이다. 간단한 코드 수정, 반복적인 변환, 문서화, 테스트 케이스 초안처럼 대량으로 처리해야 하는 작업에 어울린다. 다만 복잡한 설계 판단이나 보안상 민감한 코드 분석에서는 Sol이나 Terra를 먼저 쓰는 편이 안전하다.
벤치마크는 어떻게 봐야 하나
Artificial Analysis의 GPT-5.6 벤치마크에 따르면 Sol max는 Coding Agent Index에서 80점을 기록했고, Terra max는 77점, Luna max는 75점을 기록했다. 같은 자료에서 Terra와 Luna는 Sol 대비 작업당 비용이 각각 약 60%, 80% 낮은 것으로 정리됐다. (Artificial Analysis)
벤치마크 관점SolTerraLuna
| Coding Agent Index | 80 | 77 | 75 |
| Intelligence Index | 59 | 55 | 51 |
| 비용 방향 | 가장 비쌈 | Sol보다 낮음 | 가장 낮음 |
| 해석 | 최고 성능 우선 | 균형형 | 비용·속도 우선 |
벤치마크는 “무조건 Sol이 정답”이라는 뜻은 아니다. 실제 개발에서는 모델 성능보다 작업의 난도가 더 중요하다. 단순한 타입 수정, 테스트 이름 변경, 문서 정리 같은 일에 Sol을 계속 쓰면 비용 효율이 떨어질 수 있다. 반대로 장애 원인 분석이나 대규모 리팩터링을 Luna에 맡기면 여러 번 재시도하느라 시간이 더 들 수 있다.
Codex에서 모델을 고르는 실전 기준
Codex에서 가장 단순한 기준은 “작업이 실패했을 때 손실이 큰가”다. 손실이 크면 Sol, 평범한 개발 작업이면 Terra, 반복 처리라면 Luna부터 시작하면 된다.
작업 유형추천 모델이유
| 레거시 코드 구조 파악 | Sol | 긴 맥락과 복잡한 추론이 필요함 |
| 버그 원인 분석 | Sol 또는 Terra | 재현 조건과 코드 흐름을 함께 봐야 함 |
| 일반 기능 구현 | Terra | 성능과 비용의 균형이 좋음 |
| 테스트 코드 작성 | Terra 또는 Luna | 반복 작업이 많고 검증 가능함 |
| 코드 포맷 변경 | Luna | 단순 반복 작업에 적합함 |
| README·주석 정리 | Luna | 고성능 모델이 꼭 필요하지 않음 |
| 보안 관련 코드 검토 | Sol | 오판 비용이 큼 |
작업을 처음 맡길 때는 Terra로 시작하고, 결과가 부족하면 Sol로 올리는 방식도 괜찮다. 반대로 명확하고 단순한 작업은 Luna로 먼저 처리한 뒤, 결과 검토만 Terra나 Sol에 맡기면 비용을 줄일 수 있다.
비용을 줄이는 사용법
API 기준 가격은 Sol이 입력 $5, 출력 $30 per 1M tokens이고, Terra는 입력 $2.50, 출력 $15, Luna는 입력 $1, 출력 $6이다. 세 모델 모두 컨텍스트 창은 1.05M tokens, 최대 출력은 128K tokens로 공지되어 있다. (OpenAI 개발자)
비용을 줄이려면 모델 선택보다 프롬프트 설계가 먼저다. 저장소 전체를 무작정 넣기보다 관련 파일, 에러 로그, 기대 동작, 실패 조건을 분리해서 주는 편이 낫다. 특히 Codex 작업에서는 “수정할 범위”와 “건드리지 말아야 할 파일”을 명확히 적어야 재작업이 줄어든다.
예를 들면 이런 식이 좋다.
목표: 로그인 실패 시 에러 메시지가 표시되지 않는 문제를 수정해줘.
범위: /auth, /components/LoginForm.tsx, 관련 테스트 파일만 수정.
금지: API 응답 형식은 바꾸지 말 것.
검증: 기존 테스트 통과 + 로그인 실패 케이스 테스트 추가.
원하는 결과: 변경 요약, 수정 파일 목록, 테스트 실행 방법.
이런 요청은 모델이 불필요한 파일을 뒤지는 시간을 줄여준다. 단순한 요청일수록 Luna나 Terra로 충분하고, 원인 분석이 길어질수록 Sol을 쓰는 편이 낫다.
벤치마크보다 중요한 검증 절차
AI 코딩 모델은 결과물이 그럴듯해 보여도 실제로는 빌드가 깨질 수 있다. 그래서 모델 선택보다 중요한 것은 검증 절차다.
Codex에서 작업을 맡긴 뒤에는 최소한 아래 순서로 확인하는 편이 안전하다.
- 변경 파일 목록 확인
- 의도하지 않은 파일 수정 여부 확인
- 테스트 실행
- 타입 체크 또는 린트 실행
- 핵심 기능 직접 실행
- 보안·권한 관련 변경 여부 확인
Sol을 썼다고 검증을 생략하면 안 된다. 벤치마크 점수는 평균적인 성능을 보여줄 뿐, 내 저장소의 프레임워크 버전, 내부 규칙, 테스트 환경까지 보장하지는 않는다.
짧은 마무리
Codex에서 Sol, Terra, Luna를 고를 때는 Sol을 최고 성능 모델, Terra를 기본 작업 모델, Luna를 반복·저비용 모델로 보면 이해하기 쉽다. 처음부터 가장 비싼 모델만 쓰기보다 작업 난도에 따라 Luna → Terra → Sol 순서로 올리는 방식이 실용적이다.
'[IT] 이야기 > [AI] 이야기' 카테고리의 다른 글
| GPT-5.6 vs Claude Fable 5, 실제 개발 작업 5개 기준으로 비교해봤다 (0) | 2026.07.14 |
|---|---|
| Grok 4.5 vs GPT vs Claude, 바이브코딩 성능과 가성비 비교 (0) | 2026.07.14 |
| GPT 5.6 vs Claude Fable 5 비교, 어떤 모델을 선택해야 할까 (0) | 2026.07.10 |
| GPT-5.6은 무엇이 달라졌나, 모델별 차이와 가격 (0) | 2026.07.08 |
| GPT-5 티저부터 M4 맥·갤럭시 트라이폴드까지 — 7월 3일 ‘오늘 꼭 알아야 할 IT 핫이슈’ (5) | 2025.07.04 |
댓글