GPT-6 Sol·Luna 성능 비교: GPT-5.6·Claude·Gemini와 무엇이 달라졌나
모델 비교표에서는 점수 높은 항목이 먼저 보이지만, API를 실제 업무에 붙이면 재시도와 사람의 수정도 비용에 들어가요. 첫 답에서 끝났는지, 결과를 다시 고쳤는지에 따라 같은 단가표를 보고도 선택이 달라질 수 있어요. GPT-6 Sol과 Luna 역시 모든 평가에서 이전 세대를 앞서지는 않았어요. Artificial Analysis의 독립 평가에서는 Sol의 코딩 에이전트 지표가 조금 올랐고 Luna는 내려갔지만, 두 모델 모두 작업당 비용은 줄었어요. 그래서 한 줄 순위보다 성능과 비용의 변화를 나눠 봅니다.[1]
범위도 먼저 밝힐게요. 이 글은 GPT-6, GPT-5.6, Claude, Gemini API에 같은 프롬프트를 넣어 직접 비교한 사용기가 아니에요. 공개 가격표와 Artificial Analysis의 독립 평가, OpenAI가 공개한 자체 벤치마크를 비교했고, 비용 예시는 공개 단가에 토큰량을 대입해 계산했어요. 실제 서비스의 응답 품질·속도·재시도 비용은 각자의 API 로그로 확인해야 해요.
성능 점수만 보면 Claude Opus 5.5가 앞서요
Artificial Analysis Intelligence Index에서 GPT-6 Sol은 최고 설정(max) 기준 48점, Luna는 37점이에요. 같은 평가의 Claude Opus 5.5는 58점, Gemini 3.8 Flash(high)는 41점으로 나타났어요. 이 지수는 여러 평가를 묶은 종합 지표라서, 특정 코딩 과제나 실제 서비스의 정답률 그 자체로 읽으면 안 돼요. 특히 reasoning 설정도 Sol·Luna는 max, Gemini는 high, Claude는 max와 fallback 조합으로 표기되는 등 서로 다르므로 숫자 차이를 같은 계산량의 정면 승부로 볼 수는 없어요.[2] [3] [4] [5]
같은 Artificial Analysis 자료의 Coding Agent Index에서는 GPT-6 Sol(max)이 57로 GPT-5.6 Sol보다 2점 높았고, 평가 작업당 비용은 약 절반 수준이었어요. 반면 Luna(max)는 41로 GPT-5.6 Luna보다 2점 낮았지만 작업당 비용은 약 60% 줄었어요. 지표별로 강점과 퇴보가 섞였다는 얘기예요. 실제 코딩 프로젝트에서 Sol의 이득이 체감될 수는 있지만, 본인 코드베이스·도구·검증 과정으로 확인하기 전에는 일반적인 생산성 향상으로 단정하기 어렵습니다.[1]
해당 지수 평가에 든 비용도 비교했어요. Sol(max)은 GPT-5.6 Sol의 1.99달러에서 1.06달러로, Luna(max)는 0.18달러에서 0.07달러로 내려갔습니다. 다만 두 신모델이 평가에서 생성한 출력 토큰은 오히려 늘었어요(Sol 2.9만→3.1만, Luna 4.1만→5.1만 토큰). 즉 여기서 비용 절감은 단순히 답변을 짧게 해서라기보다 단가 변화가 큰 역할을 했다고 볼 수 있어요. 이 금액은 해당 지수의 평가 작업을 실행한 비용이며, 사용자의 앱이나 에이전트에서 같은 비용이 나온다는 보장은 아니에요.[1]
환각 관련 수치도 평가 맥락을 좁혀 읽어야 해요. Artificial Analysis의 AA-Omniscience에서 Sol의 환각률은 92%에서 60%로 내려갔지만, 답을 시도한 비율도 99%에서 83%로 감소했고 정확도는 59%에서 54%로 낮아졌어요. Luna의 환각률은 93%에서 77%로 줄었고 정확도는 43%에서 44%로 비슷했어요. 이는 해당 벤치마크에서 모델이 모르는 질문에 답하지 않는 경향까지 반영한 결과이지, 일반적인 사용자 대화에서 답변의 60%가 틀린다는 뜻은 아니에요.[1]
OpenAI가 공개한 경쟁사 비교는 별도 근거예요
OpenAI 발표에는 자체 평가 결과도 있어요. AutomationBench에서 GPT-6 Sol(xhigh)은 33.2%, 작업당 0.27달러로, Claude Opus 5(max)의 26.9%보다 높고 비용은 11.1배 낮다고 OpenAI가 보고했어요. DeepSWE v1.1에서는 Sol(max)이 68.8%, Claude Fable 5(xhigh)가 69.9%였으며, OpenAI는 Sol의 작업당 비용이 약 80% 낮다고 설명했어요. OSWorld 2.0 오프라인 평가에서는 Sol(xhigh) 60.5, Claude Opus 5(medium) 60.3으로 비슷한 점수와 약 80%의 비용 절감을 제시했어요.[6]
이 수치들은 OpenAI가 발표한 비교 결과이며 Artificial Analysis의 독립 평가와 한 표에 섞어 순위를 매길 수 없어요. 평가 세트, 설정, 도구, 비용 산정법이 다르고, 공개된 발표만으로 동일 조건의 독립 재현을 확인할 수도 없습니다. “어느 회사 모델이 이겼다”는 결론보다 각 수치를 누가 어떤 평가에서 보고했는지 보는 게 중요해요. GPT-5.6 Sol·Luna의 이전 세대 구성과 가격 변화는 기존 GPT-5.6 비교 가이드에서 이어서 확인할 수 있어요.
표준 API 요금은 입력·출력 비율에 따라 달라져요
아래 표는 2026년 9월 23일 확인한 비캐시·표준 API의 기본 단가(USD/100만 토큰)예요. OpenAI 모델은 한 요청의 입력이 272K를 넘으면 별도 배수가 적용돼, 뒤에서 따로 설명할게요.[7] GPT-5.6 Sol의 $4/$20 단가는 현재 프로모션이며, OpenAI는 이 가격의 프로모션을 최소 2026년 11월 21일까지 제공한다고 안내해요.[8] Gemini 3.8 Flash는 2026년 12월 31일까지의 프로모션을 별도 표시했어요. 캐시 읽기·쓰기, 도구 이용료, 배치나 속도 옵션은 표에서 제외했어요.[7] [8] [9] [10] [11]
| API 모델 | 입력 / 100만 토큰 | 출력 / 100만 토큰 | 비고 |
|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | 표준 단가 |
| GPT-5.6 Sol | $4.00 | $20.00 | 현재 프로모션 요금 |
| GPT-6 Luna | $0.10 | $0.50 | 표준 단가 |
| GPT-5.6 Luna | $0.20 | $1.20 | 현재 API 가격 |
| Claude Opus 5.5 | $4.00 | $20.00 | 표준 단가 |
| Claude Sonnet 5 | $2.00 | $10.00 | 표준 단가 |
| Gemini 3.8 Flash | $0.75 | $3.75 | 프로모션: 2026-12-31까지; 2027-01-01부터 $1.50 / $7.50 [12] |
여러 개의 일반 길이 요청에 나눠 입력을 합계 90만 토큰, 출력을 10만 토큰 쓴다고 가정해볼게요. 각 요청의 입력은 272K 이하예요. 이 조건에서 단순 계산하면 GPT-6 Sol은 (0.9×$2)+(0.1×$10)=$2.80, GPT-5.6 Sol은 $5.60이에요. Luna는 각각 $0.14와 $0.30, Claude Opus 5.5는 $5.60, Sonnet 5는 $2.80, Gemini 3.8 Flash는 프로모션 중 $1.05예요. 합산 예시는 토큰 사용료만 계산한 값이고, 실제 지출에는 캐시·재시도·도구 비용도 더해져요. Gemini 프로모션 기간이 끝난 뒤에는 표에 적은 정가가 적용돼요.[7] [10] [11]
반복 프롬프트가 많은 서비스라면 캐시 단가도 따로 계산해야 해요. GPT-6의 캐시 입력은 기본 입력가의 10%지만, 캐시를 새로 쓰는 토큰은 기본 입력가의 1.25배예요. 따라서 프롬프트가 매번 달라져 재사용되지 않으면 캐시 할인을 기대하기 어렵고, 반대로 같은 지침·문서 접두부를 재사용하는 호출이 많으면 총액 차이가 커질 수 있어요. Anthropic은 캐시 읽기와 5분·1시간 쓰기 가격을 구분하고, Google도 캐시 토큰 외 저장 비용을 둬요. 위 표의 표준 입력·출력 숫자만으로 캐시 사용 비용까지 대표한다고 보면 안 됩니다.[7] [10] [11]
긴 요청은 별도 주의가 필요해요. OpenAI는 GPT-6 Sol·Luna와 GPT-5.6 Sol·Luna 모두 한 요청의 입력이 272K 토큰을 넘으면 입력·캐시 요금은 2배, 출력 요금은 1.5배로 그 요청 전체에 적용해요.[13] [14] [8] [9] 입력 30만·출력 2만 토큰을 한 요청에 넣으면 GPT-6 Sol은 $1.50으로, 짧은 문맥 단가만 곱한 $0.80보다 높아요. GPT-5.6 Sol의 현재 $4/$20 프로모션 단가로 같은 요청을 계산하면 $3.00, 짧은 문맥 단가 기준으로는 $1.60이에요.[8] 그래서 합산 토큰 예시와 긴 단일 요청의 청구액은 구분해야 해요. 1.05M이라는 최대 문맥 창이 모든 토큰을 같은 가격으로 처리한다는 뜻은 아니며, GPT-6는 최대 입력 922K·출력 128K 한도도 따로 있어요.[13] [14]
Claude Opus 5.5와 Sonnet 5는 각각 1M 문맥 창과 최대 128K 출력을, Gemini 3.8 Flash는 1,048,576 입력 토큰과 65,536 출력 토큰을 지원해요. 숫자상으로 긴 입력을 다룰 수 있어 보여도, 최대 한도에 가까운 요청의 품질·응답시간·요금 효율이 같다는 뜻은 아닙니다. 입력 길이를 실제 업무에서 필요한 수준으로 고정하고, 그 안에서 정보 회수와 결과 누락을 함께 평가해야 해요.[15] [16] [17]
용도별로는 Sol과 Luna의 선택 기준이 달라요
여러 파일을 다루거나 도구를 연속 호출하는 개발 과제를 비교한다면 Sol을 테스트 후보에 넣어볼 만해요. 독립 코딩 에이전트 지수가 소폭 올랐다는 결과는 시험해 볼 이유이지, Luna보다 안전하거나 모든 저장소에서 더 낫다는 결론은 아니에요. 같은 저장소와 검증 절차로 직접 비교해 보세요.[1]
분류, 요약, 정해진 형식의 변환처럼 대량으로 반복되는 비교적 집중된 작업은 Luna의 낮은 토큰 단가가 매력적이에요. 반대로 한 번의 실패가 큰 비용을 만드는 업무라면 모델 사용료뿐 아니라 검증·재작업 비용까지 포함해 비교해야 합니다. Claude Opus 5.5는 Artificial Analysis 종합 지수에서 더 높은 점수를 보였고, Sonnet 5는 Opus보다 낮은 가격대의 선택지예요. Gemini 3.8 Flash는 입력 한도 1,048,576, 출력 한도 65,536 토큰과 낮음·중간·높음 추론 설정을 제공해 긴 입력이나 멀티모달 워크플로 후보가 될 수 있지만, 한도만으로 GPT-6와 성능이 같다고 말할 수는 없어요.[15] [16] [17]
GPT-6 Sol·Luna의 API ID는 각각 gpt-6-sol, gpt-6-luna예요. API 호출은 사용량에 따라 과금되는 별도 상품이고 ChatGPT 구독료에 토큰이 일정량 포함된다는 의미가 아닙니다. OpenAI는 발표 당시 두 모델을 ChatGPT Work와 Codex에서 제공하고 Chat에는 아직 제공하지 않는다고 안내했어요. 앱의 모델 선택 가능 여부와 요금제 제한은 API 가격표와 분리해 확인해야 해요.[6] GPT-6 Astra의 위치와 선택 기준은 Astra 안내 글을 참고해 주세요.
실제 업무에 넣기 전, 작은 표본으로 비교해요
가상의 예로 고객 문의를 요약해 담당 팀에 넘기는 자동화 도구를 생각해볼게요. 표에서 입력 단가가 낮은 모델을 골라도 문의를 잘못 분류하면 사람이 다시 읽고 고쳐야 해요.
처음부터 큰 실험을 만들 필요는 없어요. 최근 문의에서 개인정보를 지운 20~30개를 뽑고, 각 항목에 기대하는 요약과 담당 부서를 미리 적어 둬요. 이 정도는 초기 후보를 가리는 파일럿이지, 일반적인 정확도를 입증하는 벤치마크는 아니에요. 같은 프롬프트와 출력 형식, 도구 권한으로 모델을 바꿔가며 실행한 뒤, 모델 ID·날짜·설정·입출력 토큰·재시도·도구 호출·사람이 고친 시간을 한 줄씩 기록해요. 결과가 그럴듯한지보다 사전에 정한 기준을 통과했는지를 표시하는 편이 덜 흔들려요.
앞서 든 90만·10만 토큰 예시는 각 요청의 입력이 272K 이하인 여러 호출의 합계예요. 실제로 비교할 때는 토큰·도구 비용 총액을 품질 기준을 통과한 결과 수로 나눠 ‘기준 통과 결과 1건당 비용’을 비교해요. 재시도에 든 비용도 사용 기록에 포함해야 모델별 차이가 드러나요.
작업 종류도 섞지 않는 게 좋아요. 코딩 수정은 같은 저장소와 테스트 명령으로, 정형 데이터 변환은 정답 라벨과 형식 준수 여부로, 긴 문서는 필요한 근거를 빠뜨리지 않는지 따로 확인해요. 한 모델이 전부 잘할 필요는 없어요. 특정 작업에서만 기준을 통과한다면 그 경로에만 쓰면 돼요.
추론 설정의 이름도 함께 적어야 해요. OpenAI의 reasoning 단계, Anthropic의 adaptive/effort, Gemini의 thinking level은 서로 같은 연산량을 나타내는 공통 척도가 아니에요.[18] [15] [17] 화면에 보이는 답변 길이만으로 비용을 판단하면 청구 토큰을 놓칠 수 있어요. Anthropic은 thinking 토큰을 출력 요금에 포함하고, Google도 thinking 토큰을 출력 가격으로 계산한다고 안내해요.[15] [17]
이런 식으로 과제별 결과를 나란히 보면 어떤 모델을 어느 업무에 둘지 판단하기 쉬워져요. 공개 점수와 단가는 출발점으로 삼고, 마지막 선택은 내 업무의 기준 통과율과 결과당 비용을 보고 해보세요.
출처
- [1] Artificial Analysis, GPT-6 Sol and Luna: cost efficiency and evaluation results
- [2] Artificial Analysis, GPT-6 Sol
- [3] Artificial Analysis, GPT-6 Luna
- [4] Artificial Analysis, Claude Opus 5.5 Index
- [5] Artificial Analysis, Gemini 3.8 Flash
- [6] OpenAI, Introducing GPT-6 Sol and Luna
- [7] OpenAI API Pricing
- [8] OpenAI API, GPT-5.6 Sol
- [9] OpenAI API, GPT-5.6 Luna
- [10] Anthropic API pricing
- [11] Google Gemini API pricing
- [12] Google, Gemini latest model reference
- [13] OpenAI API, GPT-6 Sol
- [14] OpenAI API, GPT-6 Luna
- [15] Anthropic, Claude Opus 5.5
- [16] Anthropic, Claude Sonnet 5
- [17] Google, Gemini 3.8 Flash model documentation
- [18] OpenAI reasoning models guide
가격과 모델 정보 확인일: 2026년 9월 23일 (KST).