GPT-6 Sol·Luna 출시 분석—반값 API, 벤치마크와 X 첫 반응

OpenAI가 2026년 9월 22일 GPT-6 Sol과 GPT-6 Luna를 발표했다. GPT-6 Astra가 가장 어려운 종단간 작업을 맡는 최상위 모델이라면, Sol은 복잡한 코딩과 에이전트 업무, Luna는 대량 처리와 비용 민감 업무를 겨냥한다. 두 모델의 가장 큰 변화는 무조건 더 높은 최고점보다 Astra 세대의 기능을 훨씬 낮은 단가로 공급한다는 데 있다.
출시 메시지만 보면 단순한 세대교체처럼 보이지만 결과는 더 복잡하다. OpenAI의 공식 벤치마크에서는 Sol이 여러 에이전트 평가에서 강한 성적을 냈다. 반면 Artificial Analysis의 독립 시험에서는 Sol의 전체 지능·코딩 지수가 GPT-5.6 Sol과 비슷했고, Luna의 일부 코딩 점수와 두 모델의 지식업무 산출물 평가는 후퇴했다. 가격은 분명히 낮아졌지만, 모든 업무가 자동으로 더 좋아졌다고 결론 내릴 수는 없다.
세 줄 요약
- Sol은 복잡한 코딩·컴퓨터 사용·다단계 에이전트 작업의 비용 효율을, Luna는 반복적 대량 처리의 매우 낮은 단가를 목표로 한다.
- 두 모델 모두 105만 토큰 컨텍스트와 12만 8천 토큰 최대 출력을 제공하지만, 입력이 27만 2천 토큰을 넘으면 전체 요청에 장문 할증이 붙는다.
- 공식 수치와 독립 평가를 함께 보면 핵심은 압도적인 전면 성능 향상보다
작업당 비용 감소다. 실제 도입 전에는 성공률·재시도·사람 검토까지 포함한 자체 평가가 필요하다.
Astra·Sol·Luna의 역할은 어떻게 다른가

가격은 100만 토큰당 Standard 처리 기준이며, 표의 독립 평가 비용은 API 가격표가 아니라 Artificial Analysis의 자체 평가 작업당 측정치다. 둘을 같은 단위로 오해하면 안 된다.
GPT-6 Astra는 정확도 실패의 대가가 크고 최고 수준의 추론이 필요한 업무에 남는다. Sol은 코딩 에이전트, 복합 조사, 컴퓨터 사용, 여러 도구를 순서대로 호출하는 워크플로에서 성능과 비용의 균형을 노린다. Luna는 분류, 추출, 짧은 초안, 대규모 후보 생성처럼 한 건의 실패 비용이 낮고 검증을 자동화하기 쉬운 작업에 어울린다.
세 모델 모두 같은 입력을 기계적으로 나누는 방식보다 업무 위험과 복잡도에 따라 라우팅하는 편이 합리적이다. Luna로 후보를 만들고 규칙으로 검증한 뒤, 불확실한 사례를 Sol로 보내며, 중요한 최종 판단만 Astra나 사람에게 올리는 구조가 한 예다.

공식 사양: 같은 105만 토큰, 크게 다른 가격
GPT-6 Sol 공식 모델 문서는 gpt-6-sol을 복잡한 코딩과 에이전트 워크플로용 모델로 설명한다. 추론 강도는 none, low, medium, high, xhigh, max를 지원하며 기본값은 medium이다. 컨텍스트 창은 1,050,000토큰, 최대 출력은 128,000토큰, 지식 기준일은 2026년 4월 20일이다.
Standard API 가격은 100만 토큰 기준 입력 2달러, 캐시 입력 0.20달러, 캐시 쓰기 2.50달러, 출력 10달러다. 텍스트와 이미지를 입력받고 텍스트를 출력하며, 오디오와 비디오는 직접 지원하지 않는다.
GPT-6 Luna 공식 모델 문서는 gpt-6-luna를 집중형·대량·비용 민감 작업용으로 분류한다. 추론 강도와 1,050,000토큰 컨텍스트, 128,000토큰 최대 출력은 Sol과 같고 지식 기준일은 2026년 5월 18일이다. 가격은 입력 0.10달러, 캐시 입력 0.01달러, 캐시 쓰기 0.125달러, 출력 0.50달러다.
Sol과 Luna는 웹 검색, 파일 검색, 이미지 생성, 코드 인터프리터, hosted shell, apply patch, Skills, computer use, MCP, tool search, 함수 호출과 구조화 출력을 지원한다. 파인튜닝은 지원하지 않는다. 도구 목록이 같다고 같은 작업에서 같은 성공률을 보장하는 것은 아니다. 모델이 도구를 언제 선택하고 실패 뒤 어떻게 복구하는지는 별도로 시험해야 한다.
27만 2천 토큰을 넘기면 왜 계산이 달라지나
두 모델은 105만 토큰을 받을 수 있지만, 긴 컨텍스트를 정가로 끝까지 쓸 수 있다는 뜻은 아니다. 입력이 272K 토큰을 초과하면 전체 요청의 입력과 캐시 가격이 2배, 출력 가격이 1.5배가 된다. 임계점을 넘은 토큰에만 추가 요금이 붙는 방식이 아니다.
예를 들어 Sol 요청이 272K를 조금 넘었다면 입력 단가는 100만 토큰당 2달러에서 4달러로, 출력 단가는 10달러에서 15달러로 계산된다. Luna도 같은 배수가 적용된다. 긴 문서 묶음을 한 번에 넣는 것이 검색·요약·캐시 재사용으로 나누는 것보다 비싸질 수 있다.
지역 처리는 제공 지역에서 10% 할증된다. Batch와 Flex는 Standard 가격의 50%, Fast는 해당 가격의 2배다. EU 데이터 레지던시는 Standard processing에서만 가능하다. 따라서 모델 이름만 고르는 것이 아니라 처리 등급, 컨텍스트 길이, 캐시 적중률까지 비용 설계에 포함해야 한다.
OpenAI 공식 벤치마크가 보여 주는 강점
OpenAI의 Sol·Luna 발표에서 가장 눈에 띄는 수치는 에이전트와 컴퓨터 사용 영역이다.
- AutomationBench에서 GPT-6 Sol xhigh는 33.2%, 작업당 비용 0.27달러를 기록했다. OpenAI가 제시한 GPT-6 Astra low는 30.3%이며 Sol보다 3.9배 비쌌고, Claude Opus 5 max는 26.9%이며 11.1배 비쌌다.
- Agents’ Last Exam에서 Sol max는 56.4%를 기록했다. OpenAI는 Claude Opus 5의 최고 결과보다 높은 동시에 작업당 비용이 60% 낮다고 설명했다.
- DeepSWE v1.1에서 Sol max는 68.8%, Luna max는 66.6%였다. 발표 자료가 함께 제시한 Claude Fable 5 최고점은 69.9%다.
- OSWorld 2.0 offline에서 Sol xhigh는 60.5%, Claude Opus 5 medium은 60.3%였다.
- OpenAI 내부 사실성 평가에서 Sol은 GPT-5.6 Sol보다 오류가 약 절반이었다.
마지막 사실성 수치는 특히 조건을 봐야 한다. 일반적인 사용 요청을 대표하는 표본이 아니라 오류를 유발하도록 고른 대화 표본이다. 유용한 스트레스 테스트지만 전체 이용자의 평균 오류율이나 한국어 정확도를 뜻하지 않는다. 다른 회사 모델과의 비교도 추론 강도, 도구, 시간 제한, 가격 산정 방식이 같을 때만 직접 비교할 수 있다.
독립 평가는 더 낮은 비용과 엇갈린 품질을 함께 보여 준다
Artificial Analysis의 독립 분석은 비용 효율 개선에는 동의하지만, 전면적인 성능 도약으로 보지는 않았다.
Artificial Analysis Intelligence Index의 작업당 비용은 GPT-6 Sol max가 1.06달러로 GPT-5.6 Sol max의 1.99달러보다 낮았다. GPT-6 Luna max는 0.07달러로 GPT-5.6 Luna max의 0.18달러보다 낮았다. Sol의 작업당 출력은 29K에서 31K토큰, Luna는 41K에서 51K토큰으로 오히려 늘었다. 짧게 답해서 싸진 것이 아니라 주로 단가 인하의 효과라는 뜻이다.
Coding Agent Index에서 Sol max는 57점으로 전대의 55점보다 올랐지만, Luna max는 41점으로 전대의 43점보다 내려갔다. Sol의 Terminal-Bench 4.0은 37%에서 43%, SWE-Atlas-QnA는 54%에서 58%로 개선됐다. Luna의 SWE-Atlas-QnA는 49%에서 44%, DeepSWE v1.1은 66%에서 64%로 낮아졌다.
AutomationBench-AA에서는 Sol이 60%에서 62%, Luna가 50%에서 53%로 올랐다. 그러나 GDPval-AA v2.1에서는 Sol이 약 100 Elo, Luna가 약 75 Elo 하락했고, AA-Briefcase v1.1에서는 Luna가 약 45 Elo 내려갔다. Artificial Analysis는 일부 실패가 추론 자체보다 요구된 산출물과 평가 항목을 빠뜨리는 표현 품질 문제에서 왔다고 설명했다. 보고서·프레젠테이션·문서 제작을 즉시 전환하기 전에 형식 준수와 누락률을 따로 봐야 하는 이유다.
환각률이 줄었다는 말을 정확히 읽는 법
AA-Omniscience에서 Sol의 환각률은 92%에서 60%, Luna는 93%에서 77%로 내려갔다. 숫자만 보면 큰 정확도 향상처럼 보이지만 Sol의 답변 시도율도 99%에서 83%로 낮아졌고, 정확도는 59%에서 54%로 내려갔다.
즉 Sol은 모르는 문제에서 틀린 답을 만드는 대신 답변을 보류하는 경향이 커졌다. 위험한 추측이 줄어든 것은 긍정적이지만 더 적게 틀렸다와 더 많이 맞혔다는 같은 말이 아니다. 실제 서비스에서는 정답률, 보류율, 잘못된 확신, 재시도와 사람 검토 비율을 함께 측정해야 한다.

X 반응: 공급자 주장과 외부 평가를 분리해야 한다
OpenAI 공식 X 게시물은 Astra의 발전을 더 빠르고 저렴한 Sol·Luna로 확장하고, GPT-5.6 프로모션 가격보다 토큰 단가를 50% 낮췄다고 강조했다. 이는 제품의 공식 위치와 가격 변화에 대한 1차 자료지만, 독립 품질 검증은 아니다.
Sam Altman의 게시물은 지능·정렬·업무 산출물·코딩·컴퓨터 사용의 개선과 함께 “토큰당 절반 가격, 작업당 비용은 그보다 더 낮다”는 점을 강조했다. 이 주장은 회사 경영자의 출시 설명으로 읽어야 한다. 실제 업무 비용은 재시도와 사람 검토를 포함해 확인해야 한다.
Tibo Sottiaux의 게시물은 상위 모델의 능력을 활용해 효율성과 접근성을 높였다는 개발 방향을 설명한다. OpenAI 직원의 전략 해설로는 의미가 있지만 외부 사용자의 독립 후기는 아니다.
반대로 Artificial Analysis의 X 요약은 비용 효율 프런티어가 개선됐지만 전체 지능·코딩 지수는 GPT-5.6 계열과 대체로 비슷하며, 평가별로 개선과 후퇴가 섞였다고 정리했다.
Perplexity CEO Aravind Srinivas의 게시물은 자사 WANDR 평가에서 Sol이 Opus 5 대비 5분의 1 가격이었다고 밝혔다. Perplexity에서 Sol을 Light effort 오케스트레이터, Astra를 High effort 오케스트레이터로 사용한다는 설명은 실제 제품 라우팅 사례로 볼 수 있다. 다만 WANDR는 Perplexity의 자체 평가이므로 범용 독립 벤치마크처럼 확대하면 안 된다.
출시 당일 개인 반응은 엇갈렸다. 일부는 Luna가 전 세대보다 크게 좋아졌다고 평가했고, 일부는 Sol의 품질이 기대보다 낮지만 가격 인하가 약점을 보완한다고 봤다. 이런 짧은 첫인상은 프롬프트, 추론 강도, 도구와 계정 환경이 공개되지 않은 경우가 많아 방향성 참고 자료에 가깝다.
한국 이용자가 먼저 확인할 것
출시 시점 기준 Sol과 Luna는 ChatGPT Work, Codex와 API에 제공된다. Plus·Pro·Business·Enterprise·Edu 이용자는 Work와 Codex에서 접근할 수 있고, Free·Go 이용자는 데스크톱 앱에서 Luna에 접근할 수 있다. 일반 Chat에는 아직 제공되지 않으며 단계적 배포라 계정마다 노출 시점이 다를 수 있다.
ChatGPT 구독 한도와 API 사용료는 별개다. Plus나 Pro를 구독한다고 API 토큰이 포함되는 것은 아니며, Codex 사용량도 API 가격표만으로 계산할 수 없다. 한국에서 API를 결제할 때는 원화 환율, 부가세와 카드사의 해외 결제 수수료가 실제 비용에 추가될 수 있다.
한국어 품질도 영어 중심 벤치마크에서 자동으로 결론 내릴 수 없다. 존댓말 유지, 한영 혼합 문서, 국내 법령과 기관명, 한국식 표·보고서 형식, 긴 문서의 누락률을 별도로 평가해야 한다. 특히 Luna에 대량 한국어 문서를 맡길 때는 샘플링 검수와 자동 규칙 검사를 함께 두는 편이 안전하다.
어떤 모델을 고를까
- Astra: 실패 비용이 매우 크고 최고 난도의 장기 계획·복합 의사결정이 필요한 작업
- Sol: 복잡한 코딩, 도구 사용, 컴퓨터 조작, 다단계 조사에서 품질과 비용을 함께 관리할 작업
- Luna: 분류·추출·짧은 초안·후보 생성처럼 대량 처리하며 결과를 자동 검증할 수 있는 작업
모델 단가가 아니라 완성된 결과 한 건의 비용으로 비교해야 한다. 호출 비용 + 실패한 실행 + 재시도 + 사람 검토 + 지연 비용을 합치면 싼 모델이 더 비싸질 수도 있고, 반대로 검증 가능한 대량 작업에서는 Luna가 큰 차이를 만들 수 있다.
결론
GPT-6 Sol과 Luna는 Astra를 대체하는 모델이 아니다. 같은 세대의 기능을 서로 다른 비용·속도·업무 위험에 맞춰 나눈 모델이다. Sol은 복잡한 에이전트 작업의 작업당 비용을 낮추고, Luna는 대량 반복 작업의 단가를 크게 내린다.
공식 벤치마크는 Sol의 에이전트와 컴퓨터 사용 능력을 강하게 보여 주지만, 독립 평가는 일부 지식업무와 Luna 코딩 성능의 후퇴를 함께 드러낸다. 환각률 감소도 답변 보류 증가와 정확도 하락을 같이 봐야 한다. 따라서 가장 현실적인 도입 방법은 전면 교체가 아니라 업무별 라우팅과 자체 평가다.
출처와 이용 고지
- OpenAI, GPT-6 Sol과 Luna 공식 발표
- OpenAI API, GPT-6 Sol 모델 문서
- OpenAI API, GPT-6 Luna 모델 문서
- OpenAI API, 전체 모델 카탈로그
- Artificial Analysis, GPT-6 Sol·Luna 독립 평가
- OpenAI 공식 X 발표
- Sam Altman의 X 게시물
- Tibo Sottiaux의 X 게시물
- Artificial Analysis의 X 요약
- Aravind Srinivas의 Perplexity 관련 X 게시물
OpenAI, ChatGPT, GPT, Codex와 관련 상표는 각 권리자에게 속한다. 이 글은 OpenAI의 후원이나 승인을 받은 공식 콘텐츠가 아니다. 공식 발표의 사양과 벤치마크, Artificial Analysis의 독립 측정, 회사 관계자와 이용자의 X 반응을 서로 구분해 자체 문장으로 분석했다. 공식 차트·제품 화면·X 스크린샷·제3자 사진은 복제하지 않았다.



