OpenAI가 2026년 9월 22일(현지시각) GPT-6 Sol과 GPT-6 Luna를 공개했다. 회사는 두 모델에 GPT-6 Astra와 유사한 훈련 방식을 적용해 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬 분야의 개선점을 더 빠르고 저렴한 모델로 옮겼다고 밝혔다. GPT-6 Sol은 복잡한 코딩 작업, GPT-6 Luna는 사무 업무와 요약, 정보 추출에 각각 초점을 맞춘 모델로 소개됐다.
API 가격 인하와 이용 경로
GPT-6 Sol의 API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러다. OpenAI는 이를 GPT-5.6 판촉 가격보다 50% 낮은 수준이라고 설명했다. GPT-6 Luna는 입력 가격이 100만 토큰당 0.20달러에서 0.10달러로, 출력 가격은 1.20달러에서 0.50달러로 내려갔다. API 모델 ID는 각각 gpt-6-sol과 gpt-6-luna이며 발표 당일부터 이용할 수 있다.
두 모델은 Plus, Pro, Business, Enterprise, Edu 이용자를 대상으로 발표 당일부터 ChatGPT Work와 Codex에 제공된다. Free와 Go 이용자는 데스크톱 앱에서 GPT-6 Luna를 사용할 수 있다. 다만 MacRumors는 출시 시점에 두 모델이 “아직 Chat 모드에서는 제공되지 않는다”고 보도했다.
GitHub는 두 모델을 VS Code, Visual Studio, Copilot CLI, 클라우드 에이전트, Copilot 앱, github.com, GitHub Mobile, JetBrains, Xcode, Eclipse의 GitHub Copilot에 순차적으로 배포한다. Sol은 Copilot Pro+, Max, Business, Enterprise에서, Luna는 Pro, Pro+, Max, Business, Enterprise에서 제공된다.
OpenAI가 공개한 성능 수치
OpenAI 발표 기준으로 GPT-6 Sol은 xhigh effort의 AutomationBench에서 작업당 0.27달러의 비용으로 33.2%를 기록했다. Agents’ Last Exam에서는 max effort로 56.4%를 얻었다. DeepSWE v1.1의 max effort 점수는 Sol 68.8%, Luna 66.6%였다. 같은 DeepSWE v1.1 평가에서 Claude Fable 5는 xhigh effort로 69.9%를 기록해 max effort의 GPT-6 Sol보다 높았다.
회사는 OSWorld 2.0 offline에서 xhigh effort의 GPT-6 Sol이 60.5%, medium effort의 Claude Opus 5가 60.3%를 기록했다며 “GPT-6 Sol은 작업당 비용이 약 80% 낮은 가운데 Claude Opus 5와 비슷한 점수를 냈다”고 밝혔다. OpenAI는 또 “max 설정의 GPT-6 Luna는 비용이 10분의 1이면서 medium 설정의 GPT-5.6 Sol을 넘어설 수 있다”고 설명했다.
OpenAI는 내부 사실성 평가에서 Sol의 오류가 GPT-5.6 Sol보다 “약 절반”이라고 주장했다. 이 평가는 비식별 처리한 실제 대화를 이용했으며 제3자 검증 결과는 발표에 포함되지 않았다. 회사는 “오류를 유발하는 이 대화들은 사실 오류가 더 드문 일반적인 사용을 대표하지 않는다”고 밝혔고, 에이전트·코딩 평가에 대해서도 “의도적으로 어려운 상황을 시험하며 일반적인 사용의 실패율을 측정하지 않는다”고 제한점을 명시했다.
독립 평가에서 엇갈린 변화
독립 평가기관 Artificial Analysis의 Coding Agent Index에서 max 설정의 GPT-6 Sol은 57점으로 GPT-5.6 Sol의 55점보다 높았지만, GPT-6 Luna는 41점으로 GPT-5.6 Luna의 43점보다 낮았다. AA-Omniscience Index에서는 Sol이 22점에서 27점으로, Luna가 -10점에서 1점으로 올랐다. 이 지수에서 측정한 환각률은 Sol이 92%에서 60%로, Luna가 93%에서 77%로 낮아졌다.
Terminal-Bench 4.0에서는 Sol이 40%에서 44%, Luna가 12%에서 13%로 상승했다. AutomationBench-AA도 Sol이 60%에서 62%, Luna가 50%에서 53%로 올랐다. 반면 GDPval-AA v2.1에서는 Sol이 약 100 Elo, Luna가 약 75 Elo 하락했고, AA-Briefcase v1.1에서는 Luna가 약 45 Elo 내려간 가운데 Sol은 같은 수준을 유지했다.
Artificial Analysis는 GDPval-AA와 AA-Briefcase의 하락에 대해 “기반 역량의 손실이 아니라 표현 품질 저하와 평가 기준 요소가 빠진 결과물” 때문이라고 분석했다. 이 기관의 집계에서 max 설정의 작업당 비용은 Sol이 1.06달러로 대략 절반이 됐고 Luna는 0.07달러로 약 60% 줄었지만, 종합 Intelligence Index는 Sol이 1점 상승하고 Luna는 변하지 않았다.
같은 날 나온 경쟁 모델
Anthropic은 OpenAI의 GPT-6 Sol·Luna 발표보다 약 90분 앞서 Claude Opus 5.5를 공개했다. MacRumors는 같은 날 출시된 Claude Opus 5.5가 일부 코딩 및 지식 업무에서 GPT-6 Astra보다 높은 성능을 보인다고 전했으며, 이 차이로 모델 간 작업당 비용을 직접 비교하기가 복잡해졌다고 보도했다.
공개된 결과에는 GPT-6 Sol이 이전 세대보다 높아진 독립 코딩 지표와 비용 감소뿐 아니라 GPT-6 Luna의 Coding Agent Index 하락, 두 모델의 GDPval-AA 후퇴도 함께 포함됐다. 회사 발표의 DeepSWE v1.1에서도 Claude Fable 5의 최고 점수 69.9%가 GPT-6 Sol의 68.8%를 웃돌았다.
