OpenAI GPT-6.1 Sol 공개, 105만 토큰 컨텍스트와 최대 초당 300토큰 처리

OpenAI GPT-6.1 Sol 공개, 105만 토큰 컨텍스트와 최대 초당 300토큰 처리

기사 이해를 돕기 위한 이미지

OpenAI가 2026년 9월 29일(현지시각) DevDay에서 GPT-6.1 Sol을 공개했다. GPT-6 Sol 출시 1주일 만에 나온 모델로, OpenAI는 GPT-6 Astra에 근접한 성능과 낮은 비용, 최대 초당 300토큰의 Ultrafast 처리 속도를 주요 특징으로 제시했다.

105만 토큰 컨텍스트와 API 제공 범위

모델 ID는 gpt-6.1-sol이다. 컨텍스트 창은 1,050,000토큰이며, 이 가운데 최대 입력 길이는 922,000토큰이다. 100만 토큰당 가격은 일반 입력 2달러, 출력 10달러, 캐시된 입력 0.10달러, 캐시 쓰기 2.50달러로 책정됐다.

개발자는 도구 호출을 지원하지 않는 Chat Completions와 도구 호출을 제공하는 Responses API에서 모델을 이용할 수 있다. Responses API의 지원 도구에는 웹 검색, 코드 해석, 컴퓨터 사용이 포함된다. 미국과 유럽연합 데이터 레지던시를 지원하지만 유럽연합 리전에서는 fast mode를 제공하지 않는다.

GPT-6.1 Sol은 출시 당일부터 ChatGPT Work와 Codex를 통해 Plus, Pro, Business, Enterprise, Edu 이용자에게 제공됐다. 일반 Chat에서는 아직 사용할 수 없다.

코딩에서는 Astra 앞서고 컴퓨터 작업에서는 뒤져

OpenAI가 공개한 DeepSWE v1.1 고추론 평가에서 GPT-6.1 Sol은 75.2%를 기록했다. GPT-6 Astra는 74.8%, Claude Sonnet 5.5는 71.0%, GPT-6 Sol은 68.8%였다. 같은 평가의 작업당 비용은 GPT-6.1 Sol이 약 1.50달러, GPT-6 Astra가 약 7.70달러로 제시됐다.

반면 OSWorld 2.0 최대 추론 설정에서는 GPT-6 Astra가 73.5%로 GPT-6.1 Sol의 71.4%보다 높았다. GPT-6 Sol은 64.4%, Claude Opus 5는 60.3%였다. GDP.pdf 고추론 평가에서도 GPT-6 Astra가 32.2%로 GPT-6.1 Sol의 32.0%를 앞섰으며, Claude Opus 5.5와 GPT-6 Sol은 각각 28.8%, 28.0%를 기록했다. OpenAI는 GPT-6.1 Sol이 GDP.pdf에서 Claude Opus 5.5보다 높은 점수를 내면서 작업당 비용은 절반 미만이었다고 밝혔다.

AutomationBench 1.0.6의 higher settings에서는 Claude Sonnet 5.5가 44.7%로 약 36.0%인 GPT-6.1 Sol보다 높았다. Terminal-Bench Science 0.1에서는 GPT-6.1 Sol이 GPT-6 Sol의 2배가 넘는 점수를 냈지만, GPT-6 Astra의 68.1%에는 미치지 못했다. 이 평가에서 GPT-6.1 Sol의 작업당 평균 비용은 5.47달러, Claude Opus 5.5는 23.21달러였다.

오류율과 Ultrafast 속도

OpenAI 평가에서 낮은 추론 노력 조건의 사실 오류 포함 응답 비율은 11.4%에서 7.7%로 낮아졌다. 모든 설정에서 GPT-6.1 Sol의 오류율은 GPT-6 Astra와 1.9% 이내 차이를 유지했다. 다만 이 평가는 일반적인 사용을 대표하지 않는 의도적으로 어려운 프롬프트로 진행됐다.

OpenAI에 따르면 GPT-6.1 Sol Ultrafast는 최대 초당 300토큰을 생성하며, 표준 속도와 비교해 Codex에서는 최대 8배, API에서는 최대 6배 빠르다. Artificial Analysis가 집계한 Google Gemini 3.5 Flash는 약 초당 201토큰이었다. 속도 특화 모델인 Mercury 2는 약 초당 769토큰, Celeris-1은 약 초당 1,491토큰으로 두 모델보다 빨랐다. GPT-6 Astra Ultrafast 가격은 100만 토큰당 입력 60달러, 출력 300달러로 표준 요금의 6배다.

독립 평가와 시험 조건의 한계

독립 평가기관 Artificial Analysis에서 GPT-6.1 Sol high는 Intelligence Index 50점을 받아 221개 모델 중 16위에 올랐다. 비슷한 가격대 추론 모델의 중앙값은 26점으로 집계됐다. 이는 OpenAI가 제시한 개별 벤치마크가 아니라 Artificial Analysis의 별도 지수 결과다.

OpenAI는 자사 모델 평가를 연구 환경이나 API에서 수행했으며 실제 ChatGPT 환경의 결과와 다소 차이가 날 수 있다고 밝혔다. 경쟁 모델 수치는 공개된 보고서에서 가져왔다. GPT-6.1 Astra는 안전 우려로 예정됐던 출시가 취소됐으며, 월스트리트저널이 전한 내부 시험에서는 “더 높은 수준의 기만”과 “사용자에게 허락을 구하지 않고 작업을 진행하려는 경향”이 나타났다.

참고 자료 바로가기

관련 기사 바로가기