Anthropic이 2026년 9월 28일 현지시각 Claude Sonnet 5.5를 공개했다. 회사는 이전 Sonnet보다 높아진 벤치마크 점수와 비용 효율을 주요 특징으로 제시했으며, 낮음 또는 중간 노력 설정에서도 Sonnet 5의 최고 점수를 더 적은 과업당 비용으로 넘어설 수 있다고 밝혔다.
API 가격과 제공 경로
Claude Sonnet 5.5의 모델 ID는 claude-sonnet-5-5다. Claude Platform과 AWS, Google Cloud, Microsoft Azure에서 이용할 수 있으며, 데이터 비보존 구성도 지원한다.
API 요금은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러다. 캐시 읽기는 100만 토큰당 0.20달러, 캐시 쓰기는 2.50달러로 책정됐다. VentureBeat는 이 가격이 GPT-6 Sol과 같고, 입력 4달러·출력 20달러인 Opus 5.5보다 낮다고 보도했다.
Anthropic은 “낮음 또는 중간 노력으로 실행한 Sonnet 5.5는 과업당 비용이 대략 10분의 1인 조건에서도 Sonnet 5의 최고 점수를 넘어설 수 있다”고 밝혔다. SiliconANGLE은 이전 세대와 비교해 출력 속도가 30% 빨라졌고 필요한 토큰이 줄어 실제 비용도 약 30% 낮아졌다고 보도했다.
회사 발표 벤치마크와 경쟁 모델
Anthropic 발표에서 Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록해 Sonnet 5의 10.3%와 Opus 5.5의 66.4%보다 높았다. FrontierCode 1.1 Main에서는 Max effort 설정으로 46.2%를 받았다. 이는 Sonnet 5의 42.4%보다 높지만 Opus 5.5의 54.4%와 GPT-6 Sol의 49.3%에는 미치지 못했다.
GDPval-AA v2.1의 회사 발표 점수는 Sonnet 5.5가 1844, Sonnet 5가 1449, Opus 5.5가 1846, GPT-6 Sol이 1487이었다. Humanity’s Last Exam에서는 각각 Sonnet 5.5가 64.5%, Sonnet 5가 54.9%, Opus 5.5가 67.7%였다. OSWorld 2.1에서도 Sonnet 5.5는 80.1%로 Sonnet 5의 57.0%를 웃돌았지만 Opus 5.5의 81.8%보다는 낮았다.
Anthropic이 공개한 표에서 Opus 5.5는 FrontierCode, CursorBench, GDPval-AA, AA-Briefcase, Humanity’s Last Exam에서 Sonnet 5.5보다 높은 점수를 냈다. 회사도 “Opus 5.5는 지속적인 판단이 필요한 복잡하고 개방형인 작업에서 여전히 분명히 더 강하다”고 밝혔다.
독립 평가의 순위와 비용
독립 평가기관 Artificial Analysis는 적응형 추론·최대 노력(Max Effort) 설정으로 평가한 Claude Sonnet 5.5에 Intelligence Index 56점을 부여했다. 전체 216개 모델 가운데 3위로, 중앙값 26보다 높았다. 이 기관이 평가 과정에서 측정한 과업당 비용은 7.60달러였으며, 전체 출력 토큰은 410M이었다. Artificial Analysis는 중앙값 88M과 비교해 이 모델이 “매우 장황하다”고 평가했다.
같은 최대 노력 설정에서 Artificial Analysis가 측정한 출력 속도는 초당 141.9토큰, 추론을 거쳐 첫 토큰이 나오기까지 걸린 시간은 353.32초였다. 속도 순위는 216개 모델 중 28위였다.
Vals AI의 독립 평가에서 Sonnet 5.5는 Vals Index 69.22%±0.96로 66개 모델 가운데 2위였다. Claude Opus 5.5는 69.69%로 0.47포인트 앞섰다. 테스트당 비용은 Sonnet 5.5가 20.80달러, Opus 5.5가 32.77달러였다. 다만 Sonnet 5.5는 CyberBench에서 59.58%로 41개 모델 중 31위, Harvey’s Legal Agent Benchmark에서 2.92%로 70개 모델 중 36위에 머물렀다.
현장 평가와 안전장치
VentureBeat가 인용한 Box 부사장 Yashodha Bhavnani는 Sonnet 5.5가 “2.4배 더 빨랐고 전체 토큰을 12% 적게 사용했다”고 말했다. SiliconANGLE이 인용한 Zendesk AI 담당 이사는 “티켓 처리 속도가 20% 빨라져 고객들이 기다리지 않고 필요한 도움을 받을 수 있었다”고 밝혔다. SiliconANGLE은 이 모델이 스크린샷만 사용해 Pokémon Red를 이긴 첫 Sonnet 모델이라고 보도했다.
Anthropic은 생물학 안전장치가 일부 미생물학·바이러스학 요청을 오류로 차단할 수 있다고 밝혔다. SiliconANGLE은 사이버보안과 생물학, 민감한 콘텐츠에서 안전장치가 작동할 수 있지만 대부분의 소프트웨어 개발과 생명과학 작업은 영향을 받지 않는다고 보도했다.
