Anthropic, Claude Sonnet 5.5 공개…모델 ID claude-sonnet-5-5

Anthropic, Claude Sonnet 5.5 공개…모델 ID claude-sonnet-5-5

기사 이해를 돕기 위한 이미지

Anthropic이 2026년 9월 28일 현지시각 Claude Sonnet 5.5를 공개했다. 회사는 이전 Sonnet보다 높아진 벤치마크 점수와 비용 효율을 주요 특징으로 제시했으며, 낮음 또는 중간 노력 설정에서도 Sonnet 5의 최고 점수를 더 적은 과업당 비용으로 넘어설 수 있다고 밝혔다.

API 가격과 제공 경로

Claude Sonnet 5.5의 모델 ID는 claude-sonnet-5-5다. Claude Platform과 AWS, Google Cloud, Microsoft Azure에서 이용할 수 있으며, 데이터 비보존 구성도 지원한다.

API 요금은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러다. 캐시 읽기는 100만 토큰당 0.20달러, 캐시 쓰기는 2.50달러로 책정됐다. VentureBeat는 이 가격이 GPT-6 Sol과 같고, 입력 4달러·출력 20달러인 Opus 5.5보다 낮다고 보도했다.

Anthropic은 “낮음 또는 중간 노력으로 실행한 Sonnet 5.5는 과업당 비용이 대략 10분의 1인 조건에서도 Sonnet 5의 최고 점수를 넘어설 수 있다”고 밝혔다. SiliconANGLE은 이전 세대와 비교해 출력 속도가 30% 빨라졌고 필요한 토큰이 줄어 실제 비용도 약 30% 낮아졌다고 보도했다.

회사 발표 벤치마크와 경쟁 모델

Anthropic 발표에서 Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록해 Sonnet 5의 10.3%와 Opus 5.5의 66.4%보다 높았다. FrontierCode 1.1 Main에서는 Max effort 설정으로 46.2%를 받았다. 이는 Sonnet 5의 42.4%보다 높지만 Opus 5.5의 54.4%와 GPT-6 Sol의 49.3%에는 미치지 못했다.

GDPval-AA v2.1의 회사 발표 점수는 Sonnet 5.5가 1844, Sonnet 5가 1449, Opus 5.5가 1846, GPT-6 Sol이 1487이었다. Humanity’s Last Exam에서는 각각 Sonnet 5.5가 64.5%, Sonnet 5가 54.9%, Opus 5.5가 67.7%였다. OSWorld 2.1에서도 Sonnet 5.5는 80.1%로 Sonnet 5의 57.0%를 웃돌았지만 Opus 5.5의 81.8%보다는 낮았다.

Anthropic이 공개한 표에서 Opus 5.5는 FrontierCode, CursorBench, GDPval-AA, AA-Briefcase, Humanity’s Last Exam에서 Sonnet 5.5보다 높은 점수를 냈다. 회사도 “Opus 5.5는 지속적인 판단이 필요한 복잡하고 개방형인 작업에서 여전히 분명히 더 강하다”고 밝혔다.

독립 평가의 순위와 비용

독립 평가기관 Artificial Analysis는 적응형 추론·최대 노력(Max Effort) 설정으로 평가한 Claude Sonnet 5.5에 Intelligence Index 56점을 부여했다. 전체 216개 모델 가운데 3위로, 중앙값 26보다 높았다. 이 기관이 평가 과정에서 측정한 과업당 비용은 7.60달러였으며, 전체 출력 토큰은 410M이었다. Artificial Analysis는 중앙값 88M과 비교해 이 모델이 “매우 장황하다”고 평가했다.

같은 최대 노력 설정에서 Artificial Analysis가 측정한 출력 속도는 초당 141.9토큰, 추론을 거쳐 첫 토큰이 나오기까지 걸린 시간은 353.32초였다. 속도 순위는 216개 모델 중 28위였다.

Vals AI의 독립 평가에서 Sonnet 5.5는 Vals Index 69.22%±0.96로 66개 모델 가운데 2위였다. Claude Opus 5.5는 69.69%로 0.47포인트 앞섰다. 테스트당 비용은 Sonnet 5.5가 20.80달러, Opus 5.5가 32.77달러였다. 다만 Sonnet 5.5는 CyberBench에서 59.58%로 41개 모델 중 31위, Harvey’s Legal Agent Benchmark에서 2.92%로 70개 모델 중 36위에 머물렀다.

현장 평가와 안전장치

VentureBeat가 인용한 Box 부사장 Yashodha Bhavnani는 Sonnet 5.5가 “2.4배 더 빨랐고 전체 토큰을 12% 적게 사용했다”고 말했다. SiliconANGLE이 인용한 Zendesk AI 담당 이사는 “티켓 처리 속도가 20% 빨라져 고객들이 기다리지 않고 필요한 도움을 받을 수 있었다”고 밝혔다. SiliconANGLE은 이 모델이 스크린샷만 사용해 Pokémon Red를 이긴 첫 Sonnet 모델이라고 보도했다.

Anthropic은 생물학 안전장치가 일부 미생물학·바이러스학 요청을 오류로 차단할 수 있다고 밝혔다. SiliconANGLE은 사이버보안과 생물학, 민감한 콘텐츠에서 안전장치가 작동할 수 있지만 대부분의 소프트웨어 개발과 생명과학 작업은 영향을 받지 않는다고 보도했다.

참고 자료 바로가기

관련 기사 바로가기

같은 분야 최신 기사