Anthropic Claude Haiku 5.5 공개와 장문 요청 구간별 요금

Anthropic Claude Haiku 5.5 공개와 장문 요청 구간별 요금

기사 이해를 돕기 위한 이미지

Anthropic이 2026년 10월 7일(현지시각) Claude Haiku 5.5를 공개하고 Claude Platform과 Amazon Web Services, Google Cloud, Microsoft Azure에서 바로 쓸 수 있게 했다. 10만 토큰 이하 프롬프트 기준 입력 요금은 100만 토큰당 0.10달러다.

성능 평가 결과

Artificial Analysis는 Anthropic과 관계없는 독립 평가기관이다. 이 기관의 Intelligence Index에서 최대 노력(Max effort)으로 설정한 Claude Haiku 5.5는 43점을 받아 180개 모델 가운데 2위에 올랐다. 가격대가 비슷한 모델들의 중앙값은 13이었다. 같은 조건에서 측정한 출력 속도는 초당 240.4토큰으로 180개 중 9위, 작업당 비용은 0.21달러로 46위였다. 점검 시점까지 LMArena, Vals AI, SWE-bench, Aider는 Claude Haiku 5.5 결과를 내놓지 않았다.

Anthropic이 공개한 표에 따르면 Haiku 5.5의 OSWorld 2.1 점수는 72.4%다. 같은 평가에서 Haiku 4.5는 15.7%, GPT-6 Luna는 48.9%, Claude Sonnet 5.5는 83.9%였다. GDPval-AA v2.1에서는 Haiku 5.5가 1620점을 받았고 Haiku 4.5는 735점, GPT-6 Luna는 1437점, Sonnet 5.5는 1840점이었다. AA-Briefcase v1.1 점수는 Haiku 5.5 1578점, Haiku 4.5 614점, GPT-6 Luna 1336점, Sonnet 5.5 1824점이다. 이 표에는 OSWorld, GDPval-AA, Humanity’s Last Exam에서 시험한 조절 가능한 노력 설정(Low, Med, High, Xhigh, Max)도 함께 실렸다.

Humanity’s Last Exam을 도구 없이 풀었을 때 Haiku 5.5의 점수는 45.9%였고, 도구를 쓰자 57.4%로 올랐다. Haiku 4.5는 각각 10.2%와 18.7%, Sonnet 5.5는 56.9%와 64.5%였다. 도구를 쓰지 않은 Chartography에서는 Haiku 5.5가 46.4%를 기록했다. Haiku 4.5는 6.4%, GPT-6 Luna는 29.1%, Sonnet 5.5는 61.6%였다.

Terminal-Bench 4.0에서 Haiku 5.5는 최대 노력일 때 39.2%를 받았고, 중간 노력에서는 약 20%에 머물렀다. 이 평가에서 Haiku 4.5는 0.0%, GPT-6 Luna는 16.4%, Sonnet 5.5는 70.6%였다. FrontierCode 1.1 (Main)에서는 Haiku 5.5 46.4%, GPT-6 Luna 42.4%, Sonnet 5.5 52.1%였고 Haiku 4.5 수치는 나와 있지 않다. Anthropic이 표에 실은 모든 평가에서 Sonnet 5.5가 Haiku 5.5보다 높은 점수를 받았다.

Haiku 5.5를 미리 써 본 기업들도 자체 시험 결과를 내놓았다. Box는 지연 시간이 Haiku 4.5의 절반 정도인데도 점수가 11점 높았다고 밝혔다. HubSpot은 CRM 작업을 세 번 돌린 평균이 92.8%였다고 전했다. Asana는 지연 시간이 30% 넘게 줄었고, 에이전트 턴 하나당 추론 속도가 최대 2.5배 빨라졌다고 했다.

장문 프롬프트 요금과 토큰 사용량

요금은 프롬프트 길이 10만 토큰을 기준으로 두 구간으로 나뉜다. 100만 토큰당 입력 요금은 10만 토큰 이하에서 0.10달러, 10만 토큰을 넘으면 0.50달러다. 출력 요금은 0.50달러와 2.50달러다. 캐시 읽기는 0.01달러와 0.05달러, 캐시 쓰기는 0.125달러와 0.625달러로 정해졌다. OpenAI GPT-6 Luna의 요금은 캐시를 포함해 Haiku 5.5의 하위 구간 요금 네 가지와 모두 같다.

토크나이저가 새로 바뀌어 Haiku 5.5는 같은 작업에 Haiku 4.5보다 토큰을 조금 더 쓴다. Anthropic 발표 페이지는 증가 폭을 수치로 밝히지 않았다. 반면 Claude Platform 문서는 같은 입력 텍스트가 Haiku 4.5보다 약 30% 많은 토큰으로 나뉜다고 적었다. Anthropic은 요청 크기와 토크나이저 변경을 모두 감안해도 Haiku 4.5보다 워크로드 실행 비용이 약 75% 적게 든다고 설명했다. 캐시를 적용할 수 있는 최소 프롬프트 길이는 Haiku 4.5의 4,096토큰에서 512토큰으로 줄었다.

속도와 적합한 용도

Anthropic은 Haiku 5.5를 두고 “각 모델의 표준 속도 기준으로 지금까지 가장 빠른 모델”이라고 했다. 다만 Fast Mode로 실행한 Opus 모델보다는 느리다고 덧붙였다. 회사는 Haiku 5.5가 복잡한 에이전트형 코딩보다 범위가 좁게 정해진 작업에 가장 알맞다고 밝혔다.

개발 환경과 API 변경 사항

Claude API에서 쓰는 모델 ID는 claude-haiku-5-5다. 컨텍스트 창은 Haiku 4.5의 200k에서 1M 토큰으로 커졌고, 최대 출력도 64k에서 128k 토큰으로 늘었다. Haiku 4.5와 달리 Haiku 5.5에서는 budget_tokens로 확장 사고를 직접 지정하거나, temperature·top_p·top_k 같은 샘플링 파라미터를 바꾸거나, 어시스턴트 메시지를 미리 채우면(prefill) 오류가 난다.

Amazon Bedrock에서는 global.anthropic.claude-haiku-5-5라는 모델 ID를 쓴다. bedrock-runtime으로 US, EU, AU, JP, Global CRIS 추론 프로필에서 쓸 수 있고, AWS GovCloud (US)에서는 bedrock-runtime과 bedrock-mantle로 이용할 수 있다. Amazon Bedrock에서는 Haiku 5.5의 구조화 출력을 쓸 수 없다.

안전 조치와 시스템 카드

사이버보안 안전장치에 대해 Anthropic은 “Haiku 4.5보다 엄격하지만, 최근 다른 모델들에 적용한 것보다는 다소 덜 엄격하다”고 밝혔다. 침투 테스트 요청은 지금도 막혀 있다. Haiku 5.5 시스템 카드에는 의도가 분명하지 않은 상황에서 이 모델이 Haiku 4.5보다 자살 유서 작성을 더 자주 도왔다는 내용이 담겼다. Anthropic 행동 감사에서는 Haiku 5.5가 다른 어떤 모델보다 과도하게 거부한 경우가 많았다.

참고 자료 바로가기

관련 기사 바로가기