Claude Opus 5.5 공개: 성능은 올리고 비용은 40% 낮췄다
출처: Anthropic
원문: https://www.anthropic.com/claude-opus-5-5
작성자: 팔복소프트-김팔복
한눈에 보기
- Anthropic이 2026년 9월 22일 Claude 5.5 계열의 첫 모델인 Claude Opus 5.5를 공개했습니다.
- 대부분의 작업에서 상위 모델 Fable 5.1 수준의 성능을 내면서, 일반적인 워크로드 기준 비용은 Opus 5보다 40% 낮다는 것이 Anthropic의 설명입니다.
- 입력·출력 토큰 단가는 20%, 캐시 읽기 단가는 60% 내렸고 출력 속도는 30% 이상 빨라졌습니다.
- 에이전트 코딩과 지식 업무 벤치마크 대부분에서 1위지만, 일부 항목에서는 OpenAI의 GPT-6 Astra가 앞섭니다.
- 사이버보안·생물학 관련 요청에는 Fable 5.1급 안전장치가 적용되고, 대부분의 보안 작업은 Opus 4.8로 자동 전환됩니다.
- thinking 모드는 끌 수 없고, 2026년 8월 31일 이후 생성된 API 계정에는 preserved thinking이 적용됩니다.
- Claude Platform(
claude-opus-5-5)과 AWS, Google Cloud, Azure에서 바로 쓸 수 있습니다.
배경
Claude 라인업은 Haiku, Sonnet, Opus 위에 최상위 Mythos 계층(일반 공개용은 Fable)이 있는 구조입니다. Opus는 "실무에서 쓸 수 있는 최고 성능" 자리를 맡아 왔는데, 에이전트 작업이 길어지면서 토큰 비용이 가장 큰 도입 장벽이었습니다. 이번 발표는 Anthropic CEO가 AI 개발 속도 조절(pacing)을 주장한 직후 나온 첫 모델이라, 성능만큼 안전장치 설명에 분량을 많이 할애했습니다.
주요 내용
가격: 단가와 토큰 사용량을 함께 줄였다
| 100만 토큰당 | Opus 5.5 | Opus 5 |
|---|---|---|
| 입력 | $4 | $5 |
| 출력 | $20 | $25 |
| 캐시 읽기 | $0.20 | $0.50 |
| 캐시 쓰기 | $5 | $6.25 |
40% 절감은 단가 인하에 작업당 토큰 사용량 감소가 더해진 결과입니다. Anthropic은 에이전트·코딩 작업 비용의 대부분이 캐시 읽기에서 나온다고 설명하는데, 그래서 캐시 읽기 인하 폭이 가장 큽니다. 속도가 중요하면 Claude Code와 Claude Platform에서 최대 2.5배 빠른 Fast mode(입력 $8, 출력 $40)를 쓸 수 있습니다.
벤치마크: 대부분 앞서지만 전부는 아니다
| 항목 | Opus 5.5 | Opus 5 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 48.0% | 53.3% |
| GDPval-AA v2.1 (Elo) | 1846 | 1708 | 1542 |
| AutomationBench | 40.0% | 26.9% | 41.4% |
| Terminal-Bench-Science 0.1 | 58.7% | 29.0% | 64.6% |
비즈니스 워크플로와 과학 연구 에이전트 항목에서는 GPT-6 Astra가 앞섭니다. Anthropic 스스로도 이 수준에서는 벤치마크 격차가 실제 체감 차이를 잘 보여주지 못한다고 인정했습니다. 기본 effort(추론에 쓰는 노력 수준)인 medium만으로도 경쟁 모델 최고 설정과 비슷한 점수를 훨씬 적은 비용으로 낸다는 점을 더 강조합니다.
코딩 사례
Anthropic이 소개한 사례는 대형 작업에 집중돼 있습니다. 68만 줄 코드 마이그레이션을 하루 안에 끝냈고, 20만 줄 코드베이스 감사·수정은 Opus 5가 20시간 넘게 걸린 작업을 3시간 안에 마쳤습니다. 내부 테스트에서는 HAProxy를 C에서 Rust로 옮기는 작업을 Fable 5.1보다 빠르게(9.5시간 대 12시간), 51% 적은 비용으로 끝냈습니다.
안전장치와 API 동작 변화
- 사이버보안: 일반적인 버그 수정은 가능하지만 대부분의 보안 작업은 Opus 4.8로 전환됩니다. 보안 실무자용 Cyber Verification Program은 몇 주 안에 Opus 5.5로 확대됩니다.
- 생물학: Fable 5.1과 같은 제한이 적용되며, 검증된 기관은 Life Sciences Verification Program에 신청할 수 있습니다.
- preserved thinking: 이전 컨텍스트를 편집해 추론 과정을 빼내는 증류(distillation) 공격을 막는 장치로, 신규 API 계정에 적용됩니다.
- 정렬 평가: 약 2,000개 시나리오 감사에서 역대 최고 점수를 받았고, 격리 경계를 우회하려는 시도는 Opus 5보다 약 85% 줄었습니다. 다만 모델이 평가 중임을 눈치채는 경우가 많아 실제 환경 행동을 완전히 예측하기는 어렵다고 Anthropic이 직접 밝혔습니다.
구독자에게는 Pro, Max, Team, 좌석 기반 Enterprise의 5시간 사용 한도가 늘어나고, 원하는 때 쓸 수 있는 rate limit 리셋이 제공됩니다.
팔복소프트 관점
- 체감될 변화는 성능보다 비용입니다. 에이전트 코딩 비용 때문에 Sonnet으로 내려 쓰던 팀이라면 Opus를 다시 검토할 근거가 생겼습니다. 다만 40%는 "기본 설정, 일반 워크로드" 기준이라, 자기 팀의 사용 로그로 직접 계산해 봐야 합니다.
- 레거시 전환 수요와 잘 맞습니다. 국내 SI·공공 현장에는 오래된 Java/JSP, 전자정부 프레임워크 기반 시스템 전환 수요가 많습니다. 하지만 원문 사례는 모두 영어권 코드베이스이고, 한국어 주석이나 문서 품질은 다루지 않았습니다. 이 부분은 직접 검증이 필요합니다.
- 보안팀은 주의해야 합니다. 취약점 분석이나 모의해킹에 Opus 5를 쓰던 팀은 요청이 Opus 4.8로 넘어가면서 결과 품질이 달라질 수 있습니다. 어떤 모델이 실제로 응답했는지 로깅해 두고, Verification Program의 국내 조직 신청 요건도 미리 확인하세요.
- API 연동은 점검이 필요합니다. thinking을 끌 수 없어서, 단순 분류·추출에 Opus를 쓰던 곳은 지연 시간과 토큰이 늘 수 있습니다. 이런 작업은 곧 나올 Sonnet 5.5나 Haiku 5.5를 기다리는 편이 낫습니다. 프록시나 자체 컨텍스트 압축 로직이 이전 응답을 가공한다면 preserved thinking 때문에 신규 계정에서 동작이 깨질 수 있습니다.
- 벤치마크 수치는 대부분 Anthropic 자체 측정입니다. 멀티 모델 라우팅을 쓰는 팀이라면 업무 자동화처럼 GPT-6 Astra가 앞선 영역은 따로 비교해 보는 것이 맞습니다.
정리
Opus 5를 쓰고 있다면 모델 ID를 교체하고 회귀 테스트를 거친 뒤 전환하는 것이 합리적입니다. 새로 도입을 검토하는 팀은 몇 주 안에 나올 Sonnet 5.5와 함께 비교하면 됩니다. 기억할 점은 두 가지입니다. 가격표보다 작업당 총 토큰으로 비용을 봐야 한다는 것, 그리고 보안·생물학 영역에서는 요청이 다른 모델로 조용히 넘어갈 수 있다는 것입니다.
- Claude
- Anthropic
- LLM
- AI 에이전트
- AI 코딩
아직 댓글이 없습니다.