Claude Sonnet 5.5와 Opus 5.5 무엇을 선택할까

Sonnet 5.5의 API 가격은 입력 100만 토큰당 2달러 출력 10달러 캐시 읽기 0.20달러다. Opus 5.5의 입력 가격은 4달러 출력은 20달러로 공개돼 있다. 이 글은 확인된 사실, 발표 주체의 주장, 아직 검증되지 않은 부분을 분리해 실제 의사결정에 필요한 기준을 정리한다.
한 줄 결론 반복 가능한 일상 업무는 Sonnet 판단 비용이 큰 일은 Opus
Sonnet 5.5는 잘 정의된 코딩, 버그 수정, 문서·슬라이드·스프레드시트 제작과 빠른 반복에 맞춘 모델이다. Opus 5.5는 요구가 모호하고 긴 맥락에서 우선순위를 바꾸며 복잡한 판단을 이어가야 할 때 선택할 이유가 크다.
최고 점수 한 개로 고르지 않는다. 호출량, 응답 지연, 검토 인건비와 틀렸을 때 생기는 손실을 합친 작업당 총비용으로 비교해야 한다.
가격표는 Sonnet이 정확히 절반이지만 그것이 전부는 아니다
공개 가격에서 Sonnet 5.5는 입력 100만 토큰당 2달러, 출력 10달러다. Opus 5.5는 각각 4달러와 20달러다. 캐시 읽기는 둘 다 0.20달러지만 캐시 쓰기는 Sonnet 2.50달러, Opus 5달러다.
같은 토큰 수라면 Sonnet이 유리하다. 하지만 재시도와 사람 수정이 늘면 격차가 줄 수 있고, Opus가 한 번에 올바른 설계를 만들면 비싼 토큰이 더 싸게 끝날 수도 있다.

30퍼센트 빠르다는 말은 Sonnet 5와의 비교다
Anthropic은 Sonnet 5.5가 이전 Sonnet 5보다 출력을 30퍼센트 이상 빠르게 생성한다고 밝힌다. Opus 5.5보다 항상 30퍼센트 빠르다는 문장이 아니며, 네트워크 지연과 도구 실행 시간까지 포함한 전체 업무 시간과도 다르다.
실제 서비스에서는 첫 토큰 시간, 초당 출력, 도구 대기, 동시성 제한과 긴 맥락 처리 시간을 따로 측정한다. 체감 속도는 모델 외부 병목에서 결정될 수 있다.
최대 30퍼센트 비용 절감은 토큰 가격 인하가 아니다
Sonnet 5.5의 토큰 단가는 Sonnet 5와 같다. Anthropic이 말한 최대 30퍼센트의 작업당 절감은 같은 일을 더 적은 토큰으로 끝냈다는 내부 측정에서 나온다.
프롬프트 길이, 도구 결과, 추론 노력 설정이 다르면 절감률도 달라진다. 예산 모델에는 최대치를 고정값으로 넣지 말고 자신의 대표 작업 50개 이상으로 평균과 상위 비용을 측정한다.
Terminal-Bench 70.6과 10.3은 큰 변화지만 조건을 읽어야 한다
Sonnet 5.5는 Terminal-Bench 4.0에서 70.6퍼센트, Sonnet 5는 10.3퍼센트로 보고됐다. 명령줄에서 긴 다단계 업무를 수행하는 에이전트 코딩 평가라는 점에서 개선 신호는 강하다.
하지만 모델, 노력 수준, 하네스와 비용 예산이 결과에 영향을 준다. Opus 5.5의 66.4퍼센트는 Xhigh 노력의 최고 점수라는 각주도 있다. 다른 설정의 숫자를 단순 서열로 만들면 안 된다.

GDPval-AA는 거의 같아도 열린 판단은 Opus가 강하다는 설명
공개 표에서 Sonnet 5.5의 GDPval-AA v2.1 점수는 1844, Opus 5.5는 1846으로 2점 차이다. 지식업무 평가에서 Sonnet이 가까이 왔다는 신호다.
Anthropic은 자체 시험과 외부 테스터 경험에서 복잡하고 열린 문제, 지속적인 판단에는 Opus가 여전히 뚜렷하게 강하다고 덧붙였다. 평균 점수는 긴 꼬리 실패나 모호한 목표 조정을 충분히 보여 주지 못할 수 있다.
벤치마크 버그와 노력 설정은 반드시 기록한다
Anthropic은 사전 배포된 Sonnet 5.5의 구조화 출력 버그가 일부 지식업무 점수를 낮췄을 수 있고 이후 수정됐다고 밝혔다. FrontierCode에서는 Max 노력이 코드 리뷰 하위 에이전트를 더 자주 불러 시간 초과나 범위 밖 수정을 만들어 Xhigh보다 낮아지는 사례도 설명했다.
더 많은 추론이 항상 더 높은 점수를 만들지는 않는다. 생산 평가에서는 모델 ID, 날짜, 노력 수준, 도구 버전과 시간 제한을 함께 저장해야 재현할 수 있다.
Sonnet 5.5가 맞는 네 가지 업무
대량 고객 응답 초안, 잘 정의된 버그 수정, 일정한 형식의 분석 보고서, 반복적인 문서·슬라이드·스프레드시트 제작은 Sonnet 후보가 된다. 빠른 상호작용이 사용자 경험에 직접 영향을 주는 제품에도 유리하다.
입력과 기대 출력, 허용 도구와 완료 조건을 명확히 만들 수 있을수록 Sonnet의 가격·속도 이점을 얻기 쉽다. 자동 검사와 샘플 사람 검토를 붙여 규모를 키운다.

Opus 5.5를 먼저 시험할 네 가지 업무
여러 이해관계가 충돌하는 전략, 큰 코드베이스의 구조 변경, 불완전한 증거를 엮는 조사, 높은 실패 비용이 있는 장기 에이전트 작업은 Opus를 먼저 시험할 가치가 있다.
다만 Opus라는 이름만으로 승인 단계를 없애서는 안 된다. 법률·의료·보안·재무 결정은 전문가 검토와 도구 권한 통제가 별도로 필요하다.
가장 실용적인 운영은 라우팅과 승격이다
기본 요청은 Sonnet으로 처리하고 불확실성, 반복 실패, 큰 변경 범위 또는 높은 위험을 감지하면 Opus로 승격한다. 초안은 Sonnet, 최종 비평은 Opus처럼 역할을 나눌 수도 있다.
라우터 자체가 틀릴 수 있으므로 승격 기준을 로그로 남긴다. 사용자가 수동으로 고급 검토를 요청할 통로와 예산 상한도 제공해야 한다.

14일 평가표로 자기 업무의 답을 구한다
대표 업무 50개를 고르고 정답률, 수정 시간, 지연, 입력·출력 토큰, 도구 실패, 재시도와 치명적 오류를 14일간 기록한다. 같은 프롬프트와 데이터로 두 모델을 번갈아 시험한다.
평균만 보지 말고 최악의 10퍼센트와 실패 복구 비용을 본다. Sonnet이 충분한 품질을 안정적으로 내면 기본값으로, Opus가 큰 실패를 의미 있게 줄이면 해당 작업만 승격하는 방식이 합리적이다.
저작권·상표 및 이미지 고지
회사명과 제품명은 각 권리자의 상표일 수 있다. 별도 표시가 없는 시각 자료는 AI로 생성한 개념 배경 또는 자체 제작한 편집 디자인·정보 그래픽이다. 인용문이나 외부 자산을 사용하는 경우 해당 위치 또는 출처 목록에 저작자·출처·이용 조건을 표시한다.
출처와 앞으로 확인할 사항
아래 링크는 사실 확인에 사용한 1차·공식 자료다. 링크는 출처이며 이미지나 문장을 전재했다는 뜻이 아니다.



