GPT-6 프롬프트 캐싱 총정리, 에이전트 비용을 줄이는 구조와 함정

GPT-6 시대의 API 비용은 모델 가격표만 보고 계산하기 어렵다. 같은 10만 토큰을 보내더라도 매번 처음부터 처리하면 일반 입력 단가를 반복해서 내지만, 안정적인 앞부분을 프롬프트 캐시에 저장하고 재사용하면 해당 구간의 읽기 비용은 크게 낮아진다. 반대로 캐시할 필요가 없는 내용을 계속 쓰거나 프롬프트 앞부분을 자주 바꾸면 캐시 쓰기 비용만 늘고 재사용 혜택은 사라진다.
OpenAI가 Prompt Cache Diagnostics를 정식 제공한 이유도 여기에 있다. 이제 개발자는 단순히 cached_tokens가 몇 개인지 보는 데서 그치지 않고, 이전 응답과 비교해 어느 지점까지 재사용됐는지와 캐시 미스가 발생한 원인을 확인할 수 있다.
세 줄 요약
- GPT-5.6 이후 모델은 캐시 쓰기에 일반 입력의 1.25배, 캐시 읽기에 0.1배를 적용한다.
- 같은 프롬프트 접두사를 두 번 이상 사용할 가능성이 높다면 캐시가 유리하지만, 한 번만 쓸 내용은 쓰기 비용 때문에 더 비쌀 수 있다.
- 도구 정의, 순서, 출력 스키마, 추론 강도, 대화 압축처럼 프롬프트 앞부분을 바꾸는 요소가 캐시 미스의 핵심 원인이다.
캐시 비용을 정규화해 보면

표의 배수는 특정 모델의 달러 가격이 아니라 일반 입력 단가를 1로 놓은 정규화 값이다. 실제 청구액은 사용 모델, 서비스 등급, 긴 컨텍스트 요율과 지역별 결제 조건에 따라 달라진다.
프롬프트 캐시는 문장을 저장하는 기능이 아니다
OpenAI의 공식 프롬프트 캐싱 문서는 캐시가 프롬프트의 토큰 원문이 아니라 모델이 계산한 중간 상태인 KV 텐서를 보존한다고 설명한다. 다음 요청의 앞부분이 이전 요청과 일치하면 모델은 같은 구간을 다시 계산하는 대신 저장된 상태를 재사용한다.
캐시 대상에는 개발자가 보내는 메시지만 들어가는 것이 아니다. OpenAI가 제공하는 내부 지침, 도구 이름과 설명·스키마·순서, 개발자 메시지, 대화 이력, 텍스트·이미지·문서와 지원되는 오디오까지 모델이 실제로 보는 렌더링된 컨텍스트가 비교 대상이 된다.
따라서 화면에서 프롬프트가 비슷해 보여도 도구 정의가 달라지거나 출력 JSON 스키마가 바뀌면 해당 지점 이후는 같은 접두사로 인정되지 않을 수 있다.
GPT-5.6 이후의 핵심 숫자
GPT-5.6 이후 지원 모델에서 최소 캐시 가능 길이는 사용자에게 보이는 입력 기준 1,024토큰이다. 이 기준보다 짧은 접두사는 캐시 대상으로 사용할 수 없다.
캐시 쓰기는 일반 입력 단가의 1.25배, 읽기는 0.1배다. 안정적인 접두사를 한 번 쓰고 완전히 한 번 재사용하면 1.25 + 0.1, 즉 1.35배가 든다. 같은 내용을 캐시 없이 두 번 처리하는 2배보다 낮다. 한 번 쓰고 아홉 번 재사용하면 2.15배이며, 캐시 없이 열 번 처리하면 10배다.
이 계산은 접두사가 완전히 재사용된 단순 예시다. 요청 뒤에 붙는 새 질문과 새 도구 결과는 일반 입력으로 처리되며, 컨텍스트 일부만 일치하면 재사용되는 구간도 줄어든다.
암시적 캐시와 명시적 캐시
GPT-5.6 이후에는 두 가지 방식이 있다. 암시적 모드에서는 OpenAI가 최신 사용자 메시지나 연속된 도구 결과의 마지막 등 적합한 메시지 끝에 브레이크포인트를 자동으로 둔다. 대부분의 일반적인 다회차 대화에서 시작하기 쉬운 방식이다.
명시적 전용 모드에서는 개발자가 prompt_cache_breakpoint를 넣은 위치만 캐시한다. 브레이크포인트가 하나도 없으면 캐시 쓰기도 일어나지 않는다. 바뀌지 않는 긴 규칙·공통 문서·도구 설명까지만 캐시하고, 사용자별 데이터나 현재 시각처럼 계속 바뀌는 내용은 그 뒤에 두고 일반 입력으로 처리할 수 있다.
한 요청은 최대 4개의 캐시 쓰기를 만들 수 있다. 여러 브레이크포인트를 사용하면 변경 주기가 다른 구간을 따로 보존할 수 있지만, 무조건 많이 넣는 것이 유리한 것은 아니다. 각 지점의 재사용 빈도와 쓰기 비용을 함께 봐야 한다.

캐시 미스를 만드는 대표적인 변경
첫째는 모델 변경이다. 서로 다른 모델은 가중치와 캐싱 방식이 다르므로 같은 프롬프트라도 캐시를 공유한다고 가정하면 안 된다.
둘째는 도구 목록 변경이다. 도구의 이름, 설명, 스키마, 순서와 병렬 호출 설정이 바뀌면 렌더링된 접두사가 달라진다. 특정 요청에서 도구를 쓰지 않을 때 목록을 제거하기보다 tool_choice를 none으로 두면 앞부분을 안정적으로 유지하기 쉽다.
셋째는 출력 형식과 추론 설정이다. Structured Outputs 스키마, reasoning.effort, 응답 상세도는 내부 지침을 바꿀 수 있다. GPT-6 계열에서 대화 도중 추론 강도만 바꾸려면 앞부분을 다시 쓰는 대신 configuration_update 항목을 뒤에 추가하는 방식을 공식 문서가 안내한다.
넷째는 대화 압축이다. 컨텍스트 관리 기능이 이전 대화를 압축된 내용으로 교체하면 바뀐 첫 토큰부터 기존 캐시와 일치하지 않을 수 있다. 압축은 컨텍스트를 줄이는 데 유용하지만 캐시 재사용과는 별도의 비용 관계를 가진다.
다섯째는 매 요청마다 앞에 넣는 동적 값이다. 날짜, 사용자 ID, 세션별 권한이나 현재 상태를 개발자 지침 맨 앞에 넣으면 그 뒤의 긴 공통 문서까지 모두 달라진 것으로 처리될 수 있다. 안정적인 내용은 앞에, 동적 내용은 브레이크포인트 뒤에 두는 편이 낫다.
Prompt Cache Diagnostics가 해주는 일
OpenAI는 2026년 9월 8일 Responses API에서 GPT-5.6 이후 지원 모델용 Prompt Cache Diagnostics를 정식 제공했다. 이전 응답과 현재 요청을 비교해 재사용된 범위, 선택된 브레이크포인트와 미스 이유를 확인하고 해결 안내를 받을 수 있다. OpenAI API 변경 기록
플랫폼의 Prompt Caching Dashboard에서는 기간별 캐시 적중률, 쓰기 한 번당 읽기 횟수, 캐시 읽기·쓰기·일반 입력 토큰의 비중을 볼 수 있다. 진단은 개별 실패 원인을, 대시보드는 전체 운영 추세를 보는 도구다.
prompt_cache_key의 역할도 세대에 따라 다르다. GPT-5.6 이전 모델에서는 관련 요청을 같은 캐시로 라우팅하기 위해 안정적인 키가 중요했다. GPT-5.6 이후에는 OpenAI가 라우팅을 자동 처리하므로 최적화를 위한 필수 키가 아니다. 대신 고객·사용자·워크스페이스별 캐시 사용량을 구분하고 캐시 적중을 통한 정보 추정을 줄이는 회계·격리 용도로 사용할 수 있다.
한국 개발팀의 실전 설계 순서
먼저 실제 요청을 안정 구간, 자주 바뀌는 구간, 매번 새로 생기는 구간으로 나눈다. 공통 안전 규칙, 변하지 않는 제품 설명과 고정 도구 스키마는 안정 구간이다. 고객별 정책, 날짜와 세션 상태는 자주 바뀌는 구간이며, 현재 질문과 최신 도구 결과는 새 구간이다.
그다음 재사용 빈도를 측정한다. 동일 접두사가 한 번만 호출된다면 쓰기 비용을 낼 이유가 없다. 여러 고객이 같은 공통 지침을 쓰거나 하나의 에이전트가 긴 대화에서 같은 도구 목록을 유지한다면 캐시 가치가 커진다.
세 번째로 품질과 비용을 함께 본다. 캐시 적중률을 높이려고 필요한 사용자별 지침을 뒤로 미루면 모델 행동이 달라질 수 있다. 보안과 정확도를 해치는 최적화는 비용 절감이 아니다.
마지막으로 원화 비용은 실제 청구서로 검증한다. 달러 단가 외에 환율, 부가세와 결제 수수료가 반영될 수 있으며, 캐시 입력만이 아니라 출력 토큰과 도구·컨테이너 사용료도 총비용에 들어간다.
자주 묻는 질문
캐시는 자동으로 켜져 있나
지원 모델에서는 기본적으로 프롬프트 캐싱을 사용할 수 있고 암시적 방식이 일반적인 시작점이다. 명시적 전용 모드를 선택하고 브레이크포인트를 넣지 않으면 캐시 쓰기가 일어나지 않는다.
캐시 쓰기는 무조건 비싼가
첫 요청만 보면 일반 입력의 1.25배라 더 비싸다. 그러나 같은 접두사를 완전히 한 번만 재사용해도 1.35배로, 캐시 없이 두 번 처리하는 2배보다 낮아진다.
대화를 이어 가면 항상 캐시가 적중하나
아니다. 세션이 이어져도 모델, 도구, 설정이나 앞부분이 달라지면 적중하지 않을 수 있다. 대화 유지와 캐시 적중은 같은 개념이 아니다.
캐시가 프롬프트 원문을 별도 저장하나
공식 문서는 캐시가 토큰 원문 자체가 아니라 계산된 KV 상태를 저장한다고 설명한다. 다만 데이터 보존과 개인정보 정책은 캐시 설명만으로 판단하지 말고 계정의 데이터 제어 조건을 별도로 확인해야 한다.
결론
GPT-6 계열의 비용을 줄이는 가장 중요한 습관은 싼 모델만 찾는 것이 아니라 재사용 가능한 컨텍스트를 안정적으로 설계하는 것이다. 공통 지침과 도구를 앞에 고정하고, 바뀌는 내용을 뒤로 보내고, 적절한 브레이크포인트와 진단 도구로 실제 적중률을 확인해야 한다.
캐시는 반복 작업에서 큰 비용 차이를 만들지만 무료 할인이 아니다. 쓰기 비용, 재사용 횟수, 캐시 미스, 출력 토큰과 품질까지 합친 작업당 비용으로 판단해야 한다.
출처와 이용 고지
OpenAI, GPT와 관련 명칭·상표는 각 권리자에게 속한다. 이 글은 OpenAI의 후원이나 승인을 받은 공식 콘텐츠가 아니며 2026년 9월 26일 확인한 공식 OpenAI 문서를 자체 문장으로 분석했다. 실제 지원 모델과 요금은 변경될 수 있으므로 적용 전 최신 공식 문서를 확인해야 한다. 본문 이미지는 실제 플랫폼 화면이 아닌 독립 편집 이미지다.



