OpenAI
Cache de prompts do GPT-6 ganha diagnósticos e pontos de controle
Novas ferramentas ajudam a encontrar falhas no cache e controlar o contexto reutilizado por agentes de longa duração.

A OpenAI atualizou o cache de prompts do GPT-6 com taxas de acerto maiores por padrão, um painel para acompanhar a reutilização e diagnósticos que explicam por que uma requisição não usou o cache. Também é possível definir pontos explícitos nos prefixos dos prompts.
As mudanças são voltadas a agentes que fazem muitas chamadas relacionadas à API e enviam repetidamente as mesmas instruções, ferramentas e contexto. Segundo a OpenAI, entradas em cache podem receber descontos de até 90%, tornando o comportamento do cache relevante para o custo de agentes em produção.
A parte da conta de um agente que dá para projetar
O guia de cache diz que a reutilização exige um prefixo compartilhado exatamente igual e configurações compatíveis. Para GPT-5.6 e posteriores, são necessários pelo menos 1.024 tokens de entrada elegíveis. Um bloco estável de instruções e definições de ferramentas pode ser armazenado; o contexto que muda com frequência deve vir depois. Pontos explícitos permitem escolher onde termina o prefixo reutilizável.
Há uma troca de custos. Para esses modelos, a OpenAI documenta a escrita em cache a 1,25 vez o preço da entrada sem cache e a leitura a 0,1 vez. Se o prefixo será usado uma vez só, gravá-lo não compensa. Reutilizado ao longo de uma sessão extensa, pode compensar. O guia de diagnósticos permite comparar requisições e investigar diferenças nas ferramentas ou configurações quando um acerto esperado não acontece.
Meça antes de comemorar
O anúncio traz exemplos de economia de clientes, mas são cargas de trabalho específicas. Acompanhe taxa de acerto, tokens escritos no cache, latência e custo total em conversas representativas. Um ID de sessão sozinho não garante acerto. Se a estrutura do prompt muda a cada turno, o cache não salva uma arquitetura instável.
Fontes e leituras complementares
Conteúdos relacionados
- NotíciasGitHub Copilot ganha novos modelos e mais controle sobre agentesA atualização traz mais opções de modelos, sandbox local e novidades no VS Code, JetBrains, Slack e Teams.
- NotíciasOpenAI leva GPT-6 Sol e Luna ao trabalho cotidiano com IAOs novos modelos buscam tornar programação e agentes mais rápidos e acessíveis na API e no Codex.
- NotíciasRevisão de código do Copilot ganha controles pessoais e corporativosÉ possível ajustar revisões automáticas e esforço de análise; empresas podem definir um padrão para seus repositórios.
Comentários
Dúvidas, correções ou sua própria visão são todas bem-vindas. Entre com o GitHub para participar.