Se você usa agentes de IA para programar, provavelmente já tentou economizar usando um modelo mais barato, escrevendo prompts menores ou simplesmente reduzindo o número total de tokens. Tudo isso pode ajudar, mas nenhuma dessas métricas, sozinha, diz quanto uma tarefa realmente vai custar.

Uma requisição com 100 mil tokens pode custar menos que outra com 20 mil. Um modelo mais caro por token pode terminar uma tarefa gastando menos dinheiro. E uma Rule que adiciona tokens em todas as requisições pode, no fim das contas, reduzir seu custo total.

Parece contraditório, mas o motivo é simples: tokens não têm todos o mesmo custo, e o número total de tokens não conta a história inteira.

A composição da requisição importa. Contexto que pode ser reutilizado, informação nova que precisa ser processada e conteúdo gerado pelo modelo têm impactos diferentes no custo. Por isso, duas execuções com a mesma quantidade total de tokens podem terminar com custos completamente diferentes.

E existe outra variável ainda mais importante: quantas execuções foram necessárias para chegar ao resultado.