Calculadora de Custo de Tokens LLM Grátis
Calcule os custos da API para GPT-4o, Claude, Llama, Gemini e mais.
O que é uma calculadora de custo de tokens LLM?
Uma calculadora de custo de tokens LLM é uma ferramenta online gratuita que ajuda a estimar o custo da API para executar prompts em grandes modelos de linguagem com base na contagem de tokens e nos preços do modelo. Ela funciona inteiramente no seu navegador — sem registro, sem aplicativo e nenhum dado é enviado para um servidor.
Uma calculadora de custo de tokens LLM estima as despesas de API para grandes modelos de linguagem, incluindo GPT-4o, GPT-4o Mini, Claude 3.5 Sonnet, Claude Opus, Claude Haiku, Llama 3.1 70B, Gemini 1.5 Pro, DeepSeek V3 e Mistral Large.
Como funciona
Custo de entrada = (tokens de entrada / 1.000.000) × preço de entrada por 1M. Custo de saída = (tokens de saída / 1.000.000) × preço de saída por 1M. Total = custo de entrada + custo de saída.
Quando usar uma calculadora de custo de tokens LLM
Ao orçar uma nova aplicação de IA ou chatbot. Ao decidir entre o GPT-4o e um modelo mais barato para o seu caso de uso. Ao otimizar o uso atual de LLM para reduzir custos.
Por exemplo, um chatbot de atendimento ao cliente com 10.000 conversas por mês, cada uma com 2.000 tokens de entrada e 500 de saída usando GPT-4o, custaria cerca de US$ 55 mensais para entrada e US$ 50 para saída — mais de US$ 100 por mês só com IA. Mudar para GPT-4o Mini reduziria isso para cerca de US$ 5. Saber esses números antes de construir é a diferença entre um produto sustentável e uma surpresa na conta da AWS.
Erros comuns ao estimar custos de LLM
O erro mais caro que vejo desenvolvedores cometerem é esquecer de contabilizar os tokens de saída separadamente dos tokens de entrada. Tokens de saída são tipicamente 3-5x mais caros que os de entrada, e um modelo verboso como GPT-4o pode gerar 2.000+ tokens de saída em uma única solicitação se não for limitado. Sempre defina limites max_tokens nas suas chamadas de API. O segundo erro é subestimar o tamanho do prompt — prompts de sistema, exemplos few-shot e documentos recuperados se acumulam rápido. Um prompt de sistema de 10.000 tokens repetido em 100.000 solicitações mensais é 1 bilhão de tokens de entrada. Terceiro, muitos desenvolvedores ignoram os descontos de cache oferecidos por provedores como Anthropic e OpenAI. Um prompt bem estruturado pode reduzir os custos de entrada em 50% ou mais.
Outra omissão: assumir que seu padrão de uso corresponderá aos exemplos da página de preços. A maioria dos provedores mostra preços por milhão de tokens, mas aplicações reais raramente atingem esses números redondos. Um chatbot com 1.500 solicitações diárias e prompts de comprimento médio pode usar facilmente 50-100 milhões de tokens por mês. Calcule os números reais para seu uso esperado antes de se comprometer com um modelo.
Como usar esta calculadora
- Selecione seu modelo — Escolha entre GPT-4o, Claude 3.5, Llama 3.1 ou Gemini 1.5 para carregar os preços atuais.
- Insira as contagens de tokens — Insira o número estimado de tokens de entrada e saída por pedido.
- Estime o volume — Insira quantos pedidos você espera por mês para ver seu orçamento total projetado.
Perguntas frequentes
Quanto custa o GPT-4o por milhão de tokens?
Em meados de 2025, a OpenAI cobra US$ 2,50 por 1 milhão de tokens de entrada e US$ 10,00 por 1 milhão de tokens de saída para o GPT-4o. Isso é significativamente mais barato que o modelo GPT-4 Turbo anterior. Para necessidades de alto volume, o GPT-4o mini é muito mais acessível, a US$ 0,15/US$ 0,60 por milhão de tokens.
Qual é a diferença entre tokens de entrada e saída?
Tokens de entrada (prompt) são o texto que você envia para o modelo. Tokens de saída (completion) são o texto que o modelo gera em resposta. Os tokens de saída são geralmente 3 a 5 vezes mais caros que os de entrada, pois a geração de texto é computacionalmente mais intensiva para o provedor.
Quantos tokens tem uma página de texto?
Uma página típica de texto com espaçamento simples contém aproximadamente 500-750 palavras, o que se traduz em cerca de 650-1.000 tokens para texto em inglês (assumindo 1,3 tokens por palavra). Para código ou dados complexos, a contagem de tokens pode ser maior.
O Claude 3.5 Sonnet custa menos que o GPT-4o?
O Claude 3.5 Sonnet e o GPT-4o têm preços semelhantes. O Claude 3.5 Sonnet custa US$ 3,00/entrada e US$ 15,00/saída por 1 milhão de tokens, enquanto o GPT-4o custa US$ 2,50/entrada e US$ 10,00/saída. O Claude oferece benchmarks de inteligência superiores em algumas áreas, enquanto o GPT-4o permanece ligeiramente mais barato para tarefas com muita saída de texto.
Existem APIs de LLM gratuitas disponíveis?
Muitos provedores oferecem um nível gratuito com limites de uso. O Google Gemini 1.5 Flash tem um nível gratuito generoso para desenvolvedores. Você também pode executar modelos como Llama 3.1 ou Mistral localmente de graça usando ferramentas como Ollama, embora precise do seu próprio hardware. Esta calculadora foca nos custos de API na nuvem 'pague pelo que usar'.
Como os tokens em cache afetam o custo?
Alguns provedores (como Anthropic e OpenAI) oferecem descontos para cache de prompts. O cache permite que você pague menos por tokens de entrada que são repetidos em várias solicitações (como prompts de sistema longos ou documentos de referência). A economia pode chegar a 50-90% para a parte do prompt armazenada em cache.