O DeepSeek V4, lançado em versão estável em 24 de julho, trouxe uma mudança que passou despercebida por boa parte do mercado: preço dobrado em dois horários de pico por dia — 9h-12h e 14h-18h, horário de Pequim (01h-04h e 06h-10h UTC). Fora desses períodos, o preço segue as tarifas normais do V4 Pro (US$ 0,435 por milhão de tokens de entrada, US$ 0,87 de saída) e do V4 Flash (US$ 0,14 de entrada, US$ 0,28 de saída).
O que mudou
Segundo reportagens do TheRouter.ai e da KuCoin, a DeepSeek passou a cobrar o dobro do valor padrão durante os horários de maior demanda em Pequim, e mantém a tarifa normal fora desses horários. A empresa avisa os clientes por e-mail com 24 horas de antecedência sobre qualquer mudança de tarifa.
Por que isso importa
Para quem roda cargas de trabalho de IA que não precisam de resposta instantânea — processamento em lote, geração de relatórios, treinamento de agentes, análise de grandes volumes de dados — o horário em que a chamada é feita agora afeta diretamente o custo. Empresas que ignoram esse detalhe pagam até o dobro sem necessidade.
O impacto para o Brasil
Aqui está o detalhe que faz diferença para empresas brasileiras: os horários de pico de Pequim caem, no horário de Brasília, entre 22h e 1h e entre 3h e 7h da manhã — ou seja, fora do expediente comercial no Brasil. Na prática, uma empresa brasileira que roda suas cargas de IA em lote durante o horário comercial (8h às 18h, horário de Brasília) já está, quase sempre, dentro da janela de preço mais barato do DeepSeek — sem precisar fazer nada. Vale confirmar os horários exatos na documentação oficial antes de depender disso operacionalmente, já que tarifas podem mudar.
Leitura da Entercast
Esse é um exemplo concreto de como economia de custo em IA não vem só de escolher o modelo certo — vem também de entender a arquitetura de preço do fornecedor e desenhar a operação em torno dela. Empresas que tratam custo de IA como uma variável de engenharia, não só de contrato, encontram esse tipo de economia estrutural que reduz o custo de rodar IA em escala sem abrir mão de capacidade.