Como funciona

Como a Hooc roda o DeepSeek V4 Flash.

Infraestrutura própria em GPUs NVIDIA Blackwell. É por isso que a assinatura é fixa: o custo é uma linha reta, não um medidor.

A API por token cobra pelo uso. A assinatura cobra pela capacidade. A diferença entre os dois modelos é a infraestrutura: aqui a Hooc roda as próprias máquinas com GPU, 24 horas por dia. É por isso que o preço pode ser fixo, não importa quantas requisições passem.

Abaixo, mostramos como essa infraestrutura é montada — do hardware aos pesos, da velocidade ao custo.

01

Modelo e hardware, escolhidos juntos

Queríamos a configuração mais poderosa possível pelo menor custo — objetivos que quase sempre brigam entre si. Então a decisão foi dupla: escolher o menor modelo que ainda entregasse qualidade de verdade, e o hardware que conseguíssemos pagar.

O DeepSeek V4 Flash é um modelo mixture-of-experts: 284B de parâmetros no total, mas só 13B ativos por token. É isso que permite rodá-lo em hardware que uma startup consegue pagar. Os pesos publicados já vêm quantizados em MXFP4, um formato de ponto flutuante de 4 bits que mantém a qualidade próxima do original de 16 bits ocupando cerca de um quarto da memória: ~150GB em disco, contra ~570GB em BF16.

O checkpoint quantizado apontou o caminho para a NVIDIA. A linha Blackwell executa MXFP4 nativamente no hardware, e o suporte de software para modelos abertos é o melhor do mercado. Dentro dela, escolhemos a RTX PRO 6000 — na AWS, isso é a instância g7e.24xlarge: quatro GPUs de 96GB cada, 384GB no total, com folga para os pesos e para o serving.

Modelo

DeepSeek V4 Flash

Precisão

MXFP4

GPUs

4x RTX PRO 6000

Instância

AWS g7e.24xlarge

02

Os pesos ficam num S3 regional

Instâncias spot reiniciam com frequência: a AWS recupera a máquina sempre que precisa da capacidade. A cada boot, a máquina precisa de ~150GB de pesos de volta — então onde eles ficam guardados importa muito.

Não deixamos os pesos embutidos na imagem da máquina (isso gera descompasso de versão) nem dependemos de snapshot EBS (que é lento para carregar). Guardamos um release imutável num bucket S3 na mesma região das GPUs. No boot, a instância copia o release para o NVMe local, confere um manifesto e só então sobe o servidor de inferência.

A cópia no NVMe é apenas espaço de trabalho. Se a instância morre, nada se perde: a próxima baixa o mesmo artefato de sempre. Manter o bucket na mesma região faz mais diferença do que parece — um download entre regiões transforma uma troca rápida em uma longa indisponibilidade.

03

Speculative decoding para responder mais rápido

Para respostas rápidas, usamos speculative decoding. Um módulo leve sugere os próximos tokens e o modelo grande confere a sugestão inteira de uma vez, em vez de gerar token por token. Como a maioria dos tokens é previsível, quase tudo é aprovado em lote — e a máquina produz vários tokens por ciclo de GPU.

No DeepSeek V4 usamos o DSpark, o release de speculative decoding da própria DeepSeek: um módulo leve que acompanha os pesos, não um modelo separado. Na nossa configuração, ele é uma única flag:

vllm · speculative config
--speculative-config '{"method":"dspark","num_speculative_tokens":5}'

~300 tok/s

por stream único

~3.000 tok/s

com a fila cheia

~64 sequências

por máquina; o resto espera na fila

04

O KV cache é a parte mais importante

Cada token de uma conversa gera tensores de key e value que o modelo reutiliza em todas as requisições — juntos, eles formam o KV cache. Em produção, ele consome a maior parte da memória da GPU. Se você ignorar isso, o cache vira o gargalo, por mais rápida que seja a GPU.

Sessões longas de agente acumulam resultados de ferramentas, leituras de arquivo e turnos anteriores. Na maioria dos modelos, o cache cresce com cada token do histórico. O design de atenção do V4 resolve isso: o histórico recente é comprimido e consultado de forma esparsa, o antigo é comprimido com muito mais força, e uma janela curta de tokens preserva o detalhe mais recente.

# em nossos workers ao vivo
GPU KV cache size: 2,712,968 tokens
Maximum concurrency for 262,144 tokens per request: 10.35x

Cap no contexto

O modelo aceita até 1M de tokens, mas limitamos cada sessão a 256K. Contexto longo degrada a qualidade e enche o cache — uma ou duas sessões enormes travariam todo mundo.

Quantizar o cache

Usamos o caminho de cache quantizado que a atenção comprimida do V4 suporta. Cada token de histórico ocupa menos memória.

Descarregar caches ociosos

Sessões paradas vão para a CPU e o disco. Um sticky router mantém cada conversa presa à mesma máquina, para a próxima requisição encontrar o cache onde ele está.

05

Pronto para produção

Recuperação de spot, prioridade justa e fallback: os detalhes que fazem o custo fixo não custar caro em confiabilidade.

Endpoint protegido

As GPUs ficam em uma rede interna. Só o nosso backend consegue chegar até a camada de inferência.

Prioridade por assinatura

Requisições de quem paga têm prioridade sobre quem está consumindo em excesso de graça.

Recuperação de spot

Instância encerrada? O auto scaling sobe outra, o boot puxa os pesos e o roteador só manda tráfego depois que o modelo responde healthy.

Fallback de infraestrutura

Quando a capacidade spot some, o tráfego cai em um provedor hospedado para manter o serviço no ar.

06

Quanto isso custa

Sob demanda, uma g7e.24xlarge custa em torno de US$ 12 mil por mês. Em spot, rodamos 24/7 com aproximadamente US$ 4 a 6 mil por mês por máquina.

O número importa menos do que o comportamento do custo. Preço por token cresce com o uso; uma máquina é um custo fixo para um tamanho de frota. Quando mais gente usa, as requisições entram em lote ou na fila — o serviço fica mais lento, não mais caro.

Essa é a troca por trás da sua assinatura: sob pico, a resposta pode demorar um pouco mais. O que não pode acontecer é a fatura crescer a cada requisição.

E na sua conta

E por que isso não muda o seu preço?

Porque você não paga pelos tokens que essa infraestrutura processa. Você paga pela capacidade: R$ 99,90, R$ 179,90 ou R$ 239,90 por mês. Um número só, não importa quantos milhões de tokens os seus agentes consumirem.

Em resumo

Como funciona, em poucas linhas.

  • Modelo e hardware escolhidos juntos: DeepSeek V4 Flash em 4x RTX PRO 6000 Blackwell (AWS g7e.24xlarge).
  • Pesos em um S3 regional, copiados para o NVMe local a cada boot.
  • Speculative decoding (DSpark) para velocidade: ~300 tokens/s por stream.
  • KV cache: cap de contexto, quantização e descarga de caches ociosos — ~2,7M de tokens na GPU.
  • Prioridade para assinantes e fallback de infraestrutura.
  • Custo fixo por máquina: mais usuários significa fila, não fatura maior.

Infraestrutura de verdade. Preço que não muda.

Comece com DeepSeek V4 Flash por uma assinatura mensal previsível.

Começar agora

A partir de R$ 99,90/mês