
Mercury 2.5 chega a 1.107 tokens por segundo
O Mercury 2.5, novo modelo de difusão da Inception, promete gerar 1.107 tokens por segundo em GPUs NVIDIA amplamente disponíveis. Anunciado em 9 de setembro de 2026, segundo o comunicado da empresa, o modelo mira agentes de IA que precisam responder rapidamente em busca, voz, programação e automação. A Inception afirma que houve ganho de 40% em inteligência frente ao Mercury 2, sem abandonar o perfil de baixa latência e custo reduzido.
Na prática, a proposta é encurtar o intervalo entre um pedido e uma resposta útil, inclusive quando o sistema precisa raciocinar, consultar ferramentas e devolver dados estruturados. O Mercury 2.5 traz janela de contexto de 260 mil tokens, raciocínio ajustável, chamadas paralelas de ferramentas e saída JSON alinhada a schema. Ele já pode ser acessado pelo chat e pela API da Inception, além das plataformas Baseten e OpenRouter.
Tabela de conteúdos
O que muda com o Mercury 2.5
A velocidade declarada é o principal diferencial. A Inception posiciona seu diffusion LLM como alternativa para fluxos em que cada etapa acrescenta atraso: planejamento, reescrita de consulta, reranking, resumo de fontes, checagem de respostas e uso de ferramentas. Em aplicações desse tipo, não basta ter boa qualidade; a latência de cada chamada interfere diretamente na experiência final.
- Velocidade: 1.107 tokens por segundo, segundo a Inception.
- Contexto: até 260 mil tokens por requisição.
- Ferramentas: suporte a chamadas paralelas e JSON estruturado.
- Distribuição: API própria, Baseten e OpenRouter.
- Novidades em teste: Mercury Voice e Mercury Router.
O que é um diffusion LLM?
É uma abordagem de modelo de linguagem que a Inception associa a alta taxa de geração, buscando equilibrar qualidade, custo e latência para inferência em produção.
Preço, acesso e condições para desenvolvedores
O preço padrão informado é de US$ 0,20 por milhão de tokens de entrada e US$ 0,75 por milhão de tokens de saída. Durante o lançamento, a companhia anuncia desconto de 80%, reduzindo as tarifas para US$ 0,04 e US$ 0,15, respectivamente. Também são oferecidos 100 milhões de tokens gratuitos na API da Inception. Valores, limites e disponibilidade podem mudar; por isso, desenvolvedores devem confirmar as condições diretamente na documentação antes de integrar o Mercury 2.5.
| Item | Informação anunciada | Impacto esperado |
|---|---|---|
| Entrada | US$ 0,20/milhão; US$ 0,04 na oferta | Menor custo de prompt |
| Saída | US$ 0,75/milhão; US$ 0,15 na oferta | Geração mais acessível |
| Contexto | 260 mil tokens | Mais dados por tarefa |
| Velocidade | 1.107 tokens/segundo | Menor espera percebida |
Casos de uso: busca, voz e programação
A Inception cita busca com baixa latência, agentes de voz e sistemas de código como aplicações prioritárias. No caso da OpenCall, a empresa relata latência mediana próxima de 170 milissegundos em chamadas ao vivo. O P99 teria caído de vários minutos para um segundo, enquanto o P50 passou de 0,4 segundo para menos de 0,2 segundo, incluindo raciocínio. São números fornecidos pelas empresas, não uma auditoria independente.
Já a Augment Code usa Mercury para context compaction, roteamento de modelos e busca de ferramentas MCP. Segundo o material de lançamento, transferir a compactação para o modelo reduziu a latência de cerca de 150 segundos para 27 segundos e o custo em 90%, mantendo a qualidade. Esses ganhos dependem da carga, do prompt, da infraestrutura e da métrica usada em cada implementação.
Mercury Voice e Router entram em preview
Além do modelo principal, a Inception colocou dois produtos em prévia. O Mercury Voice é voltado a agentes de voz e promete tempo até o primeiro token abaixo de 170 milissegundos. O Mercury Router analisa o prompt e direciona a solicitação a modelos abertos ou fechados conforme o equilíbrio necessário entre qualidade, velocidade e custo. Para empresas, a oferta inclui capacidade dedicada, autoscaling, controles de compliance e retenção configurável de dados.
O desempenho divulgado é uma alegação de lançamento: a avaliação mais útil para cada equipe continua sendo testar o Mercury 2.5 com seus próprios prompts, ferramentas e metas de latência.
Como avaliar o modelo antes da adoção
- Compare qualidade e custo em tarefas reais.
- Meça P50, P95 e P99 de latência.
- Teste JSON, ferramentas e falhas de schema.
- Verifique privacidade, retenção e compliance.
Perguntas frequentes sobre o Mercury 2.5
Qual é a velocidade do Mercury 2.5?
A Inception informa 1.107 tokens por segundo. O número se refere ao desempenho anunciado em GPUs NVIDIA amplamente disponíveis e deve ser validado no caso de uso real.
Onde usar a API do Mercury 2.5?
O modelo está no chat e na API da Inception, no Baseten e no OpenRouter. A empresa também anuncia 100 milhões de tokens gratuitos para a API própria.
O Mercury 2.5 serve para agentes de voz?
Sim, a Inception direciona o modelo a sistemas sensíveis à latência. O Mercury Voice, ainda em preview, mira agentes de voz com início de resposta abaixo de 170 ms.
Qual é o contexto do Mercury 2.5?
A janela de contexto anunciada é de 260 mil tokens. Ela pode ajudar tarefas extensas, mas custo, qualidade e latência variam conforme o volume efetivamente processado.
Considerações finais
O Mercury 2.5 reforça a disputa por modelos capazes de atender agentes de IA em tempo quase real. A combinação de 1.107 tokens por segundo, contexto amplo, ferramentas paralelas e preço promocional é relevante, mas precisa ser examinada com benchmarks reproduzíveis. A Inception afirma já treinar um modelo maior; até lá, a decisão de adoção deve considerar qualidade, governança de dados e desempenho ponta a ponta, e não somente a taxa de tokens.
Fontes: comunicado da Inception. Publicação baseada nas informações de lançamento; dados de desempenho são declarações das organizações citadas.
