NoticiasInteligência ArtificialTecnologia

Mercury 2.5 chega a 1.107 tokens por segundo

O Mercury 2.5, novo modelo de difusão da Inception, promete gerar 1.107 tokens por segundo em GPUs NVIDIA amplamente disponíveis. Anunciado em 9 de setembro de 2026, segundo o comunicado da empresa, o modelo mira agentes de IA que precisam responder rapidamente em busca, voz, programação e automação. A Inception afirma que houve ganho de 40% em inteligência frente ao Mercury 2, sem abandonar o perfil de baixa latência e custo reduzido.

Na prática, a proposta é encurtar o intervalo entre um pedido e uma resposta útil, inclusive quando o sistema precisa raciocinar, consultar ferramentas e devolver dados estruturados. O Mercury 2.5 traz janela de contexto de 260 mil tokens, raciocínio ajustável, chamadas paralelas de ferramentas e saída JSON alinhada a schema. Ele já pode ser acessado pelo chat e pela API da Inception, além das plataformas Baseten e OpenRouter.

O que muda com o Mercury 2.5

A velocidade declarada é o principal diferencial. A Inception posiciona seu diffusion LLM como alternativa para fluxos em que cada etapa acrescenta atraso: planejamento, reescrita de consulta, reranking, resumo de fontes, checagem de respostas e uso de ferramentas. Em aplicações desse tipo, não basta ter boa qualidade; a latência de cada chamada interfere diretamente na experiência final.

PUBLICIDADE
  • Velocidade: 1.107 tokens por segundo, segundo a Inception.
  • Contexto: até 260 mil tokens por requisição.
  • Ferramentas: suporte a chamadas paralelas e JSON estruturado.
  • Distribuição: API própria, Baseten e OpenRouter.
  • Novidades em teste: Mercury Voice e Mercury Router.

O que é um diffusion LLM?

É uma abordagem de modelo de linguagem que a Inception associa a alta taxa de geração, buscando equilibrar qualidade, custo e latência para inferência em produção.

Preço, acesso e condições para desenvolvedores

O preço padrão informado é de US$ 0,20 por milhão de tokens de entrada e US$ 0,75 por milhão de tokens de saída. Durante o lançamento, a companhia anuncia desconto de 80%, reduzindo as tarifas para US$ 0,04 e US$ 0,15, respectivamente. Também são oferecidos 100 milhões de tokens gratuitos na API da Inception. Valores, limites e disponibilidade podem mudar; por isso, desenvolvedores devem confirmar as condições diretamente na documentação antes de integrar o Mercury 2.5.

ItemInformação anunciadaImpacto esperado
EntradaUS$ 0,20/milhão; US$ 0,04 na ofertaMenor custo de prompt
SaídaUS$ 0,75/milhão; US$ 0,15 na ofertaGeração mais acessível
Contexto260 mil tokensMais dados por tarefa
Velocidade1.107 tokens/segundoMenor espera percebida

Casos de uso: busca, voz e programação

A Inception cita busca com baixa latência, agentes de voz e sistemas de código como aplicações prioritárias. No caso da OpenCall, a empresa relata latência mediana próxima de 170 milissegundos em chamadas ao vivo. O P99 teria caído de vários minutos para um segundo, enquanto o P50 passou de 0,4 segundo para menos de 0,2 segundo, incluindo raciocínio. São números fornecidos pelas empresas, não uma auditoria independente.

Já a Augment Code usa Mercury para context compaction, roteamento de modelos e busca de ferramentas MCP. Segundo o material de lançamento, transferir a compactação para o modelo reduziu a latência de cerca de 150 segundos para 27 segundos e o custo em 90%, mantendo a qualidade. Esses ganhos dependem da carga, do prompt, da infraestrutura e da métrica usada em cada implementação.

Mercury Voice e Router entram em preview

Além do modelo principal, a Inception colocou dois produtos em prévia. O Mercury Voice é voltado a agentes de voz e promete tempo até o primeiro token abaixo de 170 milissegundos. O Mercury Router analisa o prompt e direciona a solicitação a modelos abertos ou fechados conforme o equilíbrio necessário entre qualidade, velocidade e custo. Para empresas, a oferta inclui capacidade dedicada, autoscaling, controles de compliance e retenção configurável de dados.

O desempenho divulgado é uma alegação de lançamento: a avaliação mais útil para cada equipe continua sendo testar o Mercury 2.5 com seus próprios prompts, ferramentas e metas de latência.

Como avaliar o modelo antes da adoção

  1. Compare qualidade e custo em tarefas reais.
  2. Meça P50, P95 e P99 de latência.
  3. Teste JSON, ferramentas e falhas de schema.
  4. Verifique privacidade, retenção e compliance.

Perguntas frequentes sobre o Mercury 2.5

  1. Qual é a velocidade do Mercury 2.5?

    A Inception informa 1.107 tokens por segundo. O número se refere ao desempenho anunciado em GPUs NVIDIA amplamente disponíveis e deve ser validado no caso de uso real.

  2. Onde usar a API do Mercury 2.5?

    O modelo está no chat e na API da Inception, no Baseten e no OpenRouter. A empresa também anuncia 100 milhões de tokens gratuitos para a API própria.

  3. O Mercury 2.5 serve para agentes de voz?

    Sim, a Inception direciona o modelo a sistemas sensíveis à latência. O Mercury Voice, ainda em preview, mira agentes de voz com início de resposta abaixo de 170 ms.

  4. Qual é o contexto do Mercury 2.5?

    A janela de contexto anunciada é de 260 mil tokens. Ela pode ajudar tarefas extensas, mas custo, qualidade e latência variam conforme o volume efetivamente processado.

Considerações finais

O Mercury 2.5 reforça a disputa por modelos capazes de atender agentes de IA em tempo quase real. A combinação de 1.107 tokens por segundo, contexto amplo, ferramentas paralelas e preço promocional é relevante, mas precisa ser examinada com benchmarks reproduzíveis. A Inception afirma já treinar um modelo maior; até lá, a decisão de adoção deve considerar qualidade, governança de dados e desempenho ponta a ponta, e não somente a taxa de tokens.

Fontes: comunicado da Inception. Publicação baseada nas informações de lançamento; dados de desempenho são declarações das organizações citadas.

PUBLICIDADE

Diogo Fernando

Apaixonado por tecnologia e cultura pop, programo para resolver problemas e transformar vidas. Empreendedor e geek, busco novas ideias e desafios. Acredito na tecnologia como superpoder do século XXI.