WikiSkill do Google dá memória a agentes de IA
O WikiSkill do Google é uma arquitetura que transforma tentativas, erros e acertos de agentes de IA em conhecimento persistente. Desenvolvido por pesquisadores do Google Research e da Virginia Tech, o método cria uma camada Wiki entre os rastros de execução e as habilidades usadas pelo agente.
A proposta, descrita em artigo no arXiv e reportada em 1º de outubro de 2026, evita que o sistema redescubra falhas já diagnosticadas sem colocar toda essa memória no prompt de produção.
Em termos práticos, o WikiSkill do Google guarda o diagnóstico de uma falha, testa a correção proposta e preserva o resultado para orientar melhorias futuras.
Tabela de conteúdos
O que muda na evolução de habilidades
Agentes de IA executam tarefas por meio de habilidades: instruções, scripts e fluxos de trabalho reutilizáveis para um domínio. Em abordagens convencionais, um otimizador lê trajetórias bem-sucedidas e malsucedidas, sugere uma alteração e pode descartar o raciocínio que levou à proposta. Com isso, correções rejeitadas e modos de falha recorrentes tendem a reaparecer.
“Em muitas estruturas de autoaperfeiçoamento, um otimizador pode ler rastreamentos, propor uma correção e, em seguida, descartar o diagnóstico.”
O WikiSkill do Google separa memória e execução. A inspiração vem da ideia de uma “LLM Wiki”, proposta por Andrej Karpathy: fontes imutáveis, uma wiki mantida por modelo de linguagem, índice e registro. Aqui, a fonte é a própria atividade do agente; a saída é uma habilidade executável, normalmente organizada em um arquivo SKILL.md.
As três camadas da arquitetura WikiSkill

- Camada bruta: preserva ações, raciocínio, chamadas e saídas de ferramentas como rastros de execução imutáveis.
- Camada Wiki: organiza padrões de sucesso, falhas recorrentes, propostas e impacto de cada mudança.
- Camada de habilidades: reúne as instruções procedurais curtas que ficam disponíveis ao agente durante a tarefa.
O ciclo tem quatro etapas: o Agente de Inferência produz novas trajetórias; o Wiki Maintainer atualiza a memória estruturada; o Skill Proposer propõe ajustes; e um conjunto de validação decide se a alteração entra no repertório ativo. A mudança só é aceita se superar a melhor pontuação de validação registrada até então.
Memória fora do prompt
A wiki é ampla e auditável; a habilidade é compacta e executável. Essa separação reduz custo de inferência e evita sobrecarregar o contexto do agente com detalhes históricos.
Resultados: ganhos e transferência entre modelos
Os pesquisadores avaliaram o sistema em cinco tipos de benchmark: raciocínio matemático, busca na web, planilhas, perguntas e respostas sobre documentos longos e tarefas domésticas interativas. Foram testados modelos Qwen, Gemma e Gemini, em comparação com Trace2Skill, EvoSkill, SkillOpt e agentes sem habilidades.
| Indicador | Resultado informado |
| Vantagem sobre o melhor método rival | 3,3 a 12 pontos percentuais |
| Qwen com skills próprias | +12,3; +17,5; +23,9 pontos em 4B, 9B e 27B |
| Transferência no ALFWorld | 70,2% com skill de modelo maior, ante 63,4% com skill própria |

No estudo de caso do ALFWorld, o agente repetia o padrão de pegar, examinar e devolver objetos. Uma regra genérica foi rejeitada; a wiki reteve esse fracasso. Na rodada seguinte, surgiu uma instrução específica para quebrar o loop, como não devolver um item ao ponto de origem. A correção passou na validação e depois foi refinada quando novos loops apareceram.
O que equipes corporativas podem aproveitar
O principal aprendizado não é simplesmente armazenar mais contexto. É manter trilhas de auditoria, converter experiências em padrões verificáveis e promover alterações pequenas, com validação independente. Para operações repetitivas — atendimento, análise de incidentes, pesquisa, planilhas ou automação de processos — isso pode melhorar governança e reduzir a repetição de erros conhecidos.
Há limites importantes. O WikiSkill ainda não avalia recuperação de habilidades em bibliotecas muito grandes, aceita apenas melhorias imediatas e não apresenta poda automática para a wiki crescente. Também faltam testes em tarefas com centenas de ações ou várias horas. Portanto, os resultados são promissores, mas não equivalem a uma solução pronta para toda aplicação de agentes autônomos.
Perguntas Frequentes sobre o WikiSkill do Google
O que é o WikiSkill do Google?
É uma arquitetura de memória persistente para agentes de IA. Ela organiza rastros de execução em uma wiki e usa esse histórico para propor habilidades melhores, validadas antes do uso.
O WikiSkill coloca toda a memória no prompt?
Não. A wiki fica fora do contexto do Agente de Inferência. Em produção, o agente recebe habilidades compactas, preservando contexto e reduzindo o custo de inferência.
Quais ganhos o estudo reportou?
Nos benchmarks avaliados, o método superou o rival mais forte por 3,3 a 12 pontos percentuais. Os números dependem do modelo, da tarefa e do conjunto de validação.
O WikiSkill já resolve agentes de longa duração?
Ainda não completamente. Poda automática da wiki, recuperação em bibliotecas extensas e adaptação online em tarefas longas seguem como problemas abertos no estudo.
Considerações finais
O WikiSkill do Google oferece uma direção prática para evolução de habilidades: lembrar por que uma intervenção falhou, não apenas registrar se ela falhou. Ao separar conhecimento persistente de instruções de execução, a arquitetura pode tornar agentes de IA mais consistentes sem inflar o prompt. A adoção corporativa, porém, exigirá validação própria, controles de auditoria e políticas de retenção para essa nova memória operacional.
Fontes: paper do WikiSkill no arXiv

