71%. Esse é o número que colocou a Lenovo no mapa dos agentes de programação com IA.
Se você acompanha benchmarks de agentes de código, já deve ter visto dezenas de números divulgados sem qualquer verificação. Esse, porém, é diferente.
O framework TianxiCode, desenvolvido internamente pela empresa, rodou com o modelo DeepSeek-V4.1-Flash e resolveu 71% das issues do benchmark SWE-bench-Live Lite.
E o resultado, diferente de muitos divulgados por aí, passou na verificação oficial.
O que a Lenovo anunciou, exatamente
> "O agente TianxiCode da Lenovo, rodando DeepSeek-V4.1-Flash, liderou o SWE-bench-Live Lite com 71% das issues resolvidas e verificação oficial."
Segundo a Pandaily, o desempenho foi confirmado pela checagem oficial do benchmark.
Na prática, isso significa que o conjunto agente + modelo conseguiu resolver mais de dois terços dos problemas de software propostos pelo teste.
O detalhe da verificação oficial importa. Números de benchmarks nem sempre sobrevivem à auditoria independente — e esse passou.
Por que o SWE-bench-Live Lite chama atenção
O SWE-bench-Live Lite avalia agentes de IA em issues reais de software.
Não é um teste de múltipla escolha nem um desafio teórico. O benchmark mede se o agente consegue, de fato, resolver problemas do tipo que programadores enfrentam no dia a dia.
O papel do TianxiCode
O TianxiCode é o framework de agente de código desenvolvido pela própria Lenovo.
Ele atua como a camada que orquestra o modelo de linguagem na tarefa de resolver issues. A fonte não detalha a arquitetura interna do framework.
O papel do DeepSeek-V4.1-Flash
O modelo que executou as tarefas foi o DeepSeek-V4.1-Flash, da DeepSeek.
Ou seja, a Lenovo não treinou um modelo próprio para o teste. Ela combinou seu framework de agente com um modelo externo — e a combinação entregou o resultado verificado.
O que o resultado significa — e o que não significa
> "71% das issues resolvidas, com verificação oficial — um marco para o framework de código da Lenovo."
O dado confirmado é objetivo: 71% de resolução no SWE-bench-Live Lite, com validação oficial do benchmark.
Isso sugere que a camada de agente da Lenovo consegue extrair bom desempenho de um modelo Flash, que em geral prioriza eficiência.
Mas há limites no que se sabe. A fonte não menciona comparações com outros agentes da tabela, nem detalhes de custo, latência ou quais issues específicas foram resolvidas.
Também não há informação sobre disponibilidade pública do TianxiCode — se será aberto a desenvolvedores externos ou restrito ao ecossistema da Lenovo.
Quem é afetado por essa notícia
Para desenvolvedores, o resultado reforça uma tendência: agentes de código estão entregando resultados cada vez mais concretos em tarefas reais.
Para a Lenovo, é uma vitória de posicionamento. A empresa, mais conhecida por hardware, mostra que também compete na camada de software de IA.
Para a DeepSeek, é mais uma validação externa de seus modelos — agora em cenário de agente, não só de chat.
O que ainda não está confirmado
Alguns pontos seguem em aberto:
- Disponibilidade: a fonte não informa se o TianxiCode será lançado publicamente
- Comparação com concorrentes: não há dados de outros agentes na mesma tabela
- Custo operacional: nenhum detalhe sobre o custo de rodar o conjunto
- Cronograma: não há data para lançamento ou expansão do framework
A fonte também não detalha como a verificação oficial foi conduzida além de confirmar a aprovação do resultado.
O que esperar do TianxiCode da Lenovo a partir daqui
O resultado verificado é o fato central. O resto — adoção, disponibilidade, impacto no mercado — ainda depende de anúncios da Lenovo.
Se a empresa abrir o framework ao público, a disputa por agentes de código deve esquentar ainda mais. E se fechar dentro do ecossistema próprio? Aí o 71% vira mais uma vitrine de capacidade do que uma ferramenta que você vai usar.
Enquanto isso, o número fica registrado: 71%, verificado oficialmente.
Vale acompanhar os próximos passos da Lenovo — a fonte não indica quando eles virão.
E você: um resultado verificado como esse mudaria sua escolha de agente de código no dia a dia, ou espera ver disponibilidade pública e custo antes de considerar?