---
title: "Multi-agentes superam humanos em criatividade? O que os benchmarks realmente mostram sobre conflitos internos"
author: "Ricardo Pupo Larguesa"
date: "2026-05-21 16:28:00-03"
category: "Papers & Pesquisa"
url: "http://aintuicao.scale.press/portal/aintuicao/post/2026/05/21/multi-agentes-superam-humanos-em-criatividade-o-que-os-benchmarks-realmente-mostram-sobre-conflitos-internos/md"
---

## Resumo
- Paper no arXiv mostra que multi-agentes superam humanos em originalidade só quando usam protocolo estruturado de resolução de conflitos.
- Sem gerenciamento de discordâncias, o sistema produz ideias mais conservadoras que equipes humanas.
- Cada rodada de resolução aumenta consumo de tokens em 2,3x — o ganho vale apenas para tarefas que exigem divergência real.
- O módulo de conflito deve ser configurado antes de escalar o número de agentes.

---

Quando em monto squads multi-agente para gerar ideias, o que mais chama atenção não é o número de propostas, mas o que acontece quando dois agentes discordavam sobre a mesma funcionalidade.

Um paper recente no arXiv, "Multi-Agent Creativity via Structured Conflict Resolution", testou exatamente isso. Os autores compararam equipes humanas com sistemas de 4 a 8 agentes em tarefas de brainstorming de software. Sem protocolo de conflito, os agentes produziam ideias mais conservadoras que os humanos. Com protocolo explícito de resolução como votação ponderada, debate em rodadas e veto por evidência... o sistema superou as equipes humanas em 12% nas métricas de originalidade e viabilidade técnica.

O que muda na prática é que criatividade em IA multi-agente não vem de mais agentes. Vem da capacidade de transformar conflito em sinal. Sem isso, o sistema apenas amplifica o viés médio do modelo base.

Eu já vi isso acontecer. Em um projeto de automação de requisitos, dois agentes Opus e um GPT-5 geravam user stories. Sem resolução estruturada, o output final era uma média diluída que dificilmente seria aceito. Depois de implementar rodadas de debate com critério de "evidência de usuário real", a taxa de aprovação sobe.

O benchmark também revela o custo oculto. Cada rodada extra de resolução aumentou o consumo de tokens em 2,3x. O ganho criativo só vale a pena quando o problema realmente exige divergência, e não quando a tarefa é apenas gerar variações de uma mesma ideia.

Em pipelines de agentes, a lição a ser aprendida é que o módulo de conflito precisa ser configurado antes de aumentar o número de agentes. Caso contrário, você só está pagando mais para repetir o mesmo erro com mais vozes.

[No artigo anterior sobre multi-agentes na engenharia de software](https://scale.press/portal/aintuicao/post/2026/03/19/multi-agentes-na-engenharia-de-software-eficiencia-real-ou-apenas-mais-ruido) já discutimos que eficiência exige menos ruído, não mais agentes. A mesma lógica se aplica aqui.

O erro comum que vejo em equipes é achar que basta colocar vários modelos conversando. O resultado costuma ser um comitê sem presidente: muita discussão, pouca decisão.

Se o objetivo é criatividade de verdade, o protocolo de conflito é o que separa protótipo de sistema que entrega valor.