O GitHub lançou o ReviewBench, um benchmark aberto desenvolvido em parceria com a Microsoft para avaliar agentes de inteligência artificial voltados à revisão de código. O conjunto de dados da ferramenta reúne 219 pull requests (solicitações de integração de código) originárias de 187 repositórios de código aberto, cobrindo 19 linguagens de programação.
Metodologia e amostragem de dados
Para refletir com precisão o perfil da sua base de usuários, o GitHub analisou previamente 103,9 milhões de pull requests, reproduzindo a distribuição real de volumes de repositórios e linguagens na plataforma. O benchmark deu preferência a alterações de tamanho intermediário que afetam múltiplos arquivos simultaneamente, reduzindo o espaço concedido a edições simples concentradas em um único arquivo.
A base de referência foi construída com dados de revisores humanos reais, commits de acompanhamento dos autores, ferramentas determinísticas e múltiplos modelos de fronteira, submetidos a desduplicação semântica. Em uma etapa de validação, engenheiros seniores independentes reclassificaram as constatações de referência e atingiram um índice de 96,6% de concordância com o sistema.
Métricas e avaliação com Claude Sonnet 5
O ReviewBench emprega o modelo Claude Sonnet 5 como avaliador de linguagem para julgar os apontamentos feitos pelos agentes, guiando-se por uma rubrica pública padronizada. Os resultados finais são separados em duas famílias de métricas: 'grounded', que confronta os testes apenas com falhas já registradas na referência, e 'augmented', que pontua problemas válidos inéditos identificados pelos avaliadores.
O sistema mensura precisão, cobertura (recall) e F1 em ambas as frentes, permitindo personalizar os cálculos por severidade, categoria de problema e ponderação configurável via Fβ. O GitHub aplicou o benchmark na calibração do Copilot code review (revisão de código do Copilot), afirmando que as avaliações offline conseguiram prever a direção observada em experimentos A/B conduzidos em produção.
Formato de acesso e submissão
A solução foi disponibilizada publicamente sob o formato de prévia de pesquisa (research preview). Esse arranjo possibilita a realização de ensaios prévios com 25 pull requests antes que os interessados enviem a bateria completa com as 219 solicitações, que é processada em três rodadas por meio de contêiner.
- GitHub publica anúncio oficial e disponibiliza o ReviewBench como prévia de pesquisa
- Veículos especializados repercutem os detalhes e a arquitetura do benchmark