O GitHub lançou o ReviewBench, um benchmark aberto desenvolvido em parceria com a Microsoft para avaliar agentes de inteligência artificial voltados à revisão de código. O conjunto de dados da ferramenta reúne 219 pull requests (solicitações de integração de código) originárias de 187 repositórios de código aberto, cobrindo 19 linguagens de programação.21

Metodologia e amostragem de dados

Para refletir com precisão o perfil da sua base de usuários, o GitHub analisou previamente 103,9 milhões de pull requests, reproduzindo a distribuição real de volumes de repositórios e linguagens na plataforma. O benchmark deu preferência a alterações de tamanho intermediário que afetam múltiplos arquivos simultaneamente, reduzindo o espaço concedido a edições simples concentradas em um único arquivo.21

A base de referência foi construída com dados de revisores humanos reais, commits de acompanhamento dos autores, ferramentas determinísticas e múltiplos modelos de fronteira, submetidos a desduplicação semântica. Em uma etapa de validação, engenheiros seniores independentes reclassificaram as constatações de referência e atingiram um índice de 96,6% de concordância com o sistema.21

Métricas e avaliação com Claude Sonnet 5

O ReviewBench emprega o modelo Claude Sonnet 5 como avaliador de linguagem para julgar os apontamentos feitos pelos agentes, guiando-se por uma rubrica pública padronizada. Os resultados finais são separados em duas famílias de métricas: 'grounded', que confronta os testes apenas com falhas já registradas na referência, e 'augmented', que pontua problemas válidos inéditos identificados pelos avaliadores.21

O sistema mensura precisão, cobertura (recall) e F1 em ambas as frentes, permitindo personalizar os cálculos por severidade, categoria de problema e ponderação configurável via Fβ. O GitHub aplicou o benchmark na calibração do Copilot code review (revisão de código do Copilot), afirmando que as avaliações offline conseguiram prever a direção observada em experimentos A/B conduzidos em produção.21

Formato de acesso e submissão

A solução foi disponibilizada publicamente sob o formato de prévia de pesquisa (research preview). Esse arranjo possibilita a realização de ensaios prévios com 25 pull requests antes que os interessados enviem a bateria completa com as 219 solicitações, que é processada em três rodadas por meio de contêiner.21

  1. GitHub publica anúncio oficial e disponibiliza o ReviewBench como prévia de pesquisa
  2. Veículos especializados repercutem os detalhes e a arquitetura do benchmark