GitHub lança ReviewBench para avaliar agentes de revisão de código com IA
O GitHub lançou o ReviewBench, um benchmark aberto e offline para avaliar e comparar o desempenho de agentes de revisão de código baseados em inteligência artificial. O conjunto reúne 219 pull requests de 187 repositórios públicos em 19 linguagens de programação, calibrado com base na análise de 103,9 milhões de pull requests da plataforma. A ferramenta adota o modelo Claude Sonnet 5 como juiz automatizado e divide suas avaliações entre métricas tradicionais (grounded) e métricas que reconhecem novos problemas válidos descobertos pelos modelos (augmented).
O que se sabe
- O GitHub lançou o ReviewBench, um benchmark aberto desenvolvido em parceria com a Microsoft para avaliar agentes de revisão de código com inteligência artificial.21
- O conjunto de dados do ReviewBench contém 219 pull requests de 187 repositórios de código aberto abrangendo 19 linguagens de programação.21
- O GitHub analisou previamente 103,9 milhões de pull requests para espelhar a distribuição real de linguagens e portes de repositórios na plataforma.21
- O benchmark priorizou alterações de tamanho intermediário e que afetam múltiplos arquivos, reduzindo o peso de edições simples em arquivos únicos.21
- O ReviewBench utiliza o modelo Claude Sonnet 5 como avaliador de linguagem para julgar os achados segundo uma rubrica pública padronizada.21
- Engenheiros seniores independentes reclassificaram as constatações de referência do benchmark, registrando 96,6% de concordância com o sistema.21
- O sistema divide os resultados em duas famílias de métricas: 'grounded' (compara apenas com problemas já conhecidos no conjunto de referência) e 'augmented' (avalia e pontua novos problemas válidos descobertos que não constavam na referência original).21
- O benchmark calcula precisão, cobertura (recall) e F1 em ambas as famílias, permitindo ajustes por severidade, categoria de problema e ponderação configurável via Fβ.21
- O GitHub utilizou o ReviewBench para calibrar o Copilot code review, afirmando que os testes offline anteciparam a direção de experimentos A/B em produção.21
- O ReviewBench foi disponibilizado publicamente em formato de prévia de pesquisa (research preview), permitindo testes prévios com 25 pull requests antes da submissão completa de 219 pull requests em três rodadas via contêiner.21
- O conjunto de referência reuniu dados de revisores humanos reais, commits de acompanhamento de autores, ferramentas determinísticas e múltiplos modelos de fronteira, com desduplicação semântica.1
Cronologia
- GitHub publica anúncio oficial e disponibiliza o ReviewBench como prévia de pesquisa
- Veículos de imprensa especializados repercutem os detalhes e o funcionamento do ReviewBench
Quem está envolvido
CS
Claude Sonnet 5avaliador de linguagem usado no benchmark
G
GitHubcriador do ReviewBench
R
ReviewBenchbenchmark para agentes de revisão de código