ESPNDon't look now, Michiganders, but you're back in the Bottom 10RTP Desporto12h30 Aviso a CR7: "Jesus não vira cara à luta"The Jerusalem PostMaine Senate candidate Troy Jackson opposes US giving Israel 'blank check'PunchTinubu mourns NADECO chieftain Ralph ObiohaVanguardIGP Disu mourns 25 NAF personnel, passengers killed in crashRapplerAnyare? Villars’ AllHome, AllDay confirm store closuresCollider‘Carrie’s Mike Flanagan Confirms Why He Made a Major Change From Stephen King’s BookSouth China Morning PostChinese consortium to build Latin America’s longest cable-stayed bridge in BrazilZDF heuteAktuelle Pressemitteilungen des ZDFVariety‘In the Shadows’ Producers to Self-Release British Boxing Biopic Following Collapse of U.K. Distributor True Brit Entertainment (EXCLUSIVE)UN NewsWHO releases first global guidelines on child obesity as cases surgeTagesschauFrüherer BND-Präsident Hanning muss in Untersuchungshaft
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

Copilot auf Platz eins: GitHub stellt neuen Review-Benchmark vor

Translate

Am 5. Oktober hat GitHub ReviewBench vorgestellt, einen Benchmark, der die Qualität KI-gestützter Code-Reviews beurteilt. Das soll Entwicklerinnen und Entwicklern dabei helfen, verschiedene KI-Reviewer fair zu vergleichen und deren Nutzen in der Praxis besser vorhersagen zu können.

ReviewBench basiert auf 219 echten Pull Requests (PRs) aus 187 Open-Source-Repositories in 19 Programmiersprachen. Die Datenauswahl orientiere sich an 103,9 Millionen GitHub-Pull-Requests, um möglichst realistisch zu sein, sagt GitHub in seinem Blogbeitrag zu ReviewBench. Bei den Programmiersprachen erreicht TypeScript den größten Anteil, gefolgt von Python und C#.

Als Referenz dient ReviewBench ein Datensatz bekannter Befunde aus mehreren Quellen. Zu ihnen gehören Kommentare menschlicher Reviewer und Probleme, die sich aus späteren Commits der PR-Autoren ableiten lassen, außerdem LLM-basierte Reviewer und Werkzeuge zur statischen Codeanalyse.

Als Bewertungsmodell nutzt ReviewBench Claude Sonnet 5. Es prüft anhand eines Kriterienkatalogs, ob ein Befund zutrifft, relevant und nicht trivial ist. Ein Abgleichverfahren ermittelt, ob die Befunde des Agenten demselben zugrunde liegenden Problem im Referenzdatensatz entsprechen.

Die Referenzbefunde ließ GitHub von unabhängigen Senior Engineers bewerten, die nicht am Aufbau des Benchmark-Datensatzes beteiligt waren. Laut GitHub stuften sie die Befunde in 96,6 Prozent der Fälle genauso als zutreffend oder unzutreffend ein wie ReviewBench.

ReviewBench soll GitHub dabei geholfen haben, Verbesserungen bei Copilot Code Review (CCR) zuverlässiger zu messen und zu validieren. Passenderweise landet CCR im ReviewBench-Ranking prompt auf dem ersten Platz. Die ersten Einträge der Bestenliste hat GitHub allerdings selbst erzeugt, die anderen Hersteller haben diese Tests weder durchgeführt noch geprüft.

Die Onlinebestenliste des unabhängigen Martian Code Review Bench sieht für CCR weniger schmeichelhaft aus: Dort belegt Copilot Code Review mit Stand 6. Oktober nur Platz fünf, ebenso wie im Offline-Ranking. Allerdings verfolgt Martian auch einen anderen Testansatz: Neben einem Offline-Benchmark misst Martian online, ob Entwicklerinnen und Entwickler die Vorschläge der KI-Reviewer in echten Pull Requests tatsächlich umsetzen.

Entwicklerinnen und Entwickler, die ihren KI-Code-Review-Agenten mit ReviewBench testen möchten, melden sich auf der Website von ReviewBench mit ihrem GitHub-Konto an und registrieren den Agenten samt Container-Image und Konfiguration. Anschließend können sie ihren Agenten zunächst an 25 Pull Requests testen und optimieren. Für die finale Bewertung durchläuft der Agent den vollständigen Datensatz mit 219 Pull Requests dreimal. Nach einer Prüfung durch die Maintainer landen die Ergebnisse in der Bestenliste, sofern es der erste Eintrag des Agenten ist oder er seinen bisherigen Wert übertrifft.

Quellcode, Datensätze und Dokumentation von ReviewBench sind auf GitHub verfügbar.

View the original on heise online →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.