Zum Inhalt springen

Tencent WorkBuddy Bench: Benchmark für KI-Coding-Agenten über mehrere Domänen

Auf den Punkt: Das WorkBuddy Bench Framework validiert Coding-Agenten über vier praktische Domänen mit Contamination-resistenter Task-Konstruktion und vollständiger Reproduzierbarkeit durch offene Veröffentlichung.

Tencent hat WorkBuddy Bench veröffentlicht, ein offenes Evaluations-Framework für Coding-Agenten in vier Arbeitsbereichen: Repository-Engineering, Web-Frontend, Office-Workflows und Sicherheit. Die Benchmark ist gegen Data Contamination geschützt, indem Aufgaben aus echten Commits und Pull Requests rekonstruiert und in neue Prompts umgewandelt werden.

Aufbau und Methodik: WorkBuddy Bench besteht aus vier fachlich unterschiedlichen Subsets: (1) Repository-Level Engineering für Code-Änderungen, (2) Frontend-Entwicklung für Web-basierte Aufgaben, (3) Office- und Business-Workflows, (4) Rot- und Blau-Team-Szenarien für Sicherheitsaufgaben. Jede Aufgabe wird nicht einfach aus öffentlichen Issue-Texten adaptiert, sondern aus echten Commits, Pull Requests oder geschäftlichen Szenarien rückwärts rekonstruiert und als kurzer, kolloquialer Request umformuliert. Dadurch lässt sich die originale Quelle nicht durch Web-Suche wiederfinden.

Contamination-Resistenz durch Transparenz: Statt Sicherheit durch Geheimhaltung zu erreichen, setzt das Benchmark auf völlige Offenlegung: Task-Verzeichnisse, Umgebungs-Images, Evaluierungs-Harness, Tests und Referenzlösungen sind öffentlich verfügbar. Die Contamination-Resistenz beruht auf der Konstruktionsmethode combined mit expliziter Datenversionierung. Dadurch wird das Benchmark end-to-end reproduzierbar und direkt überprüfbar – jede Partei kann Aufgaben neu ausführen und Inhalte inspizieren.

Evaluierung und Ergebnisse: Das Framework läuft unter einheitlichem, reproduzierbarem Protokoll auf zwei Agent-Harnesses: CodeBuddy Code und Claude Code. Jedes der vier Subsets nutzt sein eigenes Scoring-Instrument, was bedeutet, dass Scores domänenübergreifend nicht direkt vergleichbar sind. Das Benchmark veröffentlicht eine Cross-Model-Leaderboard über mehrere Modell-Familien, verzichtet aber bewusst auf einen Suite-weiten Durchschnittswert.


Quelle: arxiv.org · Erschienen 22. Juli 2026
Lumi AI News — KI-assistierte Kuratierung gemaess Art. 50 EU AI Act. Paraphrase und Klassifikation durch Lumi News Pipeline v1.7.3.

Share on: