LLMs können in Multi-Turn-Gesprächen mit sich entwickelnden Nutzerabsichten nicht zuverlässig mithalten, obwohl Standard-Benchmarks dies nicht abbilden.
Sicherheits-Agenten sollten an operativen Kosten bewertet werden, nicht nur an Erfolgsquoten — offensive und defensive Aufgaben skalieren dabei völlig unterschiedlich.
DailyReport ist ein neuer Open-Source-Benchmark, der Such-Agenten anhand alltagsnaher, mehrdimensionaler Suchaufgaben bewertet und Optimierungspotenziale in bestehenden Systemen aufdeckt.
Aktuelle KI-Agenten können langfristige, professionelle GUI-Workflows nicht zuverlässig ausführen und scheitern an Konsistenzerhalt, Fehlerausbreitung und domänenspezifischem Verständnis.