Zum Inhalt springen

Evaluierungen von KI-Agenten entmystifiziert

Agent-Evaluierungen sind komplexer als traditionelle LLM-Tests, da sie mehrere Turns, Tool-Nutzung und Zustandsveränderungen umfassen. Der Schlüssel ist die Unterscheidung zwischen Transcript (aufgezeichnete Interaktionen) und Outcome… 

Share on:

Mehrere FortiGate-Modelle von Backdoor betroffen

FortiGate-Geräte mit aktivierter SSL-VPN wurden durch drei kritische Schwachstellen kompromittiert. Angreifer nutzen diese, um Hintertüren zu installieren und Lesezugriff auf Dateisysteme zu erlangen. In Österreich… 

Share on:

KI-resistente technische Bewertungen gestalten

Anthropic überarbeitet seine technischen Einstellungstests kontinuierlich, während KI-Modelle stärker werden. Der Take-Home-Test zur Code-Optimierung wurde dreimal neu gestaltet, um Top-Talente zu identifizieren und dem neuesten… 

Share on: