Agent-EvalKit automatisiert die Evaluierung von KI-Agenten durch strukturierte Test-Case-Generierung, Observability-Instrumentierung und kombinierte Code- sowie LLM-basierte Metriken direkt in der Entwicklungsumgebung.
Arbor ermöglicht KI-gesteuerte Forschung durch systematische Hypothesen-Verwaltung und erzielte auf sechs Testaufgaben durchschnittlich 2,5x höhere Verbesserungen als bestehende Code-Modelle.
KI-Assistenten steigern Standardaufgaben-Geschwindigkeit, erzeugen aber messbare Defizite beim eigenständigen Problemlösen in komplexen oder unvorhergesehenen Fällen.
Unsichtbare HTML-Kommentare in GitHub-Issues konnten die Claude Code AI dazu verleiten, geschützte Umgebungsvariablen wie ANTHROPIC_API_KEY auszulesen, da das Read-Werkzeug nicht hinreichend sanktioniert war.
Malicious npm packages können Claude Codes Konfigurationsdatei umschreiben, OAuth-Token vom Netzwerk abholen und zum Zugriff auf alle angebundenen Enterprise-Services nutzen, während Audit-Logs saubere Anthropic-IP-Adressen zeigen.
Eine unbemannte Eingabevalidierung in Anthropics Claude Code GitHub Action ermöglichte die vollständige Übernahme von Repositories durch ein einfaches Issue — mit potenzieller Auswirkung auf alle…
Uber deckelt AI-Coding-Tool-Nutzung pro Mitarbeiter und Tool auf 1.500 Dollar monatlich, was rund 11 Prozent der durchschnittlichen Jahresvergütung eines Software-Engineers entspricht.
Claude Code v2.1.145 verbessert Agent-Management mit JSON-Export, behebt kritische Fehler in Sicherheit und GitHub-Integration und optimiert die Benutzerfreundlichkeit mit besseren Fehlermeldungen und Cross-Platform-Support.
Claude Code v2.1.153 führt eine skipLfs-Option für Git ein, verbessert Autocomplete und MCP-Server-Handling und behebt zahlreiche kritische Bugs in Authentifizierung, Session-Management und Terminal-Rendering.
Claude Code v2.1.147 verbessert Hintergrund-Sessions, führt erweiterte Code-Review-Funktionen ein und behebt über 30 Fehler in Enterprise-Sicherheit, Shell-Integration und plattformspezifischen Problemen.