Claude Mythos brauchte 60 Stunden und wiederholte menschliche Lenkung, um Schwachstellen in HAWK und AES-Varianten zu finden – ein Proof-of-Concept für LLM-gestützte Sicherheitsforschung, aber nur unter erheblichen Kosten und Ressourceneinsatz.
Arbor ermöglicht KI-gesteuerte Forschung durch systematische Hypothesen-Verwaltung und erzielte auf sechs Testaufgaben durchschnittlich 2,5x höhere Verbesserungen als bestehende Code-Modelle.
Arbor koordiniert autonome KI-Agenten über persistente Hypothesenbäume und erzielte auf sechs Forschungsaufgaben 2,5-fach bessere Ergebnisse als Codex und Claude Code.
Multi-Agent-Koordination mit Task-Dekomposition und Parallelisierung verbessert Computernutzungs-Agenten erheblich und löst komplexe Langzeit-Aufgaben, an denen Einzelagenten scheitern.