Ein 3-Milliarden-Parameter-Modell erreicht auf mathematischen und Code-Benchmarks (AIME26: 94,3; LiveCodeBench v6: 80,2) Leistung, die mit Systemen konkurriert, die hundertfach größer sind.
Visuellen Weltmodellen lassen sich durch visuell unauffällige Bildmanipulationen systematisch zur Generierung fehlerhafter Vorhersagen bewegen, ohne dass dabei zukünftige Daten oder Nutzereingaben bekannt sein müssen.
VisualClaw senkt Deployment-Kosten für Video-Agenten um bis zu 98 Prozent durch Frame-Filterung und selbstlernende Skill-Updates, während die Genauigkeit in den meisten Settings steigt.
VisualClaw kombiniert effiziente Video-Codierung mit Lernmechanismen, um KI-Agenten kostengünstiger und genauer auf Videoaufgaben einzusetzen und dabei auch in Echtzeit-Edge-Szenarien praktikabel zu sein.
Anthropics Modell Fable verweigerte eine direkte Sicherheitsprüfung von unsicherem Code, führte aber eine Korrektur durch – ein Verhalten, das Experten als gewollte Sicherheitsfunktion einordnen.
Gemma 4 Familie mit drei Varianten (31B dense, 26B-A4B MoE, E2B compact) steht als vollständig verwalteter Service auf Amazon Bedrock zur Verfügung, mit nativem Reasoning, Function Calling und Multimodal-Support.
Europäische Infrastruktur-Anbieter wie eww ITandTEL positionieren sich als Alternativen zu US-Hyperscalern und ermöglichen Unternehmen hybrid-flexible KI-Infrastrukturen mit lokaler Datensouveränität.
Eine Verkettung von drei Schwachstellen in LiteLLM ermöglicht die Übernahme des Proxy-Servers und damit den Zugriff auf alle verwalteten API-Schlüssel von über 100 KI-Modellanbietern.
Legitime KI-Agenten erfüllen naturgemäß alle drei Kriterien der „letalen Trifekta“ (Datenzugriff, externe Inhalte, externe Kommunikation), daher muss sich die Sicherheit vom Architektur-Design zu Laufzeit-Überwachung verlagern.
Ein neuer Benchmark ermöglicht es, die exakte Stelle zu identifizieren, wo medizinische KI-Modelle Halluzinationen produzieren, und gezielt durch Trace-Supervised Fine-Tuning gegenzusteuern.
Ein trainierbarer Klassifizier prognostiziert anhand früher Hidden States mit 0,7 Macro-F1-Score, ob Activation Steering erfolgreich sein wird, ohne komplette Generierungen durchlaufen zu müssen.