Reverse Direct Preference Optimization (rDPO) ermöglicht es, spezifische Moderationsrichtlinien aus Modell-Parametern zu entfernen, während allgemeine Fähigkeiten und Alignment in anderen Bereichen erhalten bleiben.
Amazon Nova 2 Lite orchestriert eine Pipeline zur automatischen Anonymisierung personenbezogener Daten in Bildern durch Koordination von Segmentierungs- und OCR-Tools und erfasst auch komplexe Fälle wie gespiegelte oder teilweise sichtbare PII.
Erfolgreiche Domain-Spezialisierung von LLMs erfordert sorgfältige Abstimmung von Learning Rate, Data-Mixing-Verhältnissen und Checkpoint-Auswahl, um katastrophales Vergessen zu vermeiden.