Skip to content

Fairness Pruning: LLM-arhitektuurides demograafiliste kallutatuste tuvastamine ja vähendamine

Lühidalt: Fairness Pruning tuvastab demograafilised kallutatused GLU-MLP-kihtides diferentsiaalse neuroniaktivatsiooni analüüsi abil ja kõrvaldab need minimaalse võimekuskaoga.

Teadlased tutvustavad meetodit, mis võimaldab sihipäraselt tuvastada ja manipuleerida keelemudelite neuroneid, mis töötlevad demograafilisi kallutatusi. 3 miljardi parameetriga mudeliklassi puhul saab selliseid kallutatusi vähendada vähem kui 40 neuroni väljalülitamisega, kahjustamata mudeli erialast pädevust.

Fairness Pruning on struktuurne sekkumismeetod, mille eesmärk on lokaliseerida ja vähendada demograafilisi kallutatusi suurtes keelemudelites. Meetod kasutab minimaalselt kontrastseid vihjepaare ning jäädvustab aktivatsioone päringu käigus, et tuvastada neuronid, mis reageerivad demograafiliste tunnuste töötlemisel erinevalt. Analüüs keskendub down_proj-sisendile GLU-arhitektuurides. Empiiriline hindamine hõlmas kuni 3 miljardi parameetriga mudeleid, sealhulgas Llama-3.2 perekonda ja Salamandra-2B mudelit, kombineerituna standardsete võrdlusaluste ja kvalitatiivsete tekstigenereerimistestidega.

Peamine tulemus on järgmine: tuvastatud neuronite väljalülitamine muudab süstemaatiliselt seda, kuidas mudel demograafilistele muutujatele reageerib. Efekt on seejuures väga täpselt suunatud: Llama-3.2-1B puhul piisab kallutatuse vähendamiseks kuni 40 neuronist – vähem kui 0,031% MLP kogulaiusest. Samal ajal säilitavad mudelid 99,49% oma jõudlusest arutlusoskuse ja üldteadmiste testides. Sekkumine ei too siiski kaasa lihtsat kallutatuse vähenemist, vaid kahesuunalist destabiliseerumist: kuna BiasScore on märgita, sisaldavad tuvastatud neuronikogumid nii stereotüüpe võimendavaid kui ka neid vastu töötavaid neuroneid. Netomõju sõltub sellest, kumb mõju domineerib.

Need tulemused tõendavad empiiriliselt, et demograafiliste kallutatuste töötlemine ja mudeli kognitiivsed võimed toimivad eraldiseisvate skeemide kaudu. Sellega luuakse metoodiline alus üleminekuks pimedalt neuronite kustutamiselt suunatud käitumise moduleerimisele – tee täpsemate kallutatuse leevendamise strateegiate poole, ilma et see kahjustaks mudeli võimekust.


Allikas: arxiv.org · Avaldatud 29. juuli 2026
Lumi AI News — tehisintellekti abil kureeritud sisu vastavalt tehisintellektimääruse art 50-le. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.7.3 abil.

Share on: