Autor
Edward J. Hu et al.
1 fișă de lectură din 1 carte · 2021.
1 fișă
LoRA: Low-Rank Adaptation of Large Language Models · 2021
LoRA îngheață modelul și învață o corecție mică de rang scăzut, deci un adaptor e un fișier, nu un model.
Mecanismul: schimbarea ponderilor se aproximează ca produsul a două matrice de rang mic, r mult mai mic decât dimensiunea stratului. În lucrare: de 10 000 de ori mai puțini parametri antrenabili și de 3 ori mai puțină memorie GPU față de fine-tuning-ul complet al unui model de 175 de miliarde. Un adaptor e un fișier mic, interschimbabil per sarcină pe același model de bază; QLoRA adaugă baza cuantizată pe 4 biți. În 2026, un model de 7–8 miliarde se adaptează în ore pe o singură placă, de la câțiva dolari pentru un adaptor mic la câteva mii pentru seturi mari. Ce schimbă: comportament, format, stil, disciplina apelurilor de unelte. Ce nu schimbă: nu adaugă cunoștințe noi în volum — acela e RAG. Servirea mai multor adaptoare pe aceeași bază face specializarea per client sau per sarcină ieftină.
“Propunem adaptarea de rang scăzut, sau LoRA, care îngheață ponderile modelului pre-antrenat și injectează matrice antrenabile de descompunere de rang în fiecare strat al arhitecturii Transformer, reducând considerabil numărul de parametri antrenabili pentru sarcinile din aval.”