Progetti e ricerca
L’intelligenza artificiale può cambiare “cervello” senza dimenticare la conversazione?
NVIDIA sperimenta un sistema per trasferire tra modelli linguistici parte della memoria di lavoro, passando da modelli piccoli a più potenti senza rileggere ogni volta tutto il contesto.

Una ricerca NVIDIA esplora come trasferire tra modelli AI parte del lavoro già svolto, per cambiare modello durante una conversazione senza dover rileggere tutto il contesto.
Immaginiamo di parlare per mezz'ora con un assistente di intelligenza artificiale.
Gli abbiamo fornito documenti, fatto domande, corretto alcune risposte e aggiunto informazioni. A un certo punto poniamo una domanda molto più difficile delle precedenti.
Il sistema potrebbe decidere che il modello utilizzato fino a quel momento non è sufficiente e affidare il problema a un modello più grande e potente.
Per noi utenti non cambierebbe apparentemente nulla: continueremmo la stessa conversazione.
Dietro le quinte, però, nasce un problema.
Il nuovo modello deve recuperare tutto quello che è successo prima.
Ed è proprio questo il problema affrontato da un nuovo lavoro di ricerca di NVIDIA, intitolato Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse.
L'idea può essere riassunta con una domanda molto semplice: invece di costringere il nuovo modello a rielaborare tutta la conversazione, possiamo trasferirgli direttamente il lavoro che il modello precedente ha già fatto?
I ricercatori sostengono che, in determinate condizioni, la risposta sia sì.
Ma un'intelligenza artificiale “ricorda” davvero la conversazione?
Qui occorre fare una distinzione.
Quando diciamo che ChatGPT o un altro assistente “ricorda” quello che abbiamo scritto dieci minuti prima, utilizziamo una metafora molto umana.
Un LLM, sigla che significa Large Language Model, non conserva necessariamente la conversazione come la conserveremmo noi nella memoria.
Durante l'elaborazione del testo costruisce invece enormi quantità di rappresentazioni numeriche.
Una parte di queste viene conservata nella cosiddetta KV cache.
Il nome deriva da Key e Value, due elementi del meccanismo di attention, cioè il sistema attraverso il quale un Transformer determina quali parti del contesto sono rilevanti mentre elabora e genera il testo.
Non è necessario conoscere la matematica per comprenderne la funzione.
Possiamo immaginare la KV cache come gli appunti di lavoro che il modello prepara mentre legge una conversazione.
Se quegli appunti sono già disponibili, non è necessario rifare da capo tutto il lavoro precedente.
Ed è qui che nasce il problema.
Gli “appunti” preparati da un modello non sono automaticamente utilizzabili da un altro.
Due studenti, due sistemi di appunti
Immaginiamo due studenti che seguono la stessa lezione.
Il primo prende appunti utilizzando abbreviazioni, simboli e una propria organizzazione. Il secondo potrebbe comprendere lo stesso argomento, ma organizza le informazioni in maniera differente.
Consegnare semplicemente il quaderno del primo al secondo potrebbe quindi non funzionare.
Qualcosa di analogo accade con i modelli linguistici.
Un modello Qwen3 da 14 miliardi di parametri e uno Qwen3 da 32 miliardi appartengono alla stessa famiglia, ma non sono lo stesso modello.
I ricercatori NVIDIA si sono allora chiesti se fosse possibile costruire una sorta di traduttore degli appunti.
Non tradurre le parole della conversazione, attenzione, ma le rappresentazioni matematiche che il primo modello ha già calcolato.
È questo il Cross-Model KV Cache Transfer.
La sorpresa: in alcuni casi basta una trasformazione relativamente semplice.
Questa è forse la parte scientificamente più interessante del lavoro.
Ci si potrebbe aspettare che per convertire miliardi di rappresentazioni interne tra due grandi modelli sia necessaria un'altra sofisticata rete neurale.
I ricercatori hanno invece trovato una notevole struttura lineare nelle rappresentazioni KV di alcuni modelli appartenenti alla stessa famiglia.
“Lineare”, in questo contesto, significa grossolanamente che una parte significativa della relazione tra le rappresentazioni dei due modelli può essere descritta attraverso una trasformazione matematica relativamente semplice.
Nel caso Qwen3 14B → 32B, per esempio, usando un solo strato del modello più piccolo si riesce a spiegare il 56% della variabilità delle Key del modello più grande e il 32% delle Value. Combinando più strati, i valori salgono rispettivamente al 79% e al 65%.
Per costruire questa conversione viene utilizzata soprattutto una tecnica chiamata ridge regression.
Il nome è molto più complicato del concetto che ci interessa.
Si tratta di un metodo statistico che cerca una relazione matematica tra dati di partenza e risultato desiderato, introducendo un meccanismo che impedisce alla soluzione di diventare eccessivamente instabile.
In pratica:
“Quando il modello piccolo produce questi numeri, quali numeri avrebbe probabilmente prodotto il modello grande?”
Il sistema impara questa corrispondenza utilizzando un insieme relativamente piccolo di dati di calibrazione.
Perché NVIDIA vuole evitare che il modello “rilegga” tutto?
Perché rileggere costa.
Prima di iniziare a generare una risposta, un LLM deve elaborare il testo che gli viene fornito e costruire la propria KV cache.
Questa operazione viene chiamata prefill.
Pensiamola come la fase nella quale il modello legge il fascicolo prima di cominciare a lavorare.
Se il fascicolo contiene poche righe, il problema è limitato.
Se contiene decine di migliaia di token, i token sono, semplificando, le unità nelle quali il modello scompone il testo. Il lavoro diventa molto maggiore.
E se durante la stessa conversazione cambiamo modello, il nuovo modello deve normalmente effettuare nuovamente quel lavoro. Il paper parte esattamente da questo problema: il costo del prefill aumenta con la dimensione del modello e con la lunghezza del prompt.
I numeri sono interessanti
Nell'esperimento Qwen3 14B → 32B, con un contesto di 8.000 token, trasferire la cache richiede 67,8 millisecondi, mentre rifare il prefill sul modello più grande ne richiede 1.154,8.
Circa 17 volte più veloce.
A 32.000 token il trasferimento richiede 277,6 millisecondi, contro quasi 7 secondi del nuovo prefill.
In questo caso il vantaggio arriva a circa 25 volte.
Ed è facile capire perché questo interessi chi costruisce grandi infrastrutture di intelligenza artificiale.
Meno calcolo significa potenzialmente meno attesa, minore occupazione delle GPU, minori consumi energetici e costi inferiori.
Ma soprattutto rende più interessante una possibilità: cambiare modello mentre una conversazione è già in corso.
Un modello piccolo quando basta, uno grande quando serve
Qui arriviamo alla conseguenza forse più importante.
Non tutte le domande richiedono lo stesso livello di capacità.
Chiedere di correggere una frase e chiedere di analizzare un complesso contratto non sono lo stesso problema.
Un sistema potrebbe quindi utilizzare un modello relativamente piccolo ed economico per gran parte del tempo e chiamarne uno molto più potente soltanto quando necessario.
Questo principio viene spesso chiamato routing: il sistema decide a quale modello affidare una richiesta.
Il trasferimento della KV cache potrebbe rendere questo routing più dinamico.
Il modello piccolo prepara il contesto. Quando arriva un problema difficile, parte di quello stato viene convertito nel formato utilizzabile dal modello grande. Terminato il compito complesso, almeno in linea di principio il sistema potrebbe anche effettuare il percorso inverso.
Gli stessi autori sottolineano infatti che il mapping può funzionare nelle due direzioni: dal piccolo al grande per aumentare la qualità e dal grande al piccolo per ridurre il costo.
Ma attenzione: non significa che “la memoria degli LLM è diventata portabile”
Qui il titolo da social deve lasciare spazio alla prudenza.
Il paper non dimostra che possiamo prendere la memoria di qualsiasi LLM e passarla a qualsiasi altro LLM.
Gli esperimenti principali riguardano sei coppie appartenenti a tre famiglie: Qwen3, Llama 3.1 e Ministral 3.
E soprattutto vengono utilizzate coppie definite matched-KV: modelli nei quali il numero delle “teste” KV e la loro dimensione corrispondono, anche se il numero complessivo di strati e parametri può essere differente.
In quattro delle sei coppie studiate, la trasformazione lineare conserva mediamente tra il 73% e il 98% delle prestazioni del modello di destinazione sui cinque benchmark utilizzati.
Ma nelle altre due coppie i risultati crollano al 42-44% circa.
Quindi avere una struttura KV compatibile aiuta, ma non garantisce affatto che il trasferimento funzioni bene.
Questo particolare è fondamentale per interpretare correttamente la ricerca.
E quando il metodo semplice non funziona?
I ricercatori hanno provato qualcosa di più sofisticato.
Al posto della regressione lineare hanno utilizzato una MLP, Multi-Layer Perceptron: in parole semplici, una piccola rete neurale incaricata di imparare una trasformazione non lineare.
Ed è accaduta una cosa interessante.
Nei casi nei quali il metodo lineare funzionava già bene, la rete neurale non portava vantaggi.
Nei due casi Ministral problematici, invece, le prestazioni sul benchmark HellaSwag aumentavano rispettivamente di 24,3 e 36,8 punti percentuali.
Questo suggerisce che non esista necessariamente una sola “lingua interna” facilmente traducibile tra tutti i modelli.
Per alcune coppie basta una trasformazione semplice.
Per altre occorre qualcosa di più complesso.
E per altre ancora non sappiamo ancora se sia possibile ottenere risultati sufficientemente affidabili.
Cosa abbiamo davvero imparato?
Forse la conclusione più interessante non è che NVIDIA abbia inventato una “memoria universale” per l'intelligenza artificiale.
Non l'ha fatto.
Il risultato interessante è un altro.
Una parte del lavoro computazionale svolto da un modello mentre legge un contesto potrebbe non dover essere necessariamente buttata via quando si passa a un altro modello.
Può, almeno in alcuni casi, essere trasformata e riutilizzata.
Gli stessi ricercatori riconoscono limiti importanti: gli esperimenti riguardano trasferimenti all'interno della stessa famiglia; non vengono testate coppie con KV non corrispondenti; le architetture ibride sono escluse; inoltre non sappiamo ancora se il metodo possa funzionare tra famiglie differenti, per esempio da Qwen3 a Llama 3.1.
È quindi ricerca promettente, non una tecnologia universale già risolta.
Ma indica una direzione interessante.
Finora abbiamo pensato soprattutto a quale modello scegliere per una determinata applicazione.
In futuro la domanda potrebbe diventare diversa:
quale modello conviene utilizzare in questo preciso momento della conversazione?
Se lo stato necessario a comprendere il contesto potrà essere trasferito in maniera efficiente, il sistema non dovrà necessariamente scegliere una volta per tutte.
Potrà usare un modello piccolo quando basta, uno grande quando serve e, forse, modelli specializzati quando il problema lo richiede.
La vera innovazione, allora, non sarebbe semplicemente avere modelli sempre più grandi.
Sarebbe riuscire a farli collaborare senza dover ricominciare ogni volta da zero.
Tonino Quattrone
AnpAI