Treechat
Menu
Prova gratis
Tutte le note

Cosa sono i modelli linguistici piccoli?

I modelli linguistici di piccole dimensioni utilizzano meno parametri e meno calcoli rispetto ai modelli di grandi dimensioni, rendendoli pratici per attività mirate, uso locale e servizi di intelligenza artificiale efficienti.

Di Treechat7 min di lettura
Una piccola officina focalizzata completa un compito accanto a una fabbrica generica molto più grande.

I modelli linguistici piccoli, o SLM, sono modelli linguistici progettati con meno parametri e requisiti computazionali inferiori rispetto ai modelli grandi utilizzati alla frontiera. Possono riassumere, estrarre informazioni, riscrivere testi, classificare contenuti e rispondere a domande mirate, spesso con latenza, utilizzo della memoria ed energia per token inferiori.

Non esiste una soglia parametrica ufficiale oltre la quale un modello diventa “piccolo”. Il termine è relativo all'hardware, al periodo e al confronto. Un modello che si adatta a un telefono è chiaramente piccolo rispetto a un modello per data center, ma due fornitori potrebbero applicare l'etichetta in modo diverso. Le domande utili riguardano quanta parte del modello è attiva, di quale hardware ha bisogno e se completa l'attività in modo affidabile.

Un modello linguistico può essere utile senza essere enorme

I modelli linguistici apprendono modelli numerici dal testo e li usano per prevedere i token. I modelli più grandi possono contenere più parametri e spesso funzionano bene in una gamma più ampia di attività non familiari. Richiedono anche più memoria e calcoli per addestrarsi e servire.

I modelli piccoli barattano una certa ampiezza con l’efficienza. Dati di addestramento attenti, distillazione e messa a punto mirata possono preservare ottime prestazioni su compiti comuni o ristretti. Quello di Microsoft Rapporto tecnico Phi-3, ad esempio, descrive un modello da 3.8 miliardi di parametri progettato per essere sufficientemente capace per l'implementazione su un telefono. I suoi risultati di riferimento appartengono a quel modello e set di test; non dimostrano che ogni modello piccolo rivaleggia con uno più grande.

“Piccolo” descrive quindi una classe di risorse, non una garanzia di qualità. Un modello compatto può essere eccellente nell'estrazione e scarso nel ragionamento difficile, proprio come un modello grande può non essere necessario per la formattazione di routine.

Dovrebbe essere indicata anche la data del confronto. Ciò che diversi anni fa era considerato compatto, ora può sembrare ordinario con il miglioramento dell'hardware e del design del modello.

Perché i modelli piccoli di solito necessitano di meno energia

In un trasformatore denso convenzionale, la generazione di un token richiede calcoli sulla maggior parte dei pesi del modello. Meno parametri generalmente significano meno valori da spostare nella memoria e meno operazioni da eseguire. Un modello compatto può anche essere eseguito su hardware più piccolo e soddisfare più richieste entro un determinato budget di memoria.

Ecco perché le dimensioni del modello rappresentano un’utile leva ambientale. Non è un misuratore di potenza. La precisione numerica, la lunghezza della sequenza, il dosaggio, la generazione dell'acceleratore e l'ottimizzazione del software modificano tutti l'energia per risultato. Un modello piccolo mal utilizzato può sprecare capacità, mentre un modello più grande che riesce una volta può battere le ripetute chiamate fallite a un modello più debole.

Il nostro articolo su come ridurre l'impronta di carbonio dell'intelligenza artificiale utilizza la regola pratica: scegli il modello più piccolo che completa in modo affidabile l'intero compito. Conta i tentativi e le correzioni anziché confrontare un token isolato.

La lunghezza di input può ridurre il vantaggio. L'elaborazione di un documento di grandi dimensioni su un modello compatto è ancora un lavoro sostanziale, quindi la disciplina del contesto rimane utile per ogni dimensione del modello.

Come vengono resi capaci i modelli piccoli

I costruttori di modelli fanno molto di più che rimuovere i livelli. Curano i dati di formazione in modo che venga spesa una capacità limitata su modelli utili, insegnano modelli più piccoli dai risultati o dalle rappresentazioni di insegnanti più grandi e li mettono a punto per domini particolari. La quantizzazione memorizza e calcola i pesi con una precisione inferiore, riducendo la memoria e spesso accelerando l'inferenza.

La potatura rimuove pesi o strutture giudicate di scarso contributo. Il recupero può fornire documenti rilevanti al momento della richiesta invece di chiedere al modello di memorizzare ogni fatto. Una buona progettazione dell'applicazione restringe il problema con input strutturati, strumenti e validazione.

Ogni tecnica ha dei compromessi. La distillazione può riprodurre le limitazioni dell'insegnante. Una quantizzazione aggressiva può ridurre la qualità. Una messa a punto ristretta può indebolire il comportamento generale. Le affermazioni dovrebbero essere testate sul compito effettivo, sulla lingua e sui requisiti di sicurezza, non dedotti solo dal conteggio dei parametri.

I dati di valutazione necessitano di cure simili. Un modello può sembrare capace perché il suo materiale didattico si sovrappone a un benchmark, mentre non riesce a trovare nuovi esempi dall'applicazione che dovrebbe servire.

Dove i piccoli modelli linguistici funzionano bene

Il lavoro mirato e ripetuto è il territorio naturale. Gli esempi includono la classificazione dei ticket di supporto, l'estrazione di campi da tipi di documenti noti, il suggerimento di risposte brevi, la riscrittura del testo secondo uno stile personale e la risposta a domande da una base di conoscenza controllata. Latenza e costi inferiori possono rendere pratica la distribuzione locale o edge.

L'esecuzione locale può migliorare la privacy perché i dati non devono necessariamente lasciare il dispositivo, anche se il comportamento effettivo della rete dell'applicazione è comunque importante. Può anche evitare l'accesso continuo alla rete. L’inferenza locale non comporta automaticamente minori emissioni di carbonio: un vecchio laptop che svolge un lavoro lento può consumare più energia di un efficiente server condiviso e l’impronta incorporata del dispositivo rimane.

I modelli piccoli sono meno affidabili per ragionamenti complessi in più fasi, conoscenze oscure, documenti lunghi e codici difficili. L'escalation è sensata quando i test mostrano che l'attività supera le loro capacità. La progettazione sostenibile non significa vietare i modelli di grandi dimensioni; è un routing deliberato.

Il confine può essere reso visibile agli utenti. Un servizio può spiegare che il lavoro di routine utilizza il suo modello veloce e offrire un aggiornamento intenzionale per i casi in cui un ragionamento maggiore vale il ritardo e le risorse.

Piccolo, sparso e specializzato non sono sinonimi

Un modello linguistico piccolo ha un ingombro totale relativamente modesto in termini di parametri e memoria. Un modello specializzato viene addestrato o messo a punto per un dominio ristretto, qualunque sia la sua dimensione. Un modello sparso contiene molti parametri ma ne attiva solo alcuni per un dato input.

Quest'ultima categoria include modelli misti di esperti. Possono avere un numero totale di parametri elevato mentre utilizzano un sottoinsieme attivo più piccolo per ciascun token. L’elaborazione può assomigliare a un modello più piccolo e denso, ma tutti gli esperti devono comunque essere archiviati e distribuiti, in modo che la memoria e la comunicazione non svaniscano.

Quando un fornitore promuove un modello “piccolo” o “efficiente”, chiedi parametri totali e attivi, requisiti hardware, token al secondo, limite energetico e qualità dell’attività. Nessuna etichetta risponde a tutte queste domande.

Distinguere inoltre un file di modello scaricabile dalla memoria richiesta durante l'esecuzione. Il contesto lavorativo, le cache e i processi applicativi possono rendere la distribuzione più ampia di quanto suggeriscano i soli pesi.

Come sceglierne uno responsabilmente

Costruisci un insieme di valutazioni rappresentativo, includendo esempi difficili e sensibili alla sicurezza. Testa il candidato più piccolo, registra il successo, la latenza e l'energia stimata o misurata, quindi confronta il modello successivo utilizzando le stesse condizioni. Includere il recupero, le chiamate allo strumento, i nuovi tentativi e la correzione umana.

Per le organizzazioni, monitorare la distribuzione dopo il lancio. Un router che invia la maggior parte del traffico di routine a un modello piccolo e le eccezioni reali a uno più grande può preservare la qualità senza impostare ogni richiesta al massimo calcolo. Una guida pratica all’intelligenza artificiale sostenibile copre la misurazione e la governance attorno a quel modello.

Treechat utilizza modelli più piccoli per le domande di tutti i giorni e offre capacità maggiori quando necessario. La ricevuta per risposta stima l'energia operativa derivante dall'utilizzo del modello e del token, aggiunge un sovraccarico del data center pubblicato e applica un fattore di rete stabilito. Non si tratta di una misurazione hardware diretta. I fattori e le limitazioni attuali sono a /methodology.

I piccoli modelli linguistici sono importanti perché gran parte del lavoro linguistico quotidiano non richiede il più grande sistema disponibile. Utilizzati entro i loro limiti, possono rendere l’IA più veloce, più economica e con un minore consumo energetico. Utilizzato come etichetta di marketing senza test o misurazioni delle attività, “piccolo” dice molto poco.