Treechat
Menu
Essayer gratuitement
Toutes les notes

Que sont les petits modèles de langage ?

Les petits modèles de langage utilisent moins de paramètres et moins de calcul que les grands modèles, ce qui les rend pratiques pour des tâches ciblées, une utilisation locale et des services d'IA efficaces.

Par Treechat7 min de lecture
Un petit atelier ciblé accomplit une tâche à côté d’une usine polyvalente beaucoup plus grande.

Les petits modèles de langage, ou SLM, sont des modèles de langage conçus avec moins de paramètres et des exigences de calcul inférieures à celles des grands modèles utilisés à la frontière. Ils peuvent résumer, extraire des informations, réécrire du texte, classer du contenu et répondre à des questions ciblées, souvent avec une latence, une utilisation de la mémoire et une énergie par jeton moindres.

Il n’existe pas de seuil de paramètre officiel à partir duquel un modèle devient « petit ». Le terme est relatif au matériel, à la période et à la comparaison. Un modèle qui tient sur un téléphone est clairement petit à côté d’un modèle de centre de données, mais deux fournisseurs peuvent appliquer l’étiquette différemment. Les questions utiles sont de savoir quelle part du modèle est active, de quel matériel il a besoin et s'il accomplit votre tâche de manière fiable.

Un modèle de langage peut être utile sans être énorme

Les modèles de langage apprennent des modèles numériques à partir du texte et les utilisent pour prédire les jetons. Les modèles plus grands peuvent contenir plus de paramètres et fonctionnent souvent bien dans un plus large éventail de tâches peu familières. Ils nécessitent également plus de mémoire et de calcul pour s’entraîner et servir.

Les petits modèles troquent une certaine ampleur contre l'efficacité. Des données de formation minutieuses, une distillation et un réglage précis peuvent préserver de solides performances sur des tâches courantes ou restreintes. Microsoft Rapport technique Phi-3, par exemple, décrit un modèle de 3.8 milliards de paramètres conçu pour être suffisamment performant pour être déployé sur un téléphone. Ses résultats de référence appartiennent à ce modèle et à cet ensemble de tests ; ils ne prouvent pas que chaque petit modèle rivalise avec un plus grand.

« Small » décrit donc une classe de ressources et non une garantie de qualité. Un modèle compact peut être excellent en extraction et médiocre en raisonnement difficile, tout comme un modèle volumineux peut s'avérer inutile pour un formatage de routine.

La date de comparaison doit également être indiquée. Ce qui était considéré comme compact il y a quelques années peut paraître ordinaire aujourd'hui, à mesure que le matériel et la conception des modèles s'améliorent.

Pourquoi les petits modèles ont généralement besoin de moins d'énergie

Dans un transformateur dense conventionnel, la génération d’un jeton nécessite des calculs sur la plupart des poids du modèle. Moins de paramètres signifie généralement moins de valeurs à déplacer dans la mémoire et moins d'opérations à effectuer. Un modèle compact peut également fonctionner sur un matériel plus petit et répondre à davantage de requêtes dans un budget de mémoire donné.

C’est pourquoi la taille des modèles constitue un levier environnemental utile. Ce n'est pas un wattmètre. La précision numérique, la longueur de la séquence, le traitement par lots, la génération d'accélérateurs et l'optimisation logicielle modifient tous l'énergie par résultat. Un petit modèle mal utilisé peut gaspiller de la capacité, tandis qu'un modèle plus grand qui réussit une fois peut vaincre les appels répétés échoués vers un modèle plus faible.

Notre article sur comment réduire l'empreinte carbone de votre IA utilise la règle pratique : choisissez le plus petit modèle qui accomplit l'ensemble de la tâche de manière fiable. Comptez les tentatives et les corrections plutôt que de comparer un jeton isolé.

La longueur d’entrée peut réduire l’avantage. Le traitement d'un document volumineux sur un modèle compact reste un travail substantiel, la discipline contextuelle reste donc utile quelle que soit la taille du modèle.

Comment les petits modèles sont rendus capables

Les créateurs de modèles font bien plus que supprimer des calques. Ils organisent les données de formation de manière à consacrer une capacité limitée à des modèles utiles, enseignent des modèles plus petits à partir des résultats ou des représentations d'enseignants plus grands et les affinent pour des domaines particuliers. La quantification stocke et calcule les poids avec une précision moindre, réduisant ainsi la mémoire et accélérant souvent l'inférence.

L'élagage supprime les poids ou les structures jugées peu utiles. La récupération peut fournir des documents pertinents au moment de la demande au lieu de demander au modèle de mémoriser chaque fait. Une bonne conception d’application réduit le problème grâce à des entrées, des outils et une validation structurés.

Chaque technique comporte des compromis. La distillation peut reproduire les limitations de l'enseignant. Une quantification agressive peut réduire la qualité. Un réglage précis peut affaiblir le comportement général. Les allégations doivent être testées sur la tâche réelle, la langue et les exigences de sécurité, et non déduites du seul nombre de paramètres.

Les données d’évaluation nécessitent le même soin. Un modèle peut sembler performant parce que son matériel de formation chevauche un benchmark, tout en échouant sur de nouveaux exemples de l'application qu'il est censé servir.

Où les petits modèles de langage fonctionnent bien

Un travail ciblé et répété est le territoire naturel. Les exemples incluent la classification des tickets d'assistance, l'extraction de champs de types de documents connus, la suggestion de réponses courtes, la réécriture de texte dans un style maison et la réponse aux questions d'une base de connaissances contrôlée. Une latence et un coût inférieurs peuvent rendre le déploiement local ou en périphérie pratique.

L'exécution locale peut améliorer la confidentialité, car les données n'ont pas besoin de quitter l'appareil, même si le comportement réseau réel de l'application reste important. Cela peut également éviter un accès continu au réseau. L’inférence locale n’est pas automatiquement moins émettrice de carbone : un vieil ordinateur portable effectuant un travail lent peut consommer plus d’énergie qu’un serveur partagé efficace, et l’empreinte intrinsèque de l’appareil demeure.

Les petits modèles sont moins fiables pour les raisonnements complexes en plusieurs étapes, les connaissances obscures, les documents longs et le code difficile. L'escalade est judicieuse lorsque les tests montrent que la tâche dépasse leurs capacités. Le design durable n’est pas une interdiction des grands modèles ; c'est un acheminement délibéré.

La limite peut être rendue visible aux utilisateurs. Un service peut expliquer que le travail de routine utilise son modèle rapide et proposer une mise à niveau intentionnelle pour les cas où un raisonnement plus poussé vaut le retard et les ressources.

Petit, clairsemé et spécialisé ne sont pas synonymes

Un petit modèle de langage a une empreinte totale relativement modeste en paramètres et en mémoire. Un modèle spécialisé est formé ou réglé pour un domaine restreint, quelle que soit sa taille. Un modèle clairsemé contient de nombreux paramètres mais n’en active que certains pour une entrée donnée.

Cette dernière catégorie comprend modèles mixtes d'experts. Ils peuvent avoir un nombre total de paramètres important tout en utilisant un sous-ensemble actif plus petit pour chaque jeton. Le calcul peut ressembler à un modèle dense plus petit, mais tous les experts doivent toujours être stockés et distribués, afin que la mémoire et la communication ne disparaissent pas.

Lorsqu'un fournisseur fait la promotion d'un modèle « petit » ou « efficace », demandez les paramètres totaux et actifs, la configuration matérielle requise, les jetons par seconde, la limite énergétique et la qualité des tâches. Aucune marque ne répond à toutes ces questions.

Distinguez également un fichier de modèle téléchargeable de la mémoire requise lors de son exécution. Le contexte de travail, les caches et les processus d'application peuvent rendre le déploiement plus important que ce que suggèrent les seules pondérations.

Comment en choisir un de manière responsable

Construisez un ensemble d’évaluation représentatif, comprenant des exemples difficiles et sensibles à la sécurité. Testez le plus petit candidat, enregistrez le succès, la latence et l'énergie estimée ou mesurée, puis comparez le modèle suivant en utilisant les mêmes conditions. Incluez la récupération, les appels d’outils, les tentatives et la correction humaine.

Pour les organisations, surveillez la distribution après le lancement. Un routeur qui envoie la plupart du trafic de routine à un petit modèle et de véritables exceptions à un modèle plus grand peut préserver la qualité sans que chaque requête soit réglée par défaut sur un calcul maximal. Un guide pratique pour une IA durable couvre la mesure et la gouvernance autour de ce modèle.

Treechat utilise des modèles plus petits pour les questions quotidiennes et offre des capacités plus grandes en cas de besoin. Son reçu par réponse estime l'énergie opérationnelle issue de l'utilisation du modèle et des jetons, ajoute une surcharge publiée du centre de données et applique un facteur de grille indiqué. Il ne s’agit pas d’une mesure matérielle directe. Les facteurs et limites actuels sont à /methodology.

Les petits modèles linguistiques sont importants car la plupart des travaux linguistiques quotidiens ne nécessitent pas le plus grand système disponible. Utilisés dans leurs limites, ils peuvent rendre l’IA plus rapide, moins chère et moins gourmande en énergie. Utilisé comme étiquette marketing sans tests ni mesures de tâches, « petit » en dit très peu.