Llama 3.1 (Meta)
L'essentiel
Llama 3.1, c'est la famille de modèles d'IA que Meta a mise à disposition en téléchargement en juillet 2024. Contrairement aux modèles accessibles seulement par abonnement, vous pouvez installer celui-ci sur vos propres serveurs : vos documents et vos questions ne quittent jamais votre infrastructure. Il existe en trois formats, du plus léger — qui tourne sur une seule carte graphique — au plus lourd, qui demande une salle machine. La licence autorise l'usage commercial, avec quelques obligations à respecter.
Détails Techniques
Famille de grands modèles de langage à poids ouverts publiée par Meta le 23 juillet 2024, déclinée en 8, 70 et 405 milliards de paramètres, en variantes de base et instruites. Architecture Transformer décodeur dense avec attention à requêtes groupées (GQA) et vocabulaire de 128 000 tokens, sans mélange d'experts. Fenêtre de contexte de 128 000 tokens, pré-entraînement sur plus de 15 000 milliards de tokens, entraînement du 405B sur un cluster de 16 000 GPU NVIDIA H100. Huit langues officiellement supportées. Distribution sous Llama 3.1 Community License, avec poids FP8 officiels disponibles pour la variante 405B.
#Définition : qu'est-ce que Llama 3.1 ?
Llama 3.1 est la famille de grands modèles de langage publiée par Meta le 23 juillet 2024, en trois tailles — 8, 70 et 405 milliards de paramètres — chacune déclinée en version de base et en version instruite. Les poids sont téléchargeables, notamment sur Hugging Face, ce qui autorise l'exécution sur une infrastructure que vous contrôlez, contrairement aux modèles propriétaires accessibles uniquement par API.
L'architecture est un Transformer décodeur dense, avec attention à requêtes groupées (GQA) et un vocabulaire de 128 000 tokens : Meta a délibérément écarté le mélange d'experts pour cette génération, au profit de la stabilité d'entraînement. Le pré-entraînement a mobilisé plus de 15 000 milliards de tokens, celui du 405B un cluster de 16 000 GPU H100.
#Ce que cette version a changé
Trois évolutions par rapport à Llama 3, sorti quelques mois plus tôt. D'abord la fenêtre de contexte, portée de 8 000 à 128 000 tokens. C'est le saut le plus structurant : il rend praticables l'analyse de documents longs et les chaînes RAG à passages nombreux, sans découpage acrobatique.
Ensuite le multilinguisme, avec huit langues officiellement supportées — anglais, allemand, français, italien, portugais, hindi, espagnol et thaï. Le français entre donc dans le périmètre annoncé, ce qui n'était pas acquis auparavant.
Enfin le 405B, premier modèle à poids ouverts hissé au niveau des meilleurs modèles propriétaires de l'époque sur les évaluations publiques.
#Licence : des poids ouverts, pas de l'open source
Point à ne pas confondre dans une réponse à appel d'offres. Llama 3.1 est distribué sous Llama 3.1 Community License, pas sous une licence libre reconnue par l'Open Source Initiative. Ce que la licence autorise : l'usage commercial, la modification, la redistribution, et — nouveauté de cette version — l'utilisation des sorties du modèle pour entraîner d'autres modèles, ce que les versions antérieures interdisaient.
Ce qu'elle impose : mentionner « Built with Llama », préfixer par « Llama » le nom des modèles dérivés, respecter une politique d'usage acceptable, et négocier une licence spécifique auprès de Meta au-delà de 700 millions d'utilisateurs actifs mensuels. Le terme exact est donc open weights. La distinction compte dès qu'un cahier des charges exige une licence libre au sens strict.
#Auto-hébergement : le calcul de VRAM
C'est la question qui décide de la faisabilité, avant toute considération de qualité. En précision bf16, comptez environ 2 octets par paramètre : le 8B tient dans 16 Go de mémoire graphique, le 70B en réclame près de 140 Go — soit deux H100 de 80 Go — et le 405B dépasse les 800 Go. La quantification change la donne : en 4 bits, un 70B redescend autour de 40 Go et tient sur une seule carte de 80 Go. Meta a publié des poids FP8 officiels pour le 405B, qui permettent de le servir sur un nœud unique de huit H100.
Attention au piège classique : ces chiffres ne couvrent que les poids. Le cache clé-valeur s'ajoute et croît avec la longueur de contexte et le nombre de requêtes simultanées — servir du 128 000 tokens à plusieurs utilisateurs en parallèle coûte bien plus que ce que suggère le calcul naïf. Côté serveur d'inférence, vLLM, TGI et SGLang couvrent l'essentiel des besoins de production. Sur l'exposition applicative, référez-vous à la sécurisation des LLM selon le OWASP Top 10.
#Llama 3.1 et l'AI Act européen
Les obligations applicables aux modèles à usage général sont entrées en application le 2 août 2025 : documentation technique, information des fournisseurs en aval, politique de droit d'auteur et résumé public des données d'entraînement. Le règlement prévoit des allègements pour les modèles publiés sous licence libre, mais ils ne s'appliquent pas aux modèles présumés à risque systémique.
Or le seuil de présomption est fixé à 10^25 opérations en virgule flottante cumulées à l'entraînement, et la fiche modèle de Llama 3.1 405B annonce un ordre de grandeur d'environ 3,8×10^25 FLOP : le modèle se situe donc au-dessus du seuil. À noter également, Meta n'a pas signé le code de bonnes pratiques pour les modèles à usage général publié en juillet 2025, et avait déjà différé la mise à disposition dans l'Union de ses modèles multimodaux en invoquant l'incertitude réglementaire. Pour un déployeur européen, ces éléments se documentent au dossier de conformité AI Act.
#Où en est la famille Llama, et quand la choisir
Depuis la 3.1, Meta a publié Llama 3.2 en septembre 2024 (modèles compacts 1B et 3B, variantes vision 11B et 90B), Llama 3.3 70B en décembre 2024, puis la génération Llama 4 en avril 2025, bâtie sur une architecture à mélange d'experts et nativement multimodale. En pratique, la 3.3 à 70 milliards de paramètres a largement remplacé le 405B dans les déploiements, tandis que le 3.1 8B reste un cheval de bataille pour la classification, l'extraction et les tâches embarquées.
L'auto-hébergement se justifie quand les données envoyées au modèle ne doivent pas sortir d'un périmètre juridique donné, quand le volume rend le coût par token d'une API prohibitif, ou quand un fine-tuning spécifique apporte un gain mesurable — c'est l'objet de notre service de fine-tuning de LLM et de nos missions de mise en place d'un pipeline RAG, généralement adossées à notre service Souveraineté Numérique Responsable. Sinon, une API reste plus simple à opérer. Et si la souveraineté prime, les modèles de Mistral méritent d'être évalués en parallèle : voir notre page LLM souverain.
Applications Concrètes
« Un modèle 8B ou 70B servi sur GPU dédiés, couplé à une base vectorielle et à un pipeline RAG, permet d'interroger une documentation métier sans qu'aucun extrait ne transite vers une API tierce. »
« Classification, extraction d'entités ou reformulation sur de très gros volumes : le modèle 8B auto-hébergé change la structure de coût, qui devient un coût d'infrastructure fixe plutôt qu'un coût par token. »
« Un fine-tuning en LoRA ou QLoRA sur un corpus interne permet d'adapter le vocabulaire et le format de réponse attendu, tout en conservant le modèle de base et en gardant les jeux d'entraînement dans le périmètre de l'entreprise. »
Questions fréquentes sur Llama 3.1
Non, et la nuance est importante dans un contexte contractuel. Meta distribue les poids sous Llama 3.1 Community License, qui n'est pas une licence approuvée par l'Open Source Initiative. Elle autorise largement l'usage commercial, la modification et la redistribution, et permet depuis cette version d'utiliser les sorties du modèle pour en entraîner d'autres. Mais elle impose des conditions qu'une licence libre ne connaît pas : mention « Built with Llama », préfixe de nommage pour les dérivés, politique d'usage acceptable et licence négociée au-delà de 700 millions d'utilisateurs actifs mensuels. Le terme correct est « poids ouverts ».
Cela dépend de la taille et de la précision. En bf16, comptez environ deux octets par paramètre : autour de 16 Go de VRAM pour le 8B, près de 140 Go pour le 70B, plus de 800 Go pour le 405B. La quantification 4 bits ramène un 70B autour de 40 Go, ce qui le fait tenir sur une seule carte de 80 Go, et Meta a publié des poids FP8 pour le 405B qui permettent de le servir sur un nœud de huit H100. Prévoyez toujours une marge pour le cache clé-valeur, dont la taille croît avec la longueur de contexte et le nombre de requêtes concurrentes.
Rarement, et c'est un avis assumé. Le 405B a été une démonstration technique majeure en juillet 2024, mais son coût d'inférence reste sans rapport avec le gain observé face à des modèles plus compacts publiés depuis. Llama 3.3 70B, sorti en décembre 2024, en approche la qualité pour une fraction des ressources. Dans la plupart des cas, l'arbitrage se joue entre un 8B pour les tâches simples et volumineuses, et un 70B pour le raisonnement et la rédaction. Réservez les très grands modèles aux cas où une évaluation chiffrée démontre un écart de qualité qui justifie la facture.
Le français fait partie des huit langues officiellement supportées, aux côtés de l'anglais, l'allemand, l'italien, le portugais, l'hindi, l'espagnol et le thaï. La qualité en français est bonne sur la compréhension et la synthèse, plus inégale sur la rédaction longue et sur le vocabulaire technique sectoriel. Pour un usage professionnel exigeant en français, deux réflexes : construire un jeu d'évaluation dans votre propre langue métier avant de trancher, et comparer avec les modèles de Mistral, entraînés avec une part francophone plus importante.
Il faut distinguer deux rôles. Le fournisseur du modèle à usage général porte les obligations de documentation technique, d'information des intégrateurs, de politique de droit d'auteur et de résumé des données d'entraînement, applicables depuis le 2 août 2025. Le déployeur, lui, est soumis aux obligations liées à l'usage qu'il fait du système : transparence vis-à-vis des utilisateurs, et exigences renforcées si le cas d'usage relève d'une catégorie à haut risque. Un point à documenter : le 405B se situe au-dessus du seuil de présomption de risque systémique de 10^25 FLOP, ce qui écarte les allègements prévus pour les modèles diffusés sous licence libre.
Trois critères décident. La sensibilité des données d'abord : si les prompts contiennent des secrets d'affaires ou des données personnelles sensibles, l'auto-hébergement sur une infrastructure européenne supprime l'exposition à une juridiction étrangère. Le volume ensuite : à partir d'un certain débit de tokens, le coût fixe d'un GPU dédié devient inférieur au coût variable d'une API. La spécialisation enfin : un fine-tuning propriétaire n'est possible qu'avec des poids que vous contrôlez. En dehors de ces trois cas, une API reste plus simple à exploiter, et il faut savoir le dire.