Aller au contenu principal

This site is also available in English.

View in English
Agents IA

« J’ai entraîné mon modèle IA » : l’épreuve des faits

« J’ai entraîné mon propre modèle IA » : l’affirmation est courante dans le marketing digital. Elle peut recouvrir des travaux très différents : entraîner un modèle à partir de zéro, faire le fine-tuning d’un modèle existant, connecter un modèle à des documents de référence ou construire un workflow autour de lui. Cet article explique ce qu’implique chaque approche, pour vous aider à comprendre le fonctionnement d’un outil et à poser des questions utiles.

Par EpicflarePublié en Mis à jour le 5 min de lecture

Ce que signifie vraiment « entraîner un modèle »

Entraîner un modèle d’IA générative à partir de zéro, ce que l’on appelle souvent le pré-entraînement, consiste à faire apprendre un réseau de neurones à partir d’un très grand jeu de données, avec des méthodes d’apprentissage profond (deep learning).

Pendant l’entraînement, le modèle traite un très grand nombre d’exemples. Pour chacun, il prédit une sortie, la compare au résultat attendu et ajuste ses valeurs internes pour réduire l’erreur. Pour un modèle de langage, les exemples sont surtout du texte, et la tâche consiste à prédire la suite d’une séquence.

Ces valeurs internes sont les « poids » ou « paramètres » du modèle, et les grands modèles récents en comptent des milliards. L’ajustement est répété sur un très grand nombre d’étapes, jusqu’à ce que le modèle produise des résultats cohérents.

Cela demande une puissance de calcul considérable, généralement fournie par des processeurs spécialisés comme les GPU, adaptés aux calculs intensifs sur de grands volumes de données. La taille de modèles connus donne une idée de l’effort nécessaire :

Nombre de paramètres de quelques modèles d’IA
ModèleParamètres
GPT-1117 millions
GPT-21,5 milliard
Gemini Nano-11,8 milliard
Gemini Nano-23,25 milliards
Llama 3 8B8 milliards
Llama 3 70B70 milliards
GPT-3175 milliards
Barres à échelle linéaire. Seuls les nombres de paramètres publiés par les développeurs sont indiqués. Les développeurs des plus grands modèles propriétaires, comme GPT-4, Claude et Gemini Ultra, n’ont pas publié le nombre de paramètres de ces modèles.

Le pré-entraînement d’un grand modèle généraliste exige d’importants volumes de données, une infrastructure de calcul et une expertise spécialisée. En pratique, les modèles de fondation les plus utilisés sont développés par un petit nombre de grandes entreprises technologiques et d’organismes de recherche bien financés.

Pré-entraînement, fine-⁠tuning, RAG et workflows

Adapter l’IA à un métier spécifique ne signifie pas forcément entraîner un modèle. Quatre approches sont souvent confondues, et seules les deux premières modifient le modèle lui-même :

  • Pré-entraînement

    Développer les capacités générales d’un modèle en l’entraînant sur un très grand jeu de données de texte, d’images ou de code. Le résultat est un modèle de fondation.

    Le modèle
    Ses paramètres sont appris à partir de zéro.
    Ce que cela demande
    De très grands jeux de données, une infrastructure de calcul importante et une expertise de recherche. La plupart des organisations utilisent un modèle pré-entraîné par d’autres.
  • Fine-tuning

    Poursuivre l’entraînement d’un modèle pré-entraîné existant sur un ensemble d’exemples plus restreint, afin d’adapter son comportement, son style ou son format de sortie à une tâche précise.

    Le modèle
    Ses paramètres sont ajustés.
    Ce que cela demande
    Un ensemble d’exemples représentatifs soigneusement sélectionnés, une évaluation du résultat et une maintenance lorsque le modèle de base évolue.
  • Génération augmentée par récupération (RAG)

    La génération augmentée par récupération fournit à un modèle des éléments pertinents, récupérés dans une source définie (documentation, catalogue produits ou briefs de campagnes passées, par exemple), lorsqu’il traite une demande.

    Le modèle
    Inchangé : il reçoit un contexte supplémentaire.
    Ce que cela demande
    Des documents sources organisés et à jour. Il revient néanmoins au workflow d’évaluer si ces éléments sont utiles, à jour et correctement appliqués à la tâche.
  • Workflows

    Une séquence d’étapes définie (instructions, appels au modèle, règles métier, utilisation d’outils et relecture humaine) qui organise la façon dont un ou plusieurs modèles existants sont utilisés pour une tâche.

    Le modèle
    Inchangé : le workflow modifie la façon dont il est utilisé.
    Ce que cela demande
    Une définition claire de la tâche, des instructions précises, des étapes de validation et des tests sur des entrées représentatives.

Le fine-tuning est une approche légitime pour un problème précis, par exemple une tâche qu’un modèle généraliste réalise mal même avec de bonnes instructions. Beaucoup d’outils marketing présentés comme « propulsés par l’IA » combinent un modèle existant avec des instructions, des documents de référence et des workflows. Ces approches ne s’excluent pas : un produit peut utiliser un modèle ayant fait l’objet d’un fine-tuning, récupérer des documents de référence et fonctionner au sein d’un workflow.

Ce que l’affirmation peut recouvrir en pratique

Lorsqu’un outil ou un service est présenté comme « entraîné », il peut s’agir de fine-tuning, d’une ou plusieurs des approches suivantes, ou d’une combinaison. Chacune de ces approches peut être utile ; aucune ne crée un nouveau modèle :

  1. Des instructions détaillées : le travail consiste à rédiger des prompts détaillés. C’est une compétence précieuse : elle consiste à diriger un modèle existant plutôt qu’à en construire un nouveau, comme on réalise un film sans construire le studio.
  2. Un workflow no-⁠code ou low-⁠code : des outils comme N8N ou Make enchaînent des appels à des modèles existants. Cela peut fonctionner correctement pour des tâches clairement définies. Sans validation ni gestion des entrées inattendues, ces workflows peuvent se révéler fragiles lorsque les cas diffèrent de ceux pour lesquels ils ont été conçus.
  3. Un modèle associé à des templates : un modèle génératif remplit une bibliothèque de templates prédéfinis pour des annonces, des articles de blog ou des e-mails. C’est utile dans certaines situations, dans les limites de ces templates.
  4. Des documents de référence récupérés au moment de l’exécution : le modèle reçoit des documents pertinents issus d’une source définie lorsqu’il répond (génération augmentée par récupération). Le modèle lui-même n’est pas réentraîné.

En résumé : demandez quelle approche est utilisée

Les nouveaux modèles de fondation généralistes proviennent généralement de grandes entreprises technologiques ou d’organisations de recherche bien financées. Pour les équipes de marketing digital, les progrès utiles viendront probablement de deux directions :

  • Les améliorations des modèles de fondation publiés par ces organisations.
  • Des solutions spécialisées construites sur ces modèles, qui combinent expertise métier, données fiables, évaluation et intégration dans les processus existants.

Lorsqu’un outil ou un service est présenté comme « entraîné », demandez quelle approche il utilise : pré-entraînement, fine-tuning, récupération de documents de référence, workflow ou combinaison de plusieurs approches. Demandez ensuite comment il a été évalué sur des tâches proches des vôtres, et ce qu’exigent son exploitation et sa maintenance. Les réponses en disent plus sur sa valeur que le mot « entraîné ».

Pour aller plus loin

IA agentique et achat média : le guide pour investir

Une grille de lecture pour évaluer l’architecture, l’interopérabilité, les coûts d’exploitation et le contrôle avant d’investir dans l’IA appliquée à l’achat média.

PDF · 27 pages · Gratuit · un court formulaire débloque toutes les ressources

À lire aussi