← Ingénierie IA et IA agentique
Alignement de modèles frontières · conseil en cours

IA agentique et stratégies de post-entraînement

Rendre les modèles frontières meilleurs sur les problèmes scientifiques difficiles, et concevoir la notation pour que le progrès se mesure au lieu de s'affirmer.

Là où les modèles frontières restent en retrait

Les modèles frontières peinent sur le raisonnement en plusieurs étapes dans les travaux scientifiques spécialisés. Demandez-leur de dérouler un procédé de réaction chimique en plusieurs étapes, ou de résoudre un problème d'ingénierie où l'étape 4 dépend du résultat de l'étape 2, et ils perdent le fil. Les agents connaissent une défaillance jumelle sur les longues trajectoires d'usage d'outils. Un cas fréquent : un identifiant administratif à usage unique et à durée limitée que l'agent crée, utilise, puis ne supprime jamais.

La raison tient au préentraînement. Ces modèles apprennent des motifs généraux pour prédire le jeton suivant, pas une connaissance approfondie du domaine, et c'est le post-entraînement qui referme cet écart.

1. L'alignement des modèles : RLHF et RLVR

Le RLVR convient aux tâches à réponse objective, comme un problème de mathématiques. Le RLHF convient aux tâches où la réponse relève du jugement, comme l'écriture d'un roman. Les grilles de critères se placent entre les deux et donnent au modèle de récompense un signal plus précis qu'un simple vote de préférence, puisque le modèle reçoit une note graduée au lieu d'une note binaire. Sur les tâches longues en plusieurs étapes, c'est cette gradation qui garde le modèle de récompense calibré.

Ma part commence par les instructions. J'écris des instructions qui exposent les défaillances du modèle, en superposant des contraintes précises et séquentielles (expertise, contenu, mise en forme) et les attentes qu'un expert du domaine aurait vraiment. J'écris ensuite la réponse idéale pour l'affinage supervisé, et je note les réponses du modèle pour l'apprentissage par renforcement. C'est la formation en mathématiques appliquées qui me permet de construire des cadres d'évaluation qui rejoignent l'intention humaine au lieu de l'approcher.

2. Un meilleur raisonnement par la chaîne de raisonnement

Je décompose les tâches complexes en étapes qu'un correcteur peut vérifier, avec des cadres de chaîne de raisonnement. Cela transforme une solution technique en données d'entraînement de référence. Un exemple : écrire le processus d'optimisation qui reconstruit des images d'IRM, en étapes assez fines pour qu'un modèle apprenne à les reproduire, puis à généraliser.

3. L'analyse d'erreurs et l'évaluation par grille

Je lis les fichiers YAML pour comprendre ce que l'utilisateur a demandé, je le mets en regard de la grille, et je retrace les trajectoires d'agents pour trouver le mode de défaillance précis. Je vérifie le raisonnement de l'agent et celui de l'agent de l'environnement, pour qu'une défaillance causée par ce dernier ne soit pas imputée à l'agent évalué. Je relis ensuite la transcription pour trouver l'erreur d'appel de fonction : un appel qui n'a jamais eu lieu, ou la bonne fonction appelée avec les mauvais paramètres.

4. Ce que le modèle sait faire ensuite

Après un cycle de post-entraînement, les modèles acquièrent la connaissance spécialisée des problèmes sur lesquels ils échouaient. Les tâches structurées en plusieurs étapes qui les mettaient en échec passent désormais de façon fiable.

  • RLHF
  • RLVR
  • SFT
  • DPO
  • Grilles de critères
  • Chaîne de raisonnement
  • Analyse des trajectoires d'agents
  • Ingénierie des jeux de préférences
  • Ingénierie des instructions
  • Mathématiques appliquées