← Posts LinkedIn

Ai-je une garantie, ou est-ce que je devine ?

L'analyse de convergence m'a appris à poser une seule question à tout algorithme. Cette question a façonné un système agentique d'approvisionnement construit pour décider quand ne pas croire ses propres réponses.

L’analyse de convergence m’a appris à poser une seule question à tout algorithme : ai-je une garantie, ou est-ce que je devine ? Cette question a façonné un système agentique d’approvisionnement que j’ai construit pour décider quand ne pas croire ses propres réponses.

Pourquoi cela compte

Un agent autonome qui agit sur une réponse fausse et assurée peut engager une entreprise dans une décision coûteuse avant que quiconque la relise. La sauvegarde consiste à savoir quelles réponses portent une preuve et lesquelles restent des approximations, puis à mettre une porte devant les secondes.

Mes travaux de recherche ont produit des conditions qu’un ingénieur peut calculer avant d’entraîner un réseau, au lieu de les deviner par tâtonnement. Cette discipline, qui sépare le prouvable du simplement plausible, est ce dont les systèmes d’IA en production ont le plus besoin.

Dans AI Engineering, Chip Huyen défend l’idée que livrer un modèle et construire un système sont deux métiers différents. Andrew Ng conçoit une carrière en IA autour d’un portefeuille de projets qui montre une progression. Ce système est l’endroit où j’ai mis les deux à l’épreuve.

Ce qui comble l’écart, c’est un système qui connaît les limites de ses propres réponses.

Comment cela fonctionne

Le partage entre l’évaluation et la conjecture traverse toutes les couches.

Deux solveurs calculent l’optimum : la programmation linéaire pour les flots de réseau, la programmation conique du second ordre pour l’allocation robuste sous incertitude. Les autres renvoient la meilleure solution atteignable sur des problèmes dont la difficulté est démontrée, et le système indique laquelle est laquelle au lieu de faire passer une heuristique pour un optimum.

Les couches de sûreté appliquent le même test. Une chaîne CRAG écarte les documents non pertinents avant que le modèle les voie. Des contrats typés gardent chaque frontière d’outil. 20 sondes adverses visent au moins 98 % de résistance à l’injection dans l’intégration continue. Toute décision d’orientation au-delà de 10 000 $ s’arrête pour une approbation humaine avant exécution.

La classification d’intentions suit le principe « programmez, n’écrivez pas d’instruction » du groupe NLP de Stanford, à travers DSPy : des signatures déclaratives compilées contre le modèle remplacent les instructions fragiles écrites à la main, donc changer de modèle sous-jacent recompile le programme au lieu d’imposer une réécriture.

Ce que je n’attendais pas, c’est la faible distance entre les deux mondes. L’instinct qui vous dit qu’un algorithme d’entraînement va converger est le même qui vous dit que la réponse d’un agent demande une évaluation avant d’être livrée. La recherche n’a jamais été séparée de l’ingénierie.

Through G. M. Nguegnang's Lens. On the distance between training a model and running a system