Ingénierie IA et IA agentique
Systèmes agentiques et recherche d'information
6 projets qui couvrent le déploiement en production, l'alignement de modèles, la recherche sur l'accès à l'information et le consulting sur les modèles frontières. Chacun se termine sur un chiffre, un commit ou une adresse en service. Ouvrez un projet pour lire l'étude de cas complète.
-
Multi-agents · déployé
Un planificateur pose une question d'approvisionnement en langage courant. Le système fait le calcul exact au lieu de l'estimer, et s'arrête pour l'accord d'un responsable au-delà de 10 000 $.
98 % de résistance à l'injection · 168 tests · 10 intentions métier
Un agent LangGraph oriente la question vers 1 des 7 solveurs exacts (OR-Tools, CVXPY, SciPy) et vers une chaîne CRAG sur pgvector. Une porte humaine adossée à Redis retient les décisions coûteuses, et 6 contrats typés FastMCP séparent le modèle de tout ce qui s'exécute.
-
Infrastructure de déploiement · production
ERP agentique : l'infrastructure de déploiement
AKS · IaC BicepLa chaîne qui met le copilote sur une infrastructure réelle, avec les 6 contrôles à passer avant qu'une version atteigne un utilisateur.
IaC Bicep · surcouches Kustomize · test de fumée à 6 contrôles · OTel
Bicep provisionne AKS, ACR, Postgres, Redis, CosmosDB et Azure Monitor. Les surcouches Kustomize séparent la préproduction de la production sans dupliquer un manifeste, et un déploiement en production attend une approbation manuelle.
-
Alignement de modèles · SFT et DPO
Alignement pour les questions-réponses financières par SFT, RLAIF et DPO
Llama-3-8B · FinQAApprendre à un modèle à lire les tableaux financiers d'une entreprise et à montrer son raisonnement, pour qu'un analyste vérifie le chiffre au lieu de lui faire confiance.
Perte SFT 2,74 → 0,785 · Exactitude de récompense DPO 97,7 %
Une chaîne en trois étapes sur Llama-3-8B : affinage supervisé avec annotation du raisonnement, 1 800 paires de préférence étiquetées par un second modèle, puis DPO en quantification 4 bits. Un troisième modèle juge les résultats, donc aucun modèle ne corrige sa propre copie.
-
RAG en production · déployé
Posez une question sur un corpus d'articles de recherche et recevez une réponse avec ses sources. Tout démarre par une seule commande, sur un ordinateur portable ordinaire.
Précision des citations ALCE 0,84 · 47 810 fragments indexés
FastAPI et Chainlit dans une pile Docker Compose à deux services, publiée sur GHCR à chaque envoi. Aucun environnement Python à préparer et aucun index à télécharger à la main.
-
Recherche d'information · en cours
Chaîne RAG hybride en quatre étapes pour les questions-réponses scientifiques
Jeu de référence QASPERLa recherche derrière ce chatboard : comment trouver le seul passage utile parmi 47 810, et quand reconnaître qu'il n'y en a pas plutôt que d'inventer une réponse.
ALCE 0,8373 · Fidélité 0,7150 · 84 questions QASPER
Recherche SPECTER2 et BM25 fusionnées par RRF, reclassement ColBERT v2, porte CRAG calibrée et génération Llama-3.1-8B avec citations en ligne. Une seule correction sur l'extraction de la réponse a porté le rappel ALCE de 0,057 à 0,84.
-
Alignement de modèles frontières · conseil en cours
Rendre les modèles frontières meilleurs sur les problèmes scientifiques difficiles, et concevoir la notation pour que le progrès se mesure au lieu de s'affirmer.
RLHF · RLVR · Grilles de critères · Chaîne de raisonnement
RLVR quand la réponse est objective, RLHF quand elle ne l'est pas, et des grilles de critères entre les deux pour une notation graduée. Avec l'analyse des trajectoires d'agents et les jeux de préférences qui alimentent le SFT et le DPO.