Par · Mis à jour

Méthode pratique

Évaluer un assistant IA avec un jeu de cas vérifiable

Une réponse convaincante n’est pas nécessairement correcte ou utilisable. Évaluez un assistant sur une tâche définie, avec des cas conservés et des critères écrits avant de regarder ses résultats.

01

Définir la tâche et les limites

Précisez les entrées, les sources autorisées et le résultat que l’utilisateur pourra exploiter. Séparez résumer, recommander, préparer et exécuter une action. Définissez les situations où l’assistant doit demander une précision ou passer la main.

Exemple fictif : un assistant classe des demandes de support mais ne modifie aucun compte. Le bon résultat comprend une catégorie justifiée ou une demande de clarification, pas une intervention réelle.

02

Construire un jeu de cas distinct

Préparez des cas ordinaires, ambigus, incomplets et hors périmètre. Ajoutez des documents contenant des instructions indésirables pour vérifier que l’assistant ne les traite pas comme une autorisation. N’utilisez que des données fictives ou autorisées.

Gardez les cas d’évaluation séparés des exemples utilisés pour régler le système. Sinon, l’amélioration peut simplement refléter une adaptation aux exemples connus. Notez les familles de situations absentes du jeu.

03

Écrire les critères avant le test

Pour chaque cas, indiquez les informations nécessaires, les actions interdites et une preuve de réussite. Distinguez exactitude, qualité de citation et respect du périmètre. Une note générale de style ne remplace pas ces critères.

Classez une erreur selon ses conséquences dans ce contexte : correction simple, mauvaise décision ou action interdite. Les seuils sont à fixer avec le responsable du service ; ils ne sont pas un standard universel.

04

Comparer des versions dans les mêmes conditions

Conservez modèle, instructions, sources, paramètres disponibles et date d’essai. Lors d’un changement, rejouez le même jeu et examinez les différences par famille de cas, pas seulement une moyenne.

Quand les résultats varient, documentez cette variation avec plusieurs essais limités. Évitez de retenir seulement la réponse la plus favorable. Conservez les échecs représentatifs avec les corrections prévues.

05

Décider avec les preuves et les inconnues

Rédigez une décision : usage autorisé, contrôles humains, cas exclus et condition d’arrêt. Un petit jeu réussi justifie au mieux un essai limité dans les conditions testées ; il ne prouve pas une fiabilité générale.

Le cadre NIST cité fournit un repère volontaire de gestion des risques. La méthode de ce guide reste une synthèse éditoriale, sans validation d’expert ou certification du système.

Une fiche à conserver avec la décision

Preuves minimales pour une revue
ÉlémentPreuve
TâcheRésultat utilisable, limites et actions interdites.
Jeu de casExemples, familles couvertes et inconnues.
CritèresAttendus et preuves par cas.
Version et décisionConfiguration, erreurs et conditions d’usage.

Télécharger la fiche à compléter (CSV)

Questions fréquentes

Combien de cas sont nécessaires ?

Le nombre dépend des situations et risques à couvrir. Aucun quota de ce guide n’établit une fiabilité générale.

Une bonne moyenne suffit-elle ?

Non. Examinez séparément les échecs pouvant produire une conséquence grave et les familles peu représentées.

Références

NIST · AI Risk Management Framework

La grille pratique est une synthèse éditoriale à adapter à votre service. Elle ne constitue ni une certification ni un résultat d’audit.

Poursuivre avec une décision connexe