fonctionnalités
Vérifiez que vos agents sont dans le vrai avant et après la livraison
Notez les erreurs des agents
Notez l’achèvement des actions, le choix des outils, l’importance des hallucinations, le respect de la RAG et bien d’autres critères. Utilisez nos métriques prédéfinies ou rédigez les vôtres, et affichez les scores parallèlement à la latence, aux erreurs et au coût sur une même trace.
Ajustez l’évaluateur en ligne, sans solliciter de data scientist
Corrigez les scores erronés directement sur la trace pour qu’Autotune mette à jour l’évaluateur. Épargnez-vous les projets d’étiquetage et les transferts à l’ingénierie de prompt. À partir de 5 exemples environ, la précision atteint 95 %, avec des hausses d’environ 10 à 17 points F1.
Exécutez des expérimentations et des tests A/B
Comparez les prompts, les modèles et les versions d’agent en appliquant les mêmes évaluations avant qu’ils n’atteignent la production. Découvrez quelles modifications ont bien amélioré la correction et l’utilisation des outils au lieu de faire des conjectures à partir de vérifications ponctuelles.
Vos évaluations fiables deviennent des garde-fous
Une évaluation qui donne un score fiable pendant les tests devient un mécanisme de contrôle en production. Donnez-lui le statut de vérification en cours d’exécution pour qu’elle arrête les opérations nuisibles avant le déclenchement de l’outil.