TutorielsFrance
OuvrirMesurer les taux de résolution des agents IA avec Terminal-Bench-Science v0.1 sur 70 workflows scientifiques experts
Guide pratique pour reproduire le benchmark Terminal-Bench-Science v0.1, exécuter les 70 tâches publiées, calculer les taux de résolution (meilleur modèle ≈ 30 %) et construire un pipeline d’évaluation léger et auditable.