Construire son propre benchmark
Pourquoi un benchmark maison est nécessaire
Aucun benchmark public ne couvre exactement le cas d'usage précis d'une entreprise. Un benchmark maison, même modeste (20 à 50 cas représentatifs), donne une information bien plus actionnable qu'un score générique publié par un tiers.
Constituer un jeu de test représentatif
- Sélectionner des cas réels et variés, incluant des cas simples et des cas limites difficiles rencontrés en usage réel.
- Définir un critère de succès objectif pour chaque cas (réponse attendue précise, ou grille d'évaluation claire si la réponse est plus ouverte).
- Inclure des cas où la réponse actuelle est déjà connue pour être insatisfaisante, afin de mesurer une amélioration réelle.
Comparer plusieurs modèles sur ce jeu de test
flowchart TD
A[Jeu de test maison\n20-50 cas representatifs] --> B[Modele A\nGPT]
A --> C[Modele B\nClaude]
A --> D[Modele C\nGemini]
A --> E[Modele D\nLlama/Mistral]
B --> F[Comparer :\nprecision, cout, latence]
C --> F
D --> F
E --> F
Mesurer plus que la précision brute
Au-delà du taux de réussite, comparer aussi le coût total pour traiter le jeu de test complet, et la latence moyenne, deux facteurs qui deviennent déterminants à l'échelle de la production, même si la précision brute est similaire entre plusieurs modèles candidats.
Cas concret
Une équipe support construit un benchmark de 30 tickets réels représentatifs, avec la catégorisation correcte connue pour chacun, pour comparer trois modèles candidats sur la tâche de classification automatique de tickets. Le test révèle que deux modèles obtiennent une précision quasi identique (94% et 93%), mais avec un coût par requête trois fois supérieur pour le premier. Sans ce benchmark maison, l'équipe aurait probablement choisi le modèle le plus réputé globalement, sans réaliser cette différence de coût significative pour une précision quasiment équivalente sur leur cas d'usage réel.
Erreurs fréquentes
- Ne jamais constituer de jeu de test propre à l'entreprise, se fiant uniquement à des benchmarks publics génériques, peu représentatifs du cas d'usage réel.
- Comparer uniquement la précision brute, en ignorant le coût et la latence, deux facteurs qui deviennent déterminants à l'échelle de la production.
- Constituer un jeu de test trop petit ou peu varié, ne couvrant pas les cas limites réellement rencontrés en usage quotidien, produisant une comparaison peu fiable.
À retenir
- Un benchmark maison, même modeste, donne une information plus actionnable qu'un classement public générique pour un cas d'usage précis.
- Le jeu de test doit inclure des cas représentatifs variés, avec des cas limites difficiles, pas uniquement des cas simples et évidents.
- Comparer précision, coût et latence ensemble révèle souvent des arbitrages invisibles en ne regardant que la précision brute.
Mini-exercice
Deux modèles obtiennent une précision quasi identique sur un benchmark maison, mais l'un coûte trois fois plus cher par requête que l'autre. Quel modèle choisir, et sous quelle réserve ?
Réponse : privilégier le modèle moins cher si la précision est effectivement quasi équivalente sur un échantillon suffisamment représentatif et varié, sous réserve de vérifier que cette équivalence se maintient aussi sur les cas limites les plus difficiles du jeu de test, pas uniquement sur la moyenne globale.