Polarys

Comprendre le pricing

Le pricing par token, expliqué simplement

Le pricing par token, expliqué simplement

Le token : l'unité de facturation

La plupart des fournisseurs de modèles (Anthropic, OpenAI, Google, Mistral AI et d'autres) facturent leurs API en tokens, une unité de découpage du texte approximativement égale à un fragment de mot (en moyenne, un mot représente environ 1,3 token en anglais, un peu plus en français).

Tokens d'entrée vs tokens de sortie

Prix typique (illustratif, varie selon modèle et fournisseur) :
- Tokens d'entrée (input) : ce que vous envoyez au modèle
- Tokens de sortie (output) : ce que le modèle génère

Les tokens de sortie coûtent généralement 3 à 5 fois plus cher
que les tokens d'entrée chez la plupart des fournisseurs.

Cette asymétrie de prix a une conséquence pratique importante : demander une réponse concise plutôt que verbeuse réduit directement le coût, souvent plus significativement que réduire la longueur du prompt d'entrée.

Le coût varie fortement entre modèles

Un modèle plus petit et rapide (Claude Haiku, GPT-mini, Gemini Flash) coûte généralement une fraction du prix d'un modèle plus puissant (Claude Opus, GPT complet, Gemini Pro), pour des tâches simples où la différence de qualité est négligeable.

flowchart TD
    A[Cout total] --> B[Tokens entree x\nprix par token entree]
    A --> C[Tokens sortie x\nprix par token sortie,\nsouvent 3-5x plus cher]
    B --> D[Cout total\nde la requete]
    C --> D

Cas concret

Une entreprise traite des milliers de requêtes de classification simple chaque jour, où le modèle génère une réponse d'un seul mot (catégorie). En vérifiant sa configuration, l'équipe découvre que le prompt système demande implicitement des explications détaillées à chaque fois, générant des centaines de tokens de sortie inutiles pour un besoin qui n'exigeait qu'un mot. En ajustant le prompt pour demander explicitement une réponse ultra-concise, la facture liée aux tokens de sortie (les plus chers) chute de façon spectaculaire, sans aucune perte de qualité sur l'usage réel.

Erreurs fréquentes

  • Ignorer que les tokens de sortie coûtent significativement plus cher que les tokens d'entrée, une asymétrie qui devrait orienter les efforts d'optimisation en priorité.
  • Laisser un modèle générer des réponses verbeuses pour des besoins qui n'exigent qu'une réponse concise, gaspillant un budget significatif sur des tokens de sortie inutiles.
  • Utiliser systématiquement le modèle le plus puissant et coûteux pour des tâches simples qu'un modèle plus économique traiterait tout aussi bien.

À retenir

  • La plupart des fournisseurs facturent en tokens, avec les tokens de sortie généralement 3 à 5 fois plus chers que les tokens d'entrée.
  • Demander une réponse concise plutôt que verbeuse réduit directement le coût, souvent plus significativement que réduire le prompt d'entrée.
  • Le coût varie fortement selon le modèle choisi, un modèle plus léger convenant souvent aux tâches simples à une fraction du prix.

Mini-exercice

Un système de classification automatique génère systématiquement des explications détaillées, alors que seule la catégorie finale est réellement utilisée en aval. Quelle optimisation simple réduirait significativement le coût de ce système ?

Réponse : ajuster le prompt pour demander explicitement une réponse ultra-concise (uniquement la catégorie, sans explication), réduisant directement les tokens de sortie générés, généralement le poste de coût le plus élevé et le plus facilement optimisable dans ce cas précis.

Quiz de validation

Quiz - 2 questions

1. Les tokens de sortie coûtent-ils généralement plus ou moins cher que les tokens d'entrée ?

2. Quelle action réduit directement le coût lié aux tokens de sortie ?

Suis ta progression

Crée un compte gratuit pour suivre ta progression et accéder à toutes les leçons.