Polarys
IA multimodale : vision, image et voix/Comprendre la vision multimodale

Comprendre la vision multimodale

Analyser des documents structurés

Analyser des documents structurés

OCR classique vs vision par modèle de langage

L'OCR (reconnaissance optique de caractères) traditionnel extrait du texte brut d'une image, sans comprendre sa structure ni son sens. Un modèle multimodal va plus loin : il peut comprendre la structure d'un document (tableau, formulaire, facture) et répondre à des questions sur son contenu, pas seulement en extraire le texte brut.

Extraction structurée à partir d'un document

"Voici une photo d'une facture. Extrais les informations
suivantes au format JSON : nom du fournisseur, numéro de
facture, date, montant total TTC."
{
  "fournisseur": "Entreprise XYZ",
  "numero_facture": "FA-2026-0847",
  "date": "2026-08-15",
  "montant_ttc": "1250.00 €"
}

Cette approche combine vision (lire l'image) et extraction structurée (format de sortie précis), directement transformable en donnée exploitable par un système informatique.

Documents multi-pages et mise en page complexe

Pour des documents multi-pages (contrats longs, rapports), certains modèles à fenêtre de contexte longue (Claude, Gemini notamment) peuvent traiter plusieurs pages en une seule requête, plutôt que de nécessiter un traitement page par page qui perdrait le contexte global du document.

flowchart TD
    A[Document scanne\nmulti-pages] --> B{Traitement}
    B -- Page par page --> C[Perte du contexte\nglobal entre pages]
    B -- Contexte long,\ntout le document --> D[Analyse coherente\nsur l'ensemble]

Cas concret

Une entreprise reçoit des centaines de factures fournisseurs par email chaque mois, dans des formats variés (PDF natif, scan photographié, capture d'écran). Un agent multimodal extrait automatiquement les informations clés (montant, date, fournisseur) de chaque facture au format structuré, alimentant directement le système comptable, remplaçant une saisie manuelle chronophage et sujette à erreur de transcription.

Erreurs fréquentes

  • Traiter un document multi-pages page par page sans contexte global quand un modèle à contexte long permettrait une analyse cohérente de l'ensemble, perdant des liens entre informations réparties sur plusieurs pages.
  • Ne jamais valider un échantillon des extractions structurées avant de les intégrer automatiquement dans un système en aval, risquant de propager des erreurs d'extraction non détectées à grande échelle.
  • Confondre OCR classique et vision par modèle de langage, deux technologies aux capacités différentes : l'OCR extrait du texte brut, la vision comprend aussi la structure et le sens.

À retenir

  • Un modèle multimodal comprend la structure d'un document, pas seulement son texte brut, contrairement à un OCR classique.
  • Demander une extraction au format structuré (JSON) rend directement le résultat exploitable par un système informatique en aval.
  • Pour des documents multi-pages, un modèle à contexte long préserve la cohérence globale, contrairement à un traitement page par page isolé.

Mini-exercice

Une entreprise veut extraire automatiquement le montant, la date et le fournisseur de centaines de factures scannées par mois, pour les intégrer dans son système comptable. Quelle instruction de prompt rend cette extraction directement exploitable en aval ?

Réponse : demander explicitement une sortie au format structuré (JSON) avec des champs précis (montant, date, fournisseur), plutôt qu'une description en texte libre, rendant le résultat directement intégrable par le système comptable sans traitement manuel supplémentaire.

Quiz de validation

Quiz - 2 questions

1. Quelle est la différence entre un OCR classique et un modèle multimodal analysant un document ?

2. Pourquoi demander une extraction au format JSON plutôt qu'en texte libre pour traiter des factures ?

Suis ta progression

Crée un compte gratuit pour suivre ta progression et accéder à toutes les leçons.