Classification des données pour l'IA
Toutes les données ne se valent pas face à l'IA
Une politique efficace d'usage de l'IA en entreprise commence par classifier les données selon leur sensibilité, permettant de définir clairement ce qui peut être envoyé à un outil IA cloud, et ce qui ne le peut jamais.
Une classification simple et actionnable
| Niveau | Exemples | Règle IA |
|---|---|---|
| Public | Communiqués de presse, documentation publique | Utilisable librement avec tout outil IA |
| Interne | Procédures internes non sensibles | Utilisable avec des outils IA approuvés par l'entreprise |
| Confidentiel | Données clients, contrats, code source propriétaire | Uniquement avec des outils garantissant la confidentialité contractuelle (offre entreprise, hébergement interne) |
| Restreint | Données de santé, données financières critiques, secrets industriels | Modèle auto-hébergé uniquement, ou interdiction d'usage IA cloud sans validation exceptionnelle |
Rendre cette classification concrète pour les employés
Une classification abstraite dans un document que personne ne lit n'a aucun effet réel. Elle doit être intégrée dans les habitudes concrètes : étiquetage des documents, formation avec des exemples réels du quotidien de l'entreprise, rappels dans les outils utilisés.
Cas concret
Un cabinet d'avocats classe ses documents en 4 niveaux. Un contrat client (confidentiel) ne peut être analysé qu'avec l'outil IA d'entreprise sous licence garantissant la non-conservation des données, jamais avec un compte personnel gratuit. Cette règle simple, une fois intégrée dans les habitudes de l'équipe, évite qu'un juriste ne colle par réflexe un contrat sensible dans un chatbot grand public pour un résumé rapide.
Erreurs fréquentes
- Créer une classification théorique sans jamais la rendre concrète et actionnable pour les employés au quotidien.
- Traiter toutes les données de la même façon face à l'IA, qu'elles soient publiques ou hautement confidentielles, une approche binaire qui ne protège pas efficacement les données les plus sensibles.
- Ne jamais réviser la classification à mesure que de nouveaux types de données ou de nouveaux outils IA apparaissent dans l'entreprise.
À retenir
- Une classification des données par niveau de sensibilité définit clairement ce qui peut être envoyé à quel type d'outil IA.
- Une classification n'a d'effet que si elle est rendue concrète et intégrée aux habitudes réelles des employés, pas seulement documentée abstraitement.
- Les données les plus sensibles (santé, secrets industriels) justifient souvent un modèle auto-hébergé plutôt qu'un service cloud, quel que soit le fournisseur.
Mini-exercice
Un juriste veut faire résumer un contrat client confidentiel par un outil IA. Quelle question doit-il se poser en premier, selon une politique de classification des données ?
Réponse : quel outil IA utiliser est-il approuvé par l'entreprise pour traiter des données classées "confidentiel" (garantissant contractuellement la non-conservation/non-utilisation des données), plutôt que de choisir l'outil le plus pratique ou familier sans vérifier cette compatibilité.