Polarys
IntermédiaireIA

IA multimodale : vision, image et voix

Comment les modèles multimodaux analysent images et documents, génèrent des visuels et traitent la voix, pour des usages professionnels concrets.

Cours complet sur l'IA multimodale : analyser des images et documents avec un modèle vision, générer des images avec Midjourney/DALL-E/Stable Diffusion, transcrire et synthétiser la voix (speech-to-text et text-to-speech), avec les bonnes pratiques, limites et enjeux de confidentialité et de droits propres à chaque modalité.

6 chapitres12 leçons49 minIntermédiaire

Contenu du cours

Cours similaires