
Variante Normal
Normal · Shiny · Holo
Stable Diffusion
Stable Diffusion est une famille de modèles de diffusion latente générant des images à partir de texte, célèbre pour ses poids téléchargeables et son vaste écosystème local.
- Deck
- AI Icons
- Monde
- Monde 4 - Conflits & Exploration Avancée
- Zone principale
- Réseau Neural Global
- Récompense
- +70 XP
Description
Stable Diffusion est une famille de modèles génératifs texte-image rendue publique en août 2022. Son importance vient autant de sa technique que de sa distribution : les poids et le code des premières versions furent accessibles, permettant à des utilisateurs d’exécuter le modèle sur leur propre ordinateur, de l’intégrer dans des interfaces et de l’adapter. Cette ouverture déclencha un écosystème de modèles spécialisés, extensions, workflows et communautés très différent des générateurs accessibles uniquement par un site fermé. La base scientifique est le modèle de diffusion latente développé par des chercheurs du groupe CompVis de la LMU Munich, notamment Robin Rombach, avec Patrick Esser de Runway et d’autres collaborateurs. Un modèle de diffusion apprend à inverser un processus qui dégrade progressivement une image avec du bruit. Stable Diffusion effectue l’essentiel de ce calcul dans un « espace latent », représentation compressée produite par un autoencodeur, plutôt que directement sur tous les pixels. Cela réduit fortement les ressources nécessaires. Un encodeur de texte transforme le prompt en représentation qui guide le débruitage vers une image compatible. Stability AI fournit le calcul et participa avec CompVis, Runway, LAION, EleutherAI et Hugging Face au lancement. Cette histoire collective est souvent simplifiée à tort en attribuant toute l’invention à une seule entreprise. Les versions ultérieures — 2.x, SDXL, Stable Diffusion 3 et autres modèles Stable Image — changèrent architecture, encodeur, résolution et licence. Le terme « Stable Diffusion » ne garantit donc pas que deux checkpoints aient les mêmes conditions d’usage. L’exécution locale permet inpainting, img2img, ControlNet, fine-tuning et LoRA. Une LoRA peut apprendre un personnage, un produit ou un style avec relativement peu de données. Ce pouvoir facilite direction artistique et expérimentation, mais aussi création non consentie, imitation et contenus trompeurs. Les filtres d’un service hébergé ne s’appliquent pas nécessairement à une copie locale. Les datasets constituent la controverse centrale. Les premiers modèles furent entraînés à partir de grands ensembles de paires image-texte issus du Web, liés à LAION. Des artistes et sociétés ont contesté l’utilisation d’œuvres protégées et la reproduction de signatures ou styles. Les procédures judiciaires et licences varient ; une sortie nouvelle n’est pas automatiquement une copie, mais la provenance de l’entraînement et une ressemblance substantielle restent des questions juridiques distinctes. Le rabbit hole mène aux autoencodeurs, au débruitage, à CLIP, LAION, ControlNet, LoRA et aux procès sur l’entraînement. La carte symbolise le moment où la génération d’images est devenue un médium programmable et modifiable par une communauté mondiale.
À savoir
Stable Diffusion est une famille de modèles de diffusion latente générant des images à partir de texte, célèbre pour ses poids téléchargeables et son vaste écosystème local.
Sources
Pour aller plus loin
- Lire l’article sur la diffusion latente ↗
Pour comprendre autoencodeur, espace latent et processus de débruitage.
- Explorer la model card d’une version ↗
Pour vérifier architecture, limites et licence checkpoint par checkpoint.