← Retour à la collection
Stable Diffusion, variante Normal

Variante Normal

Normal · Shiny · Holo

Very RareInternet & Culture

Stable Diffusion

Stable Diffusion est une famille de modèles de diffusion latente générant des images à partir de texte, célèbre pour ses poids téléchargeables et son vaste écosystème local.

Deck
AI Icons
Monde
Monde 4 - Conflits & Exploration Avancée
Zone principale
Réseau Neural Global
Récompense
+70 XP
Consulter la source principale ↗

Description

Stable Diffusion est une famille de modèles génératifs texte-image rendue publique en août 2022. Son importance vient autant de sa technique que de sa distribution : les poids et le code des premières versions furent accessibles, permettant à des utilisateurs d’exécuter le modèle sur leur propre ordinateur, de l’intégrer dans des interfaces et de l’adapter. Cette ouverture déclencha un écosystème de modèles spécialisés, extensions, workflows et communautés très différent des générateurs accessibles uniquement par un site fermé. La base scientifique est le modèle de diffusion latente développé par des chercheurs du groupe CompVis de la LMU Munich, notamment Robin Rombach, avec Patrick Esser de Runway et d’autres collaborateurs. Un modèle de diffusion apprend à inverser un processus qui dégrade progressivement une image avec du bruit. Stable Diffusion effectue l’essentiel de ce calcul dans un « espace latent », représentation compressée produite par un autoencodeur, plutôt que directement sur tous les pixels. Cela réduit fortement les ressources nécessaires. Un encodeur de texte transforme le prompt en représentation qui guide le débruitage vers une image compatible. Stability AI fournit le calcul et participa avec CompVis, Runway, LAION, EleutherAI et Hugging Face au lancement. Cette histoire collective est souvent simplifiée à tort en attribuant toute l’invention à une seule entreprise. Les versions ultérieures — 2.x, SDXL, Stable Diffusion 3 et autres modèles Stable Image — changèrent architecture, encodeur, résolution et licence. Le terme « Stable Diffusion » ne garantit donc pas que deux checkpoints aient les mêmes conditions d’usage. L’exécution locale permet inpainting, img2img, ControlNet, fine-tuning et LoRA. Une LoRA peut apprendre un personnage, un produit ou un style avec relativement peu de données. Ce pouvoir facilite direction artistique et expérimentation, mais aussi création non consentie, imitation et contenus trompeurs. Les filtres d’un service hébergé ne s’appliquent pas nécessairement à une copie locale. Les datasets constituent la controverse centrale. Les premiers modèles furent entraînés à partir de grands ensembles de paires image-texte issus du Web, liés à LAION. Des artistes et sociétés ont contesté l’utilisation d’œuvres protégées et la reproduction de signatures ou styles. Les procédures judiciaires et licences varient ; une sortie nouvelle n’est pas automatiquement une copie, mais la provenance de l’entraînement et une ressemblance substantielle restent des questions juridiques distinctes. Le rabbit hole mène aux autoencodeurs, au débruitage, à CLIP, LAION, ControlNet, LoRA et aux procès sur l’entraînement. La carte symbolise le moment où la génération d’images est devenue un médium programmable et modifiable par une communauté mondiale.

À savoir

Stable Diffusion est une famille de modèles de diffusion latente générant des images à partir de texte, célèbre pour ses poids téléchargeables et son vaste écosystème local.

Sources

Pour aller plus loin