Rocket Them All
Rocket Them All
← Retour à la collection
Qwen, variante Normal

Variante Normal

Normal · Shiny · Holo

RareInternet & Culture

Qwen

Qwen est une famille de modèles de langage et multimodaux développée par Alibaba Cloud, publiée en de nombreuses tailles pour le cloud et l’exécution locale.

Deck
AI Icons
Monde
Monde 4 - Conflits & Exploration Avancée
Zone principale
Réseau Neural Global
Récompense
+40 XP
Consulter la source principale ↗

Description

Qwen, contraction de Tongyi Qianwen, est une famille de modèles fondamentaux développée par Alibaba Cloud. Elle comprend des modèles de langage généraux, de code, de mathématiques, de vision, d’audio et d’autres variantes multimodales. Qwen n’est donc pas seulement un chatbot chinois : c’est un écosystème de poids, bibliothèques et services utilisé comme base par des applications et par d’autres modèles, notamment certaines distillations de DeepSeek-R1. Les premiers modèles Qwen furent présentés en 2023. Au fil des générations, Alibaba publia davantage de tailles, allant de modèles adaptés aux appareils modestes à de grands systèmes nécessitant plusieurs GPU. Cette diversité permet de choisir entre qualité, vitesse, mémoire et coût. Les versions instruction-tuned sont préparées pour suivre des consignes et dialoguer, tandis que les modèles de base servent davantage à la recherche ou à l’ajustement spécialisé. Comme les autres grands modèles, Qwen transforme le texte en tokens puis prédit les suivants. Les variantes multimodales ajoutent des encodeurs ou représentations pour images, sons et vidéos. Un développeur peut télécharger des poids, quantifier le modèle, l’affiner ou l’utiliser via une plateforme hébergée. L’exécution locale donne plus de contrôle sur les données, mais demande de gérer dépendances, sécurité, performances et licence. La taille affichée ne suffit pas à prévoir la qualité : données, entraînement, contexte et évaluation comptent également. La licence doit être vérifiée modèle par modèle. Le code de certains dépôts est sous Apache 2.0, tandis que les premières générations utilisaient des accords distincts pour leurs poids et certains usages commerciaux. Des versions plus récentes peuvent adopter des conditions différentes. Dire simplement « Qwen est open source » masque donc la distinction entre code d’inférence, poids et dataset. Les données d’entraînement complètes ne sont généralement pas fournies, ce qui limite l’audit de provenance et de biais. Qwen est important parce qu’il a contribué à rendre les modèles chinois visibles dans l’écosystème mondial de développement. Ses variantes apparaissent dans Hugging Face, ModelScope, outils locaux et produits dérivés. Comme tout modèle, il peut halluciner, produire du code vulnérable, refléter des biais linguistiques ou appliquer des restrictions liées à son contexte de développement. Le rabbit hole mène à Alibaba Cloud, ModelScope, aux modèles multilingues, à la quantification, aux licences par checkpoint et à la compétition mondiale des modèles ouverts. Comprendre la carte revient à voir Qwen comme une boîte à outils en évolution rapide, dont chaque composant doit être identifié par nom, version, licence et usage.

À savoir

Qwen est une famille de modèles de langage et multimodaux développée par Alibaba Cloud, publiée en de nombreuses tailles pour le cloud et l’exécution locale.

Sources

Pour aller plus loin