← Retour à la collection
DeepSeek, variante Normal

Variante Normal

Normal · Shiny · Holo

RareInternet & Culture

DeepSeek

DeepSeek est un laboratoire chinois de modèles de langage ouverts, connu pour ses architectures efficaces et son modèle de raisonnement R1.

Deck
AI Icons
Monde
Monde 4 - Conflits & Exploration Avancée
Zone principale
Réseau Neural Global
Récompense
+40 XP
Consulter la source principale ↗

Description

DeepSeek est un laboratoire d’intelligence artificielle fondé en 2023 à Hangzhou par Liang Wenfeng, également cofondateur du fonds quantitatif High-Flyer. Le nom désigne à la fois l’entreprise, ses modèles et son service conversationnel. DeepSeek s’est fait connaître auprès des développeurs avec des modèles de code et de langage publiés avec leurs poids, puis auprès du grand public avec DeepSeek-V3 et le modèle de raisonnement DeepSeek-R1 annoncé en janvier 2025. DeepSeek-V3 utilise une architecture de type mixture of experts : le modèle contient de très nombreux paramètres, mais n’active qu’une partie des experts pour chaque token. Cette stratégie peut réduire le calcul nécessaire à l’inférence par rapport à un modèle dense de taille totale équivalente. R1 fut entraîné pour produire des chaînes de résolution longues, notamment en mathématiques et programmation, en combinant apprentissage par renforcement et étapes d’ajustement. DeepSeek publia aussi des modèles « distillés » plus petits, entraînés à reproduire certaines capacités de R1 sur des bases Qwen ou Llama. Les affirmations de coût et de performance doivent être lues précisément. Un montant publié peut concerner la phase finale d’entraînement d’un modèle, sans inclure recherche préalable, données, salaires, infrastructure ou expériences abandonnées. De même, un benchmark mesure un protocole défini, pas l’intelligence générale. L’impact de DeepSeek fut néanmoins réel : il montra qu’une équipe pouvait rivaliser sur plusieurs évaluations avec une architecture efficace et des prix d’API très bas, ce qui renforça l’intérêt pour les modèles ouverts et la distillation. Il faut distinguer le modèle téléchargé du service hébergé. Exécuter des poids localement peut garder les requêtes dans sa propre infrastructure ; utiliser l’application ou l’API transmet des données au fournisseur selon sa politique. Plusieurs autorités et organismes ont soulevé des questions de confidentialité, de cybersécurité et de censure. Des évaluations ont observé des refus ou cadrages particuliers sur des sujets politiquement sensibles. Un développeur doit donc tester les comportements dans son contexte et ne pas confondre disponibilité du code ou des poids avec neutralité. R1 a été annoncé sous licence MIT, mais les modèles dérivés peuvent hériter d’éléments ou obligations de leur base. Les données d’entraînement ne sont pas entièrement publiées. Le rabbit hole de DeepSeek mène aux mixture-of-experts, à l’apprentissage par renforcement, à la distillation, aux restrictions de puces, à la concurrence sino-américaine, à la censure et au déploiement local. La carte représente une secousse industrielle : non parce qu’un modèle aurait résolu l’IA, mais parce qu’il a remis en question les hypothèses sur le coût, l’ouverture et l’origine géographique des systèmes de pointe.

À savoir

DeepSeek est un laboratoire chinois de modèles de langage ouverts, connu pour ses architectures efficaces et son modèle de raisonnement R1.

Sources

Pour aller plus loin