Après avoir joué un rôle clé dans le mouvement en faveur du raisonnement avancé parmi les entreprises d’IA, DeepSeek a présenté une technique expérimentale appelée DeepSeek Sparse Attention. Ce nouveau mécanisme est conçu pour explorer et valider des optimisations de l’efficacité de l’entraînement et de l’inférence lors du traitement de requêtes longues, a indiqué DeepSeek le 29 septembre.
Qu’est-ce qu’un mécanisme d’attention parcimonieuse ?
Dans l’IA générative, un mécanisme d’attention parcimonieuse permet d’empêcher l’architecture neuronale de relier chaque jeton à tous les autres. Au lieu de cela, chaque jeton porte son attention sur un sous-ensemble plus restreint de jetons. L’utilisation d’un mécanisme d’attention parcimonieuse réduit les besoins en calcul et en mémoire nécessaires pour produire une réponse. La différence est particulièrement visible dans les requêtes contenant des milliers, voire des centaines de milliers de jetons.
DeepSeek-V3.2-Exp avec attention parcimonieuse est disponible avec ses poids et son code sur HuggingFace pour une utilisation locale. Il est également accessible sur le Web, dans l’application DeepSeek et via l’API.
Cette version constitue « une étape intermédiaire vers notre architecture de nouvelle génération », a écrit DeepSeek sur la fiche du modèle le 29 septembre.
Formats de précision : FP8 aujourd’hui, BF16 en cours
DeepSeek a indiqué que ses modèles les plus récents prennent en charge l’architecture FP8, ou à virgule flottante sur 8 bits, a rapporté Bloomberg lundi. Le FP8 est couramment utilisé dans l’entraînement de l’IA afin d’améliorer l’efficacité grâce à des calculs plus rapides et à une consommation de mémoire réduite. En outre, DeepSeek travaille à la prise en charge du BF16, ou Brain Floating Point 16, un format qui permet d’accélérer les calculs.
Tarifs et accès pour les développeurs
Lundi, l’entreprise a réduit d’au moins 50 % les tarifs de l’API DeepSeek. Cette mesure pourrait faciliter l’accès des développeurs intéressés aux nouveaux modèles, sur lesquels DeepSeek mise peut-être pour attirer davantage de clients à long terme.
Huawei prend en charge DeepSeek et propose une alternative chinoise à Nvidia
Huawei affirme que ses puces Ascend prendront en charge l’inférence du nouveau modèle, a rapporté Bloomberg. Ses puces Ascend seront capables d’exécuter le nouveau modèle. Parallèlement, Huawei augmente sa production en Chine et se présente comme une alternative aux puces d’IA de Nvidia produites aux États-Unis.
La semaine dernière, Huawei a détaillé un plan sur trois ans visant à relier des milliers de processeurs Ascend au sein de ses nouveaux systèmes « SuperPoD ».
Huawei est en concurrence avec Nvidia, mais les règles d’exportation entre les États-Unis et la Chine créent un environnement réglementaire incertain pour les puces d’IA avancées.
Le dernier modèle d’IA de DeepSeek ne sera pas commercialisé comme prévu, des problèmes d’approvisionnement liés aux puces Nvidia ralentissant son déploiement. Découvrez comment ce retard pourrait remodeler la concurrence dans la course mondiale à l’IA.

