L’entreprise chinoise d’IA DeepSeek a annoncé une nouvelle pour le moins intrigante dans le domaine du traitement des documents.
L’entreprise a dévoilé DeepSeek-OCR 2, un système de reconnaissance optique de caractères entièrement repensé, qui remplace son architecture précédente par la technologie d’IA Qwen d’Alibaba.
Changement technologique
DeepSeek a abandonné le framework CLIP d’OpenAI qui alimentait son système d’origine, au profit du Alibaba Cloud, avec le modèle léger Qwen2-0.5b.
Cette nouvelle approche offre un gain de performances de 3,7 % par rapport à la version précédente, ce qui peut sembler modeste jusqu’à ce que l’on examine ce qui se passe sous le capot. DeepSeek-OCR 2 traite désormais les documents comme les humains les lisent réellement : il réorganise et comprend dynamiquement le contenu en fonction du contexte et du sens, plutôt que de procéder à un balayage rigide et mécanique.
Une avancée en matière d’efficacité
Reposant sur DeepSeek et son architecture propriétaire DeepEncoder V2, ce système peut compresser des pages de documents complexes en seulement 256 à 1 120 jetons visuels. À titre de comparaison, les systèmes traditionnels nécessitent souvent des milliers de jetons pour un traitement similaire.
Les tests menés avec OmniDocBench v1.5 ont révélé un score global de 91,09 % pour le système, un bond significatif qui se traduit par des gains concrets en matière de reconnaissance de l’ordre de lecture et de compréhension de la mise en page.
DeepSeek affirme que le système réduit les coûts de calcul des modèles de langage utilisés en aval, tout en conservant une précision comparable à une compréhension des documents de niveau humain.
La collaboration avec Alibaba
Cette collaboration met en lumière quelque chose de plus important que de simples améliorations techniques. La mise à jour met en évidence la Chine et son écosystème d’IA open source en plein essor, où les entreprises s’appuient sur les innovations des autres pour créer des outils toujours plus puissants.
Il suffit de considérer la rapidité du cycle d’itération : cette mise à niveau intervient un peu plus de trois mois après le lancement par DeepSeek de son premier système d’OCR.
Cap vers l’avenir
DeepSeek a publié l’intégralité du système en open source sur Hugging Face, ce qui signifie que les développeurs du monde entier peuvent accéder à cette technologie et la développer. Les implications sont considérables pour les secteurs qui traitent d’immenses volumes de documents, des cabinets d’avocats qui traitent des contrats aux organismes de santé qui numérisent les dossiers des patients.
L’approche fondée sur le raisonnement sémantique permet d’adapter automatiquement les schémas de numérisation aux différents types de documents. Au lieu d’un traitement rigide, ligne par ligne, cette évolution réorganise les informations visuelles en fonction de leur pertinence dans chaque document.
Pour les entreprises noyées sous la paperasse, cela pourrait marquer le passage d’un traitement documentaire coûteux et chronophage à une automatisation qui comprend réellement ce qu’elle lit.
Un documentaire présenté en avant-première au festival de Sundance cette semaine estime révéler la réalité troublante qui se cache derrière l’essor fulgurant de l’IA.

