Alibaba a annoncé Marco-o1, un grand modèle de langage (LLM) avancé conçu pour s’attaquer à des problèmes ouverts et à des tâches de raisonnement complexe. Développé par l’équipe MarcoPolo au sein d’Alibaba International Digital Commerce, Marco-o1 est appelé à rivaliser avec le modèle o1 d’OpenAI, en proposant des améliorations dans le raisonnement, la traduction et la résolution de problèmes dans de nombreux domaines.
La différence Alibaba
Contrairement aux modèles d’IA traditionnels qui excellent dans des tâches structurées comme le codage et les mathématiques, Marco-o1 se concentre sur les problèmes ouverts, pour lesquels les réponses définitives et les critères d’évaluation clairs font souvent défaut.
« À l’heure actuelle, o1 d’OpenAI suscite un vif intérêt pour l’étude des grands modèles de raisonnement (LRM) », selon un extrait du rapport. « S’appuyant sur cette dynamique, Marco-o1 ne se concentre pas seulement sur les disciplines qui admettent des réponses standard, comme les mathématiques, la physique et le codage — particulièrement adaptées à l’apprentissage par renforcement (RL) —, mais accorde aussi une plus grande place aux solutions ouvertes. Nous cherchons à répondre à la question suivante : “Le modèle o1 peut-il se généraliser efficacement à des domaines plus vastes, dépourvus de critères clairs et où les récompenses sont difficiles à quantifier ?” »
Cette avancée repose sur une combinaison de méthodologies avancées :
- Ajustement fin fondé sur la chaîne de pensée (CoT) : permet un raisonnement étape par étape en explicitant le cheminement de la pensée.
- Recherche arborescente de Monte-Carlo (MCTS) : explore plusieurs chemins de raisonnement en utilisant des scores de confiance pour guider le modèle vers des solutions optimales.
- Stratégies d’action pour le raisonnement : ajuste dynamiquement le niveau de granularité de la prise de décision, afin d’affiner l’approche du modèle face aux problèmes nuancés.
Marco-o1 repose sur l’architecture Qwen2-7B-Instruct et a été entraîné à partir d’un mélange de données CoT open source et de jeux de données synthétiques propriétaires. Ces technologies permettent à Marco-o1 de traiter des tâches allant du raisonnement abstrait aux traductions multilingues.
Points forts en matière de performances
Marco-o1 a réalisé des avancées significatives dans les benchmarks de raisonnement et de traduction, avec notamment une précision supérieure de 6,17 % sur le jeu de données MGSM (anglais), un test rigoureux des capacités de raisonnement ; une précision supérieure de 5,60 % sur le jeu de données MGSM (chinois), qui témoigne de ses compétences multilingues ; ainsi qu’une maîtrise de la traduction automatique, comme le montre sa capacité à interpréter les nuances culturelles de l’argot.
Dans un geste en faveur de l’innovation ouverte, Alibaba a mis Marco-o1 gratuitement à disposition sur des plateformes comme GitHub et Hugging Face, invitant les chercheurs et les développeurs à explorer ses capacités et à les améliorer.
L’annonce d’Alibaba intervient peu après des innovations similaires, comme le modèle DeepSeek-R1-Lite-Preview lancé par le laboratoire chinois DeepSeek, et met directement au défi le modèle o1 d’OpenAI, salué pour ses performances en raisonnement logique et mathématique, notamment sur des plateformes comme AIME et CodeForces. Marco-o1 entend toutefois aller plus loin en généralisant ses capacités de raisonnement à des domaines ambigus du monde réel.
Pour en savoir plus sur certaines des autres grandes entreprises qui transforment le monde de la technologie de l’IA.


