Kuaishou Technology, le principal acteur chinois de la vidéo courte, a présenté mardi Kling O1, un modèle multimodal unifié qui combine la génération vidéo, le montage, la transformation de style, la retouche par remplissage et la postproduction au sein d’un même système.
Kling O1 accepte du texte, des images, des vidéos et des sujets spécifiques en entrée, permettant aux créateurs de guider l’IA à l’aide d’une simple combinaison de mots et d’éléments visuels.
Cette technologie repose sur un nouveau cadre de langage visuel multimodal (MVL), qui lui permet de fusionner un large éventail de fonctionnalités — transformer du texte en vidéo, générer les images de début et de fin, insérer ou supprimer du contenu, modifier les styles et prolonger des plans — au sein d’un flux de travail polyvalent.
Plutôt que de recourir à un montage manuel complexe, les créateurs peuvent simplement saisir des instructions telles que « supprimer les passants » ou « changer la tenue du protagoniste » pour effectuer une reconstruction sémantique au niveau du pixel, sans avoir besoin de masques manuels ni d’images clés. L’entreprise considère cela comme une transformation du montage complexe de postproduction en une expérience simple et conversationnelle.
Résoudre le problème de la cohérence
Un point faible dans la vidéo par IA à ce jour a été de maintenir la cohérence, en conservant les traits d’un personnage, une tenue ou une scène stables d’un plan à l’autre. Kuaishou affirme que Kling O1 résout ce problème grâce à ce qu’il décrit comme une « mémoire de réalisateur ».
Le modèle conserve l’identité des personnages principaux et des accessoires, garantissant la stabilité des traits, même lorsque la caméra est en mouvement ou dans des scènes complexes réunissant plusieurs sujets. Les créateurs peuvent importer des photos ou des extraits de référence, et le modèle s’ancrera sur ces éléments, leur permettant de combiner plusieurs sujets ou de les fondre harmonieusement avec d’autres images. L’objectif est d’offrir une « cohérence de niveau industriel sur l’ensemble des plans ».
À la conquête des géants mondiaux
La sortie de Kling O1 constitue une avancée majeure dans l’intensification du secteur de la vidéo par IA, positionnant Kuaishou — une entreprise qui rivalise en Chine avec Douyin de ByteDance — face à des géants internationaux comme OpenAI Sora, Google Veo, et Runway.
Les capacités de montage précises du modèle lui ont valu une comparaison remarquée. Alvaro Cintas-Canto, professeur adjoint spécialisé en IA et en cybersécurité à Marymount University, a salué la polyvalence de l’outil sur son compte X, qualifiant Kling O1 de « Nano Banana de la vidéo par IA ».
Le cofondateur et directeur général de Kuaishou, Cheng Yixiao, a précédemment déclaré que la stratégie de l’entreprise en matière d’IA consistait à utiliser cette technologie pour soutenir la création de contenus télévisuels et cinématographiques. Cette orientation s’est traduite par de solides résultats commerciaux : l’activité Kling AI de Kuaishou, qui propose des outils vidéo premium, a enregistré un chiffre d’affaires de 300 millions de yuans (42 millions de dollars US) au troisième trimestre 2025, selon le South China Morning Post.
Le récent « code rouge » de Sam Altman pour maintenir ChatGPT devant Google et Anthropic souligne l’intensité de la course à l’IA.

