Pendant deux ans, le flux de travail était simple : on posait une question à l’IA, qui renvoyait une réponse. Aujourd’hui, trois annonces distinctes d’OpenAI, Google et Moonshot AI ont discrètement enterré ce paradigme.
Le nouveau modèle ? Une IA qui enquête, manipule et coordonne… sans qu’on le lui demande.
D’abord, Prism d’OpenAI intègre GPT-5.2 directement dans votre article de recherche
- Au lieu de copier-coller du texte dans une fenêtre de chat séparée, GPT-5.2 lit désormais l’intégralité de votre manuscrit — structure, équations, citations, figures — et travaille à vos côtés comme un coauteur qui aurait déjà lu toutes les versions.
- Il extrait les publications pertinentes d’arXiv, transforme des gribouillages sur un tableau blanc en diagrammes LaTeX prêts à être publiés et raisonne sur vos équations dans leur contexte.
- Kevin Weil, vice-président chargé des sciences chez OpenAI, l’a formulé sans détour : « 2026 sera pour l’IA et les sciences ce que 2025 a été pour l’IA et l’ingénierie logicielle. »
Traduction: Prism est le pari d’OpenAI pour un « Claude Code, mais pour les sciences. »
Ensuite, Agentic Vision de Google résout un problème dont vous ignoriez probablement l’existence
Quand une IA regarde une image, elle n’en a qu’un aperçu et, si elle ne repère pas un numéro de série sur une puce ou un panneau de signalisation au loin, elle devine. Gemini 3 Flash exécute désormais une boucle « Think, Act, Observe » sur les images. Concrètement :
- Think : planifier la manière d’examiner l’image.
- Act : écrire du code Python pour zoomer, recadrer ou annoter.
- Observe : réinjecter l’image modifiée dans le contexte et examiner les résultats.
Le résultat : une amélioration de la précision de 5 à 10 % sur les benchmarks de vision. En pratique, cela signifie que Gemini peut désormais dessiner des cadres autour des doigts pour les compter correctement, ou zoomer sur des plans de bâtiments afin de vérifier leur conformité aux normes. Une startup, PlanCheckSolver.com, a fait état d’un gain de précision de 5 % en activant simplement cette fonctionnalité pour l’examen de plans architecturaux.
Enfin, Kimi K2.5 de Moonshot pousse ce concept encore plus loin
La fonctionnalité « Agent Swarm » de Moonshot lance une équipe coordonnée d’agents spécialisés par domaine, qui s’attaquent en parallèle à des tâches complexes.
- Lors d’une démonstration, un seul prompt a généré un storyboard Excel de 100 Mo contenant 55 scènes visuelles cohérentes pour l’adaptation, en court métrage de 10 minutes, de « The Gift of the Magi ».
- Le modèle a décomposé la tâche, l’a déléguée à des sous-agents spécialisés, puis a réassemblé le résultat.
- Leur fonctionnalité de conversion de vidéo en code est tout aussi démesurée : enregistrez votre écran pendant que vous naviguez sur un site web, importez la vidéo, et K2.5 clone l’intégralité du site… y compris toutes les interactions et animations UX.
- (Oui, cela soulève d’importantes questions sur l’éthique du scraping web, mais tout le reste de l’IA actuelle en soulève aussi, alors j’imagine que tout fonctionne en mode YOLO jusqu’à ce que la Cour suprême tranche sur ces questions ??)
Pourquoi c’est important
Voici une antisèche pratique pour expliquer ce que tout cela signifie pour l’évolution, en 2026, de nos anciens paradigmes d’interaction (la manière dont nous travaillions avec l’IA).
| Ancien flux de travail | Nouveau flux de travail |
|---|---|
| Question → Réponse | L’IA enquête de son propre chef |
| Une seule fenêtre de contexte | Le contexte complet du document/projet |
| Agent unique | Équipes d’agents coordonnées |
| Traitement statique des images | Manipulation visuelle active |
Le fil conducteur ? L’IA n’attend plus que vous posiez la bonne question. Elle détermine quelles questions poser, quels outils utiliser et comment vérifier son propre travail.
Attendez-vous à ce que cette tendance s’accélère. Si votre travail implique de longs documents, des images complexes ou des recherches en plusieurs étapes, les outils que vous utiliserez dans six mois n’auront plus rien à voir avec ceux que vous utilisez aujourd’hui, probablement parce qu’ils effectueront eux-mêmes la moitié du travail.
Note de la rédaction : ce contenu a été publié à l’origine dans la newsletter de notre publication sœur, The Neuron. Pour découvrir davantage de contenus de The Neuron, inscrivez-vous à sa newsletter ici.

