Le responsable scientifique de Biohub, Alex Rives, affirme que les jeux de données existants couvrent des centaines de millions de cellules, tandis que des « cellules virtuelles » d’IA fiables pourraient nécessiter des données provenant de milliards, voire à terme de milliers de milliards de cellules. Google et Meta rejoignent un effort de 1,8 milliard de dollars visant à combler cet écart.
Le 7 octobre, Biohub, l’organisation à but non lucratif fondée par Mark Zuckerberg et Priscilla Chan, a annoncé l’arrivée de nouveaux partenaires gouvernementaux et technologiques, qui viennent renforcer sa Virtual Biology Initiative. Le projet consiste à créer des jeux de données biologiques standardisés pour des modèles d’IA capables de prédire la réaction des cellules à des médicaments ou à des changements de leur environnement. Les scientifiques pourraient à terme tester leurs hypothèses numériquement avant de consacrer du temps et de l’argent au laboratoire, mais l’annonce ne présente pas de modèle universel de cellule virtuelle achevé.
Les 1,8 milliard de dollars derrière le projet de cellules virtuelles de Biohub
Reuters a rapporté que l’initiative combine de nouveaux investissements et des ressources de recherche financées auparavant. Google DeepMind, Meta et Isomorphic Labs investissent collectivement 300 millions de dollars, et non 300 millions de dollars chacun.
Contributeur | Engagement | Rôle |
| Biohub | 500 millions de dollars promis en avril | 400 millions de dollars pour les technologies de mesure ; 100 millions de dollars pour la recherche externe |
| Google DeepMind, Meta, Isomorphic Labs | 300 millions de dollars au total | Investissement privé |
| Département de l’Énergie des États-Unis | Plus de 500 millions de dollars sur cinq ans | Mesure, modélisation et calcul |
| Instituts nationaux de la santé | Ressources issues de plus de 500 millions de dollars de financements antérieurs | Jeux de données et référentiels existants |
La contribution des NIH ne correspond pas à de nouveaux fonds promis. Les dépenses du DOE s’étalent également sur cinq ans, ce qui fait du chiffre de 1,8 milliard de dollars une combinaison de financements et d’actifs existants.
La construction de cellules virtuelles commence par des données biologiques réelles
Une cellule virtuelle utiliserait des mesures issues d’expériences réelles pour prédire la réaction d’une cellule à une intervention. The Verge a indiqué que Biohub espère ainsi permettre aux scientifiques d’étudier des questions biologiques par voie numérique et de sélectionner les expériences prometteuses à mener en laboratoire.
Mesurer les cellules vivantes à grande échelle
Les chercheurs recueilleront des données au moyen de la transcriptomique spatiale, qui cartographie l’activité moléculaire au sein des tissus, ainsi que de criblages mesurant les réactions cellulaires. Interesting Engineering a décrit d’autres outils, notamment la tomographie électronique cryogénique et des systèmes de microscopie conçus pour imager des millions ou des milliards de cellules.
Le Département de l’Énergie contribuera avec les capacités des laboratoires nationaux, notamment le calcul exascale et des équipements d’imagerie. NVIDIA fournit des capacités de calcul accéléré et un soutien technique. Biohub prévoit des normes communes afin que les laboratoires puissent combiner leurs mesures en jeux de données d’entraînement exploitables.
Entraîner l’IA à prédire le comportement cellulaire
La collecte de données supplémentaires ne constitue qu’une partie du défi. Les chercheurs doivent également vérifier que les modèles prédisent correctement les réactions cellulaires lors d’expériences sur lesquelles ils n’ont pas été entraînés.
Axios a souligné une autre incertitude : personne ne sait encore si les modèles de cellules entières progresseront de manière prévisible à mesure que les jeux de données biologiques s’enrichiront, comme certains autres modèles d’IA l’ont fait. Le média a cité le vieillissement, la régénération et la maladie d’Alzheimer parmi les questions à plus long terme que des cellules prédictives pourraient aider à étudier. Une grande partie des données d’entraînement manquantes doit d’abord être produite au moyen d’expériences physiques.
Ce qu’a constaté eWeek : la précision est le véritable test
Le titre de 1,8 milliard de dollars combine de nouveaux engagements et des ressources scientifiques existantes, plutôt que de représenter exclusivement de nouveaux fonds. Pour les entreprises de biotechnologie et les équipes de recherche, l’étape déterminante à surveiller sera de voir si ces modèles peuvent prédire les réactions cellulaires lors d’expériences sur lesquelles ils n’ont pas été entraînés. L’accès anticipé aux données par les partenaires commerciaux pourrait leur donner une longueur d’avance dans leurs recherches, mais l’accès seul ne suffit pas à établir la précision prédictive. Tant que des tests en laboratoire n’auront pas validé ces prédictions, le développement accéléré de médicaments restera un objectif plutôt qu’un bénéfice démontré.
Les jeux de données finiront par être rendus publics, mais les partenaires commerciaux y auront accès en premier. Axios a rapporté que les entreprises qui financent la recherche bénéficieront d’un accès exclusif d’un an aux données qu’elles contribuent à produire.
Biohub a également déclaré que cet accord encourage l’investissement privé tout en garantissant que la recherche reste accessible à long terme à la communauté scientifique. Reuters a souligné que les travaux financés par le gouvernement ne seront pas soumis à la même restriction.
Biohub prévoit son premier jeu de données dans environ un an
Rives a déclaré à Reuters qu’il prévoyait un premier jeu de données dans environ un an et des modèles prédictifs fiables dans les cinq ans. Il s’agit d’objectifs de recherche et non de dates de livraison garanties. Les chercheurs devront vérifier si les modèles entraînés sur ces données prédisent correctement les réactions cellulaires lors de nouvelles expériences.
Les premiers résultats devraient permettre aux scientifiques de mieux évaluer la faisabilité de cette approche à plus grande échelle. Des expériences en laboratoire resteront nécessaires pour vérifier les prédictions des modèles, mais des résultats fiables pourraient à terme aider les chercheurs à identifier des traitements prometteurs et à étudier les maladies plus efficacement.
À lire également : même si les cellules virtuelles restent un objectif de recherche, l’agent d’IA clinique d’Oracle s’étend au codage médical et à la revue des dossiers, montrant comment l’IA est appliquée aux processus de travail du secteur de la santé.


