Quand les LLM peinent à inventer : limites, illusions et enjeux pour la recherche
La question des capacités réelles des grands modèles de langage (LLM) en mathématiques fait l'objet d'un débat animé dans la communauté scientifique, alimenté par plusieurs travaux et prises de position récentes. D'un côté, une étude présentée à la conférence ICML 2026 par Tom Zahavy, chercheur chez Google DeepMind, intitulée « LLMs can't jump », propose un cadre analytique pour caractériser les limites de ces systèmes. L'auteur y distingue trois formes de raisonnement — l'induction, la déduction et l'abduction — pour mieux cerner ce que les LLM font ou ne font pas lorsqu'ils sont confrontés à des problèmes nouveaux.
De leur côté, deux mathématiciens de premier plan, Timothy Gowers, médaillé Fields, et Peter Sarnak, portent un jugement nuancé sur ces outils. Ils reconnaissent que les LLM sont performants pour assembler et combiner des techniques mathématiques déjà connues, mais ils estiment que ces systèmes sont dépourvus de l'intuition nécessaire à la production d'idées véritablement originales. Cette distinction entre capacité computationnelle et créativité constitue le coeur de leur analyse.
Pourtant, les mêmes sources soulignent des avancées concrètes qui compliquent ce tableau. Un modèle d'OpenAI aurait ainsi résolu une conjecture de Paul Erdos portant sur la géométrie à distance unitaire, restée ouverte depuis 1946, en mobilisant des outils issus de la théorie des nombres algébriques — une approche jugée inédite par les experts. Ce résultat, validé par neuf mathématiciens et supervisé par trois chercheurs d'OpenAI, a conduit Gowers lui-même à qualifier cette avancée de jalon important pour l'IA en mathématiques, tout en notant qu'il devient de plus en plus difficile pour les humains de rivaliser sur certains terrains.
Par ailleurs, les progrès des LLM semblent plus marqués dans les domaines où les résultats sont vérifiables, comme la programmation ou les preuves formelles, notamment grâce aux techniques d'apprentissage par renforcement. En revanche, des travaux récents montrent que les hallucinations de ces modèles — leurs réponses fausses mais assurées — ne résultent pas d'un simple manque de données, mais sont ancrées dans leur architecture même : les trajectoires internes des modèles peuvent diverger et s'éloigner activement des bonnes réponses.
Ce tableau d'ensemble dessine une réalité contrastée : des LLM capables de performances surprenantes sur des problèmes précis et vérifiables, mais dont la créativité mathématique au sens fort — celle qui consiste à forger des concepts radicalement nouveaux — reste, pour l'heure, une limite reconnue par les spécialistes eux-mêmes.
Sources : atlantico.fr · briefia.fr
Actu