339 experts en IA ont donné à quatre résultats de référence en IA une chance de 24,6 %, et aux superforecasters 9,7 %

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

Un panel de 339 experts en IA a donné une probabilité moyenne de 24,6 % à quatre résultats de référence en IA qui sont ensuite arrivés, et un groupe de superprévisions a donné les quatre mêmes résultats de 9,7 %. Les chiffres proviennent de l’examen de l’exactitude du Forecasting Research Institute, publié le 23 septembre.

Les quatre sont MATH, MMLU, QuALITY et une médaille d’or aux Olympiades mathématiques internationales, toutes prévues à la mi-2022 lors du tournoi de persuasion du risque existentiel de FRI. L’IA a atteint le niveau or de l’OMI en juillet 2025, cinq ans plus tôt que la prévision médiane des experts de 2030 et 10 ans plus tôt que la prévision médiane des superprévisions de 2035.

Le panel de FRI est composé de professeurs et de personnel de laboratoire

L’institut a recruté le genre de personnes qu’un décideur politique pourrait appeler. Son panel longitudinal d’experts en IA s’est ouvert avec 339 experts : 76 informaticiens, 76 employés de l’industrie de l’IA, 68 économistes et 119 chercheurs en politiques en matière d’IA.

Sur les 76 informaticiens, 41 sont des professeurs, 30 d’entre eux travaillent dans les 20 meilleures institutions et 10 font partie des 200 auteurs les plus cités dans le domaine de l’IA. Vingt des 76 panélistes de l’industrie travaillent chez OpenAI, Anthropic, Google DeepMind, Meta ou Nvidia, et 12 d’entre eux sont lauréats du TIME 100 AI.

Les ratés ne se sont pas arrêtés en 2022

Sur FrontierMath Tiers 1 à 3, l’expert médian a prédit que le modèle leader atteindrait 31 % d’ici la fin 2025 et le superforecaster médian 30 % ; la question résolue à 40,7%. Sur LiveCodeBench Pro (Hard), les médianes de 14 % et 12 % pour fin 2026 ont été dépassées en mai 2026 à 53,8 %.

Une question s’est rapprochée beaucoup plus, puis a vieilli en quelques semaines. Interrogés en avril et mai 2026 sur la durée d’une tâche que le meilleur modèle gérerait avec une fiabilité de 80 % d’ici la fin de l’année, les experts ont répondu 3,4 heures et les superforecasters 3,5. Le 8 mai, avant la fin de la période d’enquête, METR a répertorié Mythos Preview d’Anthropic à 3,1 heures.

Les prévisions de revenus ont été multipliées par cinq

FRI a également demandé le chiffre d’affaires récurrent annuel le plus élevé de toutes les entreprises axées sur l’IA d’ici fin 2026. Les experts en IA ont donné une médiane de 20 milliards de dollars, les économistes de 16 milliards de dollars et les superprévisions de 25 milliards de dollars, contre un chiffre que FRI évalue à 100 milliards de dollars au 22 septembre, sans nommer l’entreprise.

Tous les ratés ne se déroulent pas de la même manière. Dans un essai randomisé mené mi-2025 par Active Site, les experts en biosécurité ont prédit que 22,5 % d’un échantillon d’étudiants de premier cycle en STEM pourraient effectuer trois tâches liées aux risques biologiques avec l’aide d’un LLM, ont déclaré les virologues 40 % et les superprévisions 16,2 %. En fait, 5,2 % ont complété les trois.

FRI affirme clairement que sa méthodologie « est biaisée en faveur de l’identification des sous-estimations des progrès de l’IA plutôt que des surestimations ». Une valeur réelle dépassant une prévision médiane expose immédiatement un appel bas, tandis qu’un appel haut ne peut être jugé qu’une fois sa date de résolution arrivée, et la plupart des questions ne sont pas résolues.

Il s’agit de panels autosélectionnés plutôt que d’un échantillon aléatoire, et les 24,6 % et 9,7 % couvrent ces quatre critères, ce qui n’est pas toutes les questions posées par FRI. L’institut prévoit de continuer à publier des mises à jour sur la précision à mesure que les questions LEAP seront résolues, vague par vague, sur les pages du rapport du panel.

Ce qui laisse, c’est un record marqué, qui est plus que ce que la plupart des prédictions publiques sur l’IA n’ont jamais acquis, y compris le cas de Sam Altman contre ceux qui ont qualifié les grands modèles de langage d’impasse. Les quatre dernières années n’ont donné que très peu de raisons de se vanter aux experts du domaine.