La fluidité d'une réponse n'est pas une preuve de justesse
Un modèle peut produire une réponse parfaitement formulée et néanmoins fausse. La question opérationnelle n'est donc pas sa performance moyenne, mais le niveau de fiabilité exigé par la décision qu'on lui confie.
Un modèle peut être très performant sans être assez fiable pour engager automatiquement une marque, un prix ou une promesse client.
La performance suit une frontière dentelée
Les capacités d'un modèle ne forment pas un plateau régulier. Elles dessinent ce que les auteurs appellent une jagged technological frontier : très forte sur certaines tâches, instable sur d'autres — et la limite n'est pas visible pour celui qui utilise le modèle.
- Dans la frontièrePerformance élevée et gains réels. Dans l'expérience menée auprès de 758 consultants d'un cabinet international, l'assistance IA a permis de traiter 12,2 % de tâches supplémentaires et 25,1 % plus rapidement.
- À proximité de la frontièrePerformance difficile à prédire. Rien dans la formulation de la réponse ne signale que la tâche sort du domaine où le modèle est fiable.
- Hors frontièreL'assistance peut dégrader la décision. Dans cette même expérience, sur une tâche située hors de la frontière de compétence identifiée, les utilisateurs assistés par l'IA étaient 19 points de pourcentage moins susceptibles d'obtenir la bonne réponse.
Dell'Acqua et al. · Navigating the Jagged Technological Frontier · 2025 · expérience contrôlée auprès de 758 consultants — résultat propre à ce protocole — Consulter la source
Ce résultat ne dit pas que « l'IA fait perdre 19 points ». Il dit qu'à l'intérieur d'un même outil, deux tâches d'apparence voisine peuvent produire un gain net ou une perte nette, sans avertissement.
La fiabilité requise dépend de la conséquence de l'erreur
Un taux de réussite n'a pas de valeur dans l'absolu : il n'a de sens que rapporté à ce que coûte une erreur. Un système qui réussit 80 ou 90 % du temps peut être excellent pour produire un premier jet, suggérer une variante ou classer un contenu. La même fiabilité devient insuffisante pour modifier un prix, publier automatiquement, engager une promesse contractuelle ou dépenser un budget important.
METR formule le même principe côté évaluation : un horizon de tâche mesuré à 50 % de succès ne signifie pas que la tâche peut être déléguée. Certaines applications critiques exigent des niveaux de fiabilité supérieurs à 98 %.
METR · Time Horizons · 2025 · évaluation de capacités, non une mesure d'usage en entreprise — Consulter la source
C'est cette asymétrie qui justifie les permissions, les seuils, les niveaux d'autonomie différenciés et l'escalade humaine — non pas une méfiance de principe envers les modèles.
Plus de contexte ne garantit pas plus de compréhension
Élargir la fenêtre de contexte ne suffit pas à améliorer l'usage qui en est fait. Les travaux sur la position de l'information montrent que les modèles exploitent moins bien ce qui se trouve au milieu d'un long contexte qu'au début ou à la fin.
Liu et al. · Lost in the Middle · 2024 — Consulter la source
Une évaluation plus récente sur des textes longs constate qu'aucun des modèles testés ne maintient une compréhension stable au-delà de 64k tokens.
Hamilton et al. · Decomposing LLM long-context understanding with novels · 2026 · modèles évalués sur un protocole de compréhension de romans — Consulter la source
Augmenter la fenêtre disponible n'élimine donc pas le besoin de sélectionner, structurer et hiérarchiser l'information utile.
Les hallucinations relèvent du même registre : elles restent une limitation persistante des modèles génératifs et ne peuvent pas être traitées comme un problème entièrement éliminé.
OpenAI · Why language models hallucinate · 2025 — Consulter la source
Le coût pertinent est celui du résultat accepté
Le prix d'un token ne décrit qu'une fraction du coût réel. Ce qui compte est le coût complet d'un résultat utilisable :
coût réel = modèle + contrôle + corrections + escalades + erreurs + temps humain
Un modèle moins cher qui produit davantage de reprises peut coûter plus cher qu'un modèle plus cher intégré dans un système qui limite les reprises. C'est le système, pas le tarif unitaire, qui détermine l'économie.
Déplacer l'objet de la confiance
La confiance ne doit pas porter sur la capacité abstraite du modèle. Elle doit porter sur un système qui définit ce que le modèle peut faire, avec quelles données, dans quelles limites, avec quelles preuves et selon quels mécanismes de validation.
Deux domaines rendent cette exigence particulièrement concrète : la marque, où une erreur se propage, et l'orchestration et gouvernance, où les permissions et les seuils se décident.
- 01Production et validation
- 02Fiabilité des modèles
- 03Cohérence et risque de marque
- 04Internalisation et connaissance propriétaire
- 05Orchestration et gouvernance