Aller au contenu
Article 2 sur 5

La fluidité d'une réponse n'est pas une preuve de justesse

Un modèle peut produire une réponse parfaitement formulée et néanmoins fausse. La question opérationnelle n'est donc pas sa performance moyenne, mais le niveau de fiabilité exigé par la décision qu'on lui confie.

La thèse

Un modèle peut être très performant sans être assez fiable pour engager automatiquement une marque, un prix ou une promesse client.

La performance suit une frontière dentelée

Les capacités d'un modèle ne forment pas un plateau régulier. Elles dessinent ce que les auteurs appellent une jagged technological frontier : très forte sur certaines tâches, instable sur d'autres — et la limite n'est pas visible pour celui qui utilise le modèle.

  1. Dans la frontière
    Performance élevée et gains réels. Dans l'expérience menée auprès de 758 consultants d'un cabinet international, l'assistance IA a permis de traiter 12,2 % de tâches supplémentaires et 25,1 % plus rapidement.
  2. À proximité de la frontière
    Performance difficile à prédire. Rien dans la formulation de la réponse ne signale que la tâche sort du domaine où le modèle est fiable.
  3. Hors frontière
    L'assistance peut dégrader la décision. Dans cette même expérience, sur une tâche située hors de la frontière de compétence identifiée, les utilisateurs assistés par l'IA étaient 19 points de pourcentage moins susceptibles d'obtenir la bonne réponse.

Dell'Acqua et al. · Navigating the Jagged Technological Frontier · 2025 · expérience contrôlée auprès de 758 consultants — résultat propre à ce protocole — Consulter la source

Ce résultat ne dit pas que « l'IA fait perdre 19 points ». Il dit qu'à l'intérieur d'un même outil, deux tâches d'apparence voisine peuvent produire un gain net ou une perte nette, sans avertissement.

La fiabilité requise dépend de la conséquence de l'erreur

Un taux de réussite n'a pas de valeur dans l'absolu : il n'a de sens que rapporté à ce que coûte une erreur. Un système qui réussit 80 ou 90 % du temps peut être excellent pour produire un premier jet, suggérer une variante ou classer un contenu. La même fiabilité devient insuffisante pour modifier un prix, publier automatiquement, engager une promesse contractuelle ou dépenser un budget important.

METR formule le même principe côté évaluation : un horizon de tâche mesuré à 50 % de succès ne signifie pas que la tâche peut être déléguée. Certaines applications critiques exigent des niveaux de fiabilité supérieurs à 98 %.

METR · Time Horizons · 2025 · évaluation de capacités, non une mesure d'usage en entreprise — Consulter la source

C'est cette asymétrie qui justifie les permissions, les seuils, les niveaux d'autonomie différenciés et l'escalade humaine — non pas une méfiance de principe envers les modèles.

Plus de contexte ne garantit pas plus de compréhension

Élargir la fenêtre de contexte ne suffit pas à améliorer l'usage qui en est fait. Les travaux sur la position de l'information montrent que les modèles exploitent moins bien ce qui se trouve au milieu d'un long contexte qu'au début ou à la fin.

Liu et al. · Lost in the Middle · 2024 — Consulter la source

Une évaluation plus récente sur des textes longs constate qu'aucun des modèles testés ne maintient une compréhension stable au-delà de 64k tokens.

Hamilton et al. · Decomposing LLM long-context understanding with novels · 2026 · modèles évalués sur un protocole de compréhension de romans — Consulter la source

Augmenter la fenêtre disponible n'élimine donc pas le besoin de sélectionner, structurer et hiérarchiser l'information utile.

Les hallucinations relèvent du même registre : elles restent une limitation persistante des modèles génératifs et ne peuvent pas être traitées comme un problème entièrement éliminé.

OpenAI · Why language models hallucinate · 2025 — Consulter la source

Le coût pertinent est celui du résultat accepté

Le prix d'un token ne décrit qu'une fraction du coût réel. Ce qui compte est le coût complet d'un résultat utilisable :

coût réel = modèle + contrôle + corrections + escalades + erreurs + temps humain

Un modèle moins cher qui produit davantage de reprises peut coûter plus cher qu'un modèle plus cher intégré dans un système qui limite les reprises. C'est le système, pas le tarif unitaire, qui détermine l'économie.

Conséquence opérationnelle

Déplacer l'objet de la confiance

La confiance ne doit pas porter sur la capacité abstraite du modèle. Elle doit porter sur un système qui définit ce que le modèle peut faire, avec quelles données, dans quelles limites, avec quelles preuves et selon quels mécanismes de validation.

Deux domaines rendent cette exigence particulièrement concrète : la marque, où une erreur se propage, et l'orchestration et gouvernance, où les permissions et les seuils se décident.

La série, en cinq temps
  1. 01
    Production et validation
  2. 02
    Fiabilité des modèles
  3. 03
    Cohérence et risque de marque
  4. 04
    Internalisation et connaissance propriétaire
  5. 05
    Orchestration et gouvernance

Voir comment CAIAC borne ce qu'un modèle peut faire, et avec quelles données.