Observatoire
Les réponses d'une IA sont-elles suffisamment stables pour éclairer une décision ?
Nos mesures montrent qu'une même IA peut mobiliser des critères différents pour répondre à une même question. Et si la stabilité était le critère à mesurer en premier ?
Pendant plusieurs années, la principale question posée à propos des intelligences artificielles génératives était simple :
« Les réponses sont-elles vraies ? »
Aujourd'hui, une autre question émerge.
Les réponses sont-elles suffisamment stables pour servir de base à une décision ?
Cette nuance est importante. Deux réponses peuvent être factuellement correctes tout en conduisant à des décisions différentes si elles ne mettent pas en avant les mêmes critères.
C'est précisément ce que met en évidence cette mesure LirenPrism.
Ce que nous avons mesuré
Pour cette étude, nous avons analysé les réponses de plusieurs fournisseurs d'IA à une même intention :
« Dans quelle activité me lancer pour créer mon entreprise en France ? »
La mesure compare deux contextes de réponse :
- les réponses produites à partir des connaissances internes du modèle ;
- les réponses produites lorsque le modèle s'appuie également sur des informations externes.
Au total, 40 interrogations ont été réalisées (20 par contexte), permettant de mesurer non seulement les réponses, mais surtout les critères mobilisés pour construire ces réponses.
Un phénomène plus profond qu'un simple changement de réponse
Le premier constat est contre-intuitif.
Les IA continuent de répondre à la même question.
En revanche, elles ne s'appuient plus sur les mêmes éléments pour y répondre.
Dans cette étude :
- la demande du marché reste présente dans 100 % des réponses, quel que soit le contexte ;
- l'écologie passe de 10 % à 80 % des réponses ;
- la performance, absente initialement, apparaît dans 60 % des réponses ;
- la sécurité atteint également 60 % ;
- la durabilité apparaît dans 55 % des réponses ;
- à l'inverse, le cadre réglementaire, présent dans 45 % des réponses dans un contexte, disparaît complètement dans l'autre.
Autrement dit, ce ne sont pas seulement les réponses qui évoluent.
Les priorités utilisées pour construire ces réponses évoluent elles aussi.
Pourquoi est-ce important ?
Lorsqu'une personne consulte une IA, elle cherche rarement une simple information.
Elle cherche souvent à prendre une décision :
- créer une entreprise ;
- choisir un fournisseur ;
- sélectionner un investissement ;
- comparer deux produits ;
- définir une stratégie.
Dans tous ces cas, les critères mis en avant influencent directement la décision finale.
Si ces critères changent selon le contexte de génération, alors deux réponses peuvent orienter l'utilisateur vers deux raisonnements différents, sans que la question initiale ait changé.
Cette étude ne permet pas de dire quelle réponse est la meilleure.
Elle montre simplement qu'une même IA peut construire sa réponse à partir d'un ensemble de priorités différent selon le contexte observé.
Un sujet qui mobilise désormais la recherche
Cette question dépasse largement cette seule étude.
Depuis plusieurs mois, les travaux de recherche s'intéressent de plus en plus à la stabilité, à la cohérence et à la robustesse des systèmes d'IA.
Des publications récentes montrent notamment que les systèmes de génération augmentée par recherche (RAG) peuvent produire des réponses différentes lorsque l'ordre des documents récupérés change, même si les mêmes informations sont présentes. D'autres travaux s'intéressent aux conflits entre les connaissances internes du modèle et les informations récupérées, car ces situations peuvent réduire la fiabilité des réponses et compliquer la prise de décision.
Ces recherches ne répondent pas exactement à la même question que LirenPrism.
Elles cherchent principalement à améliorer la qualité ou la cohérence des réponses.
Notre mesure observe un phénomène différent :
les critères mobilisés pour produire une réponse restent-ils stables ?
Une nouvelle façon d'évaluer les IA
Pendant longtemps, l'évaluation des IA s'est concentrée sur des notions comme :
- la précision ;
- les hallucinations ;
- les performances aux benchmarks.
Ces indicateurs restent essentiels.
Mais ils ne répondent pas à une autre interrogation fondamentale :
L'IA mobilise-t-elle toujours les mêmes critères lorsqu'elle répond à une même intention ?
Cette stabilité est pourtant essentielle dès lors que les réponses servent à orienter une décision stratégique, économique ou personnelle.
Ce que cette étude démontre
Cette mesure démontre un fait.
Pour l'intention analysée, les critères mis en avant par les IA ne restent pas identiques selon le contexte de génération. Certains deviennent beaucoup plus présents, d'autres disparaissent totalement, tandis que d'autres restent constants.
En revanche, cette étude ne permet pas d'affirmer qu'une réponse est plus juste qu'une autre, ni que les décisions prises seraient meilleures ou moins bonnes.
Elle met simplement en évidence un phénomène mesurable :
la stabilité des critères utilisés par une IA n'est pas acquise.
À mesure que les intelligences artificielles deviennent des outils d'aide à la décision, cette stabilité pourrait devenir un indicateur aussi important que la précision elle-même.
Testez gratuitement : créez un compte LirenPrism, entrez le code LIREN2026 et recevez 2 mAIr gratuits.