l’IA générative va faire disparaître les interfaces graphiques ? A mon avis, pas vraiment…
Depuis trois ans, la prophétie circule dans toutes les keynotes : l’IA générative va faire disparaître les interfaces graphiques. Plus de menus, plus d’onglets, plus de formulaires à seize champs obligatoires. Il suffira de dire ce que l’on veut, et la machine s’exécutera. Les écrans rejoindront la carte perforée au musée de l’informatique, aux côtés du modem et du fax.
Pendant ce temps, dans la vraie vie, l’industrie de l’IA a passé l’année 2026 à faire exactement l’inverse. Elle a normalisé un protocole permettant à un agent d’afficher des boutons.
Cet article tente d’examiner ce décalage, ce qu’il révèle du paradigme conversationnel, et surtout ce qui casserait réellement dans un système d’information d’entreprise si l’on poussait la logique jusqu’au bout.
Le troisième paradigme, et le petit détail qu’on oublie de citer
Le socle théorique du discours ambiant vient de Jakob Nielsen (le pape de l’UX), qui posait en 2023 que l’IA générative constitue le troisième paradigme d’interaction de l’histoire de l’informatique. Le premier fut le traitement par lots, le second l’interaction par commande, qui englobe aussi bien la ligne de commande que l’interface graphique. Le troisième est celui de la spécification d’intention : l’utilisateur décrit le résultat voulu, et non la suite des opérations à réaliser.
Nielsen nomme lui-même la conséquence, et c’est la partie que les slides enthousiastes coupent systématiquement : il s’agit d’un renversement du lieu de contrôle. Si l’utilisateur ne spécifie plus les étapes, il ne peut plus les vérifier. Et s’il ne peut plus les vérifier, il ne lui reste qu’à faire confiance au résultat 🙂
On notera au passage une coïncidence géniale. Dans la taxonomie de Nielsen, le premier paradigme consistait à soumettre une pile d’instructions et à attendre un résultat dont on ne pouvait pas suivre l’élaboration. Tout architecte ayant regardé un agent tourner pendant quatre minutes avec un aimable « je consulte vos données » reconnaîtra la scène. Le troisième paradigme ressemble beaucoup au premier, avec une meilleure conversation et une facture de tokens en supplément.
MCP Apps, ou la capitulation élégante
Venons-en au fait technique majeur de l’année, curieusement peu commenté en France.
En novembre 2025, une proposition d’extension au Model Context Protocol est déposée conjointement par des mainteneurs d’OpenAI et d’Anthropic, avec les créateurs de MCP-UI, sous la référence SEP-1865. Fin janvier 2026, elle devient la première extension officielle du protocole, identifiée io.modelcontextprotocol/ui.
Son objet est limpide. Jusque-là, un serveur MCP ne pouvait échanger avec un hôte que du texte et des données structurées. Avec l’extension, il peut déclarer des ressources d’interface sous un schéma d’URI dédié, ui://, associer ces ressources à ses outils via des métadonnées, et renvoyer une interface HTML interactive en réponse à un appel d’outil. L’hôte rend ce contenu dans une iframe isolée, et la communication bidirectionnelle entre le composant et l’hôte réutilise le socle JSON-RPC existant du protocole, transporté par postMessage. Pas de nouveau format de message inventé pour l’occasion, ce qui est une décision d’ingénierie élégante.
Les choix de sécurité méritent l’attention des RSSI. Le rendu se fait en iframe avec permissions restreintes, les gabarits HTML sont prédéclarés afin que l’hôte puisse les inspecter avant affichage, et les échanges sont auditables. La première version de la spécification n’accepte que du contenu text/html, les URL externes, le DOM distant et les composants natifs étant explicitement renvoyés à plus tard. Autrement dit : surface d’attaque volontairement réduite au départ.
Le résultat concret, c’est qu’un serveur d’analyse commerciale ne renvoie plus une colonne de chiffres dans un mur de texte, mais un tableau de bord filtrable, avec des formulaires conditionnels et des workflows en plusieurs étapes, rendu dans la conversation elle-même. Les clients majeurs, dont ChatGPT, Claude, Goose et Visual Studio Code, ont livré le support.
Résumons la séquence pour l’histoire. L’industrie annonce en 2023 que l’IA va tuer les interfaces. Elle constate en 2024 et 2025 que le mur de texte devient insupportable dès que la tâche se complique. Elle normalise en 2026 un moyen standard de renvoyer des formulaires et des graphiques dans le chat. Ce n’est pas un échec, c’est un apprentissage. Mais appelons les choses par leur nom : c’est le grand retour du widget… On tourne en rond.
Ce que l’interface faisait vraiment, et que le langage ne remplace pas
L’exercice de pensée vaut la peine d’être mené jusqu’au bout. Supposons qu’un éditeur supprime réellement toute interface graphique de son produit. Que casse-t-il exactement ?
Il casse d’abord la preuve. Une interface n’est pas seulement un moyen d’agir, c’est un dispositif probatoire. On en fait des captures d’écran, on les joint aux dossiers, on les archive dans les procédures, on les produit en justice. Supprimez l’écran de validation daté et signé, et il ne reste qu’un journal de conversation, c’est-à-dire un texte produit par un système probabiliste décrivant ce qu’il affirme avoir fait. Le calendrier réglementaire n’est pas favorable à cette approche : depuis le 2 août 2026, les obligations de transparence de l’article 50 du règlement européen sur l’IA et le régime de sanctions sont applicables, le paquet Digital Omnibus n’ayant repoussé au 2 décembre 2027 que les obligations relatives aux systèmes à haut risque de l’annexe III. Ajoutons l’article 22 du RGPD sur les décisions automatisées, et la question devient simple : comment démontrez-vous qu’un humain est intervenu, et quand ?
Il casse ensuite l’accessibilité, et c’est le paradoxe le plus spectaculaire du dossier, puisque la suppression des écrans est souvent vendue comme un progrès d’inclusion. Depuis le 28 juin 2025, l’European Accessibility Act étend les obligations au secteur privé, la conformité se démontrant via la norme EN 301 549 et, pour la partie web, via le RGAA 4.1.2, avec en France des sanctions pouvant atteindre 50 000 euros par service. Tout ce corpus repose sur une hypothèse : il existe une structure d’interface stable, nommée, navigable au clavier, sur laquelle une technologie d’assistance peut s’appuyer. Une interface régénérée à chaque appel n’offre aucune prise à un lecteur d’écran. Le conversationnel aide certaines situations de handicap et en pénalise sévèrement d’autres, notamment les troubles cognitifs et de l’attention.
Il casse également l’égalité d’accès à l’outil de travail. Un écran fonctionne par reconnaissance : il montre les options, et l’utilisateur identifie celle dont il a besoin. Un champ de texte fonctionne par rappel, il exige de produire de mémoire la formulation adéquate. Nielsen a nommé ce problème la barrière d’articulation. Traduit en langage d’entreprise : la performance individuelle cesse de dépendre de la maîtrise de l’outil métier et se met à dépendre de la maîtrise de l’expression écrite. Les gagnants seront les cadres à l’aise à l’écrit, les perdants ceux qui connaissaient parfaitement le métier et médiocrement les mots.
Il casse enfin la friction utile. Le formulaire de confirmation, le récapitulatif avant virement, le champ à ressaisir sont des ralentisseurs délibérés, c’est-à-dire des contrôles internes. Un agent qui exécute une intention de bout en bout les supprime, et c’est même son argument de vente. Dans un contexte NIS2, expliquer que l’on a retiré volontairement les points de contrôle humains pour gagner en fluidité est une conversation que nous ne souhaitons à personne.
Les agents savent cliquer, pas toujours au bon endroit…
Un mot sur l’état réel de la technique, car la prospective sans mesure relève de l’astrologie.
Sur des tâches web simples, les agents pilotant un navigateur affichent des taux de réussite annoncés autour de 87 à 89 % sur le benchmark WebVoyager selon les acteurs. Dès que l’on passe à des environnements de bureau complets, de type OSWorld, les scores se dispersent violemment, de l’ordre de 38 % pour certains agents contre plus de 70 % pour les meilleurs modèles. Traduction pour une DSI : un agent réussit une large majorité de vos tâches, et vous ne savez pas à l’avance lesquelles il va rater.
Ajoutons le point que l’on évite en comité de pilotage. OpenAI a reconnu fin 2025 que l’injection de prompt dans les navigateurs agentiques pourrait ne jamais être totalement résolue. Ce n’est pas une anomalie à corriger, c’est une propriété du paradigme. Et selon une étude Deloitte de 2026, environ une organisation sur cinq seulement dispose d’un modèle de gouvernance mature pour ses agents. C’est dans ce contexte que certains proposent de retirer les écrans.
Le verrou change d’étage, et c’est le vrai sujet stratégique
Il y a une conséquence importante pour les directions informatiques.
Depuis vingt ans, le verrou fournisseur se situait au niveau applicatif : les données, les formats, les processus. Dans un monde d’intentions et de capacités exposées via un protocole standard, l’application devient un fournisseur interchangeable. Excellente nouvelle en apparence. Sauf que le verrou ne disparaît pas, il remonte d’un étage, vers la couche d’orchestration, c’est-à-dire l’assistant, le copilote ou le navigateur agentique qui décide quel outil appeler et dans quel ordre.
Cela change le contenu du travail d’une DSI. Négocier le contrat ERP devient secondaire. Négocier qui possède la couche d’orchestration, où elle s’exécute, quelles données la traversent, quelles traces elle conserve et quelle réversibilité existe devient l’enjeu central des trois prochaines années. Ce débat n’a lieu aujourd’hui dans presque aucun comité de direction.
Le modèle économique suit le même mouvement. L’interface était le lieu où se matérialisait la notion de siège, puisqu’un siège c’est un humain devant un écran. Une enquête menée en avril 2026 auprès de 300 dirigeants d’éditeurs SaaS livre un résultat délicieusement contradictoire : 97 % déclarent vouloir abandonner la facturation au siège sous deux ans, et 94 % reconnaissent qu’elle reflète encore correctement la valeur de leur produit. Le marché se stabilise en pratique sur des modèles hybrides, abonnement de base plus crédits de consommation. Pour une direction des achats, cela signifie la fin de la comparaison fonctionnelle par les démonstrations d’écrans, et l’apparition d’une ligne budgétaire indexée sur la verbosité des collaborateurs. Nous n’avons pas encore vu d’entreprise budgéter la loquacité.
Ce qui va, à mon avis, réellement se passer
Ni disparition, ni statu quo. Subordination.
L’interface cesse d’être le produit et devient un rendu, convoqué par l’agent quand la tâche l’exige. Trois régimes vont coexister durablement, et c’est à l’architecte d’entreprise de tracer la frontière avant que les éditeurs ne la tracent à sa place.
Le régime conversationnel convient aux interrogations, aux synthèses et aux déclenchements simples. C’est acquis, et le gain est réel.
Le régime génératif convient à la configuration, à la comparaison et à l’arbitrage, à une condition impérative : que les composants soient sélectionnés dans une bibliothèque fermée, versionnée et testée pour l’accessibilité, et non rédigés librement par un modèle. C’est exactement ce que rend possible MCP Apps avec ses gabarits prédéclarés. La différence entre un système auditable et un générateur d’hypothèses tient à cette clause contractuelle.
Le régime stable et immuable reste obligatoire partout où l’entreprise engage sa responsabilité : validation financière, signature, actes RH, administration d’infrastructure. Non par conservatisme, mais parce qu’un écran identique pour tous et à chaque fois est la condition d’un audit possible.
Conclusion
L’IA générative n’a pas tué l’interface utilisateur. Elle a fait quelque chose de plus intéressant : elle a révélé à quoi celle-ci servait vraiment.
Nous pensions que l’écran servait à commander la machine. Il servait en réalité à quatre choses que nous ne comptions pas, parce qu’elles étaient gratuites : montrer ce qui est possible, enseigner le fonctionnement du métier, produire une preuve opposable, et ralentir au bon moment.
Le langage naturel remplace admirablement la première fonction, la commande. Il ne remplace aucune des quatre autres. Et ce sont précisément celles dont une entreprise européenne régulée et auditée ne peut pas se passer.
L’entreprise sans interface est donc techniquement réalisable et juridiquement indéfendable. Ce qui nous attend n’est pas la mort des écrans mais leur relégation et leur transformation en objet de conformité. Le travail de la DSI n’est pas de résister à ce mouvement. Il est de décider, avant ses fournisseurs, où l’écran reste obligatoire. La réponse se trouve à l’endroit exact où l’entreprise engage sa responsabilité, c’est-à-dire, si l’on y réfléchit, à peu près partout où l’informatique sert à quelque chose.