
Une revue d'audit accablante sur le trading agentique
Sur soixante-dix-sept études recensées, dix-neuf travaux empiriques : deux seulement livrent un découpage temporel qui interdit de tricher avec le futur, un seul modélise les coûts de transaction, un seul documente le biais de survie et aucun n'atteint un niveau de reproductibilité sérieux.
arxiv.org ↗

KTD-Fin : l'alpha qui n'en était pas
KTD-Fin, un banc d'essai conçu pour ce démêlage, masque les noms de sociétés et les dates, puis décompose les rendements d'un agent à la manière du modèle de Barra, en séparant ce qui vient du marché, du style et de la vraie sélection de titres. Une fois ce tri fait, l'essentiel des gains s'explique par le bêta et le style, non par un flair persistant pour les bons titres.
arxiv.org ↗

AI-Trader : six modèles en trading réel
AI-Trader, banc d'essai en direct et automatisé qui, d'octobre à novembre 2025, met aux commandes de la négociation des agents fondés sur six grands modèles, sur trois marchés réels (actions américaines, actions chinoises et crypto), tire une leçon jumelle : le savoir général d'un modèle ne fait pas de lui un bon opérateur de marché. L'avantage tient non à la puissance de raisonnement mais au contrôle du risque, qui devient déterminant.
arxiv.org ↗

Des agents trop rationnels pour former une bulle
Le dispositif reprend le protocole classique de marché de laboratoire, une valeur fondamentale connue et fixe, ici quatorze unités, autour de laquelle le prix devrait osciller. L'erreur quadratique moyenne mesure, à chaque instant, l'écart entre le prix affiché et cette valeur de référence, met cet écart au carré, puis fait la moyenne sur toute la séance. Sur ce banc, l'erreur quadratique moyenne par rapport à cette valeur tombe sous l'unité pour les meilleurs modèles, contre un ordre de grandeur de quatre cents pour les participants humains : un fossé de près de mille pour un ; ces modèles sont les têtes de série de laboratoires concurrents, éprouvées côte à côte, qui convergent toutes vers la même sagesse désincarnée : ce ne sont pas d'obscurs prototypes.
arxiv.org ↗

Détecter les fuites d'eau et de méthane depuis l'espace
Un modèle localise les fuites d'un réseau d'eau par imagerie satellite, un autre repère depuis l'espace un panache de méthane sur un gazoduc et alerte l'opérateur.
thameswater.co.uk ↗ prnewswire.com ↗

DeepMind et Ericsson : agir sous garde-fous
Le système de DeepMind qui pilote le refroidissement des centres de Google le fait derrière huit couches de sûreté et un opérateur qui peut, à tout instant, l'exclure : l'agent écarte de lui-même les propositions où sa confiance est basse et si une consigne viole une borne de sûreté, le système retombe seul sur un réglage neutre au lieu de forcer le passage. L'économie obtenue, environ 30 % sur l'énergie de refroidissement une fois le système rodé. Le premier réseau mobile certifié « autonome de niveau 4 » (TDC NET et Ericsson) n'agit sans approbation humaine que dans un périmètre étroit : l'économie d'énergie d'une cellule radio, sous une intention qui le borne.
deepmind.google ↗ ericsson.com ↗

Cinq pannes majeures, aucune IA
La panne mondiale de Meta d'octobre 2021 est venue d'une commande de maintenance et de l'outil de vérification bogué censé l'arrêter ; celle d'Amazon Web Services, d'un emballement de l'ajustement automatique de capacité ; la crise électrique du Texas de février 2021, du gel et du couplage serré entre gaz et électricité, avec une vingtaine de gigawatts de délestage. Deux incidents plus anciens sur l'eau et le gaz confirment le motif, sans la moindre IA non plus : en février 2021, un intrus connecté à distance, sans autorisation, à la station de traitement d'eau d'Oldsmar (Floride) a tenté de porter la concentration de soude caustique de 100 à 11 100 parties par million, un opérateur corrigeant la dose avant tout effet réel ; en mai 2021, une intrusion purement informatique (mot de passe VPN compromis, sans double authentification) a conduit Colonial Pipeline à arrêter par précaution le principal oléoduc de la côte Est américaine, provoquant pénuries et achats de panique sans qu'aucun composant physique n'ait été touché.
engineering.fb.com ↗ aws.amazon.com ↗ ferc.gov ↗ cisa.gov ↗ cisa.gov ↗

Surtrac et la détection de mauvaises herbes : le temps de la boucle
Le pilote Surtrac, conçu par le Robotics Institute de Carnegie Mellon et déployé en 2012 dans le quartier d'East Liberty à Pittsburgh, laisse chaque carrefour calculer seul, en temps réel et sans plan centralisé rigide, l'horaire de son propre feu ; le pilote réduit de 40 % le temps d'attente aux feux et de 26 % le temps de trajet. Un pulvérisateur agricole guidé par un modèle de vision qui confond une mauvaise herbe et une jeune pousse traite au mauvais endroit : le coût ne se lit qu'à la récolte, quand la correction coûte cher.
cmu.edu ↗ arxiv.org ↗

Slack AI : un message public vide les canaux privés
En août 2024, le cabinet de recherche PromptArmor documente une injection de prompt indirecte contre Slack AI : un message posté dans un canal public, visible de tout le personnel même sans en être membre, contient une instruction cachée que l'assistant ingère dans sa base de récupération ; interrogé ensuite par un utilisateur, il obéit à cette instruction et restitue un lien dont l'URL encode des secrets tirés de canaux privés, jusqu'à des clés d'API, vers un serveur choisi par l'attaquant.
promptarmor.com ↗

EchoLeak : Copilot exfiltre sans un seul clic
Le 11 juin 2025, la société Aim Security publie EchoLeak (CVE-2025-32711, score CVSS 9,3), une vulnérabilité zéro-clic (l'exploitation ne demande aucune action de la victime, ni ouvrir un lien, ni cliquer nulle part) de Microsoft 365 Copilot : un simple courriel reçu suffit à déclencher l'exfiltration. Le courriel dissimule ses instructions en texte invisible ; Copilot les lit lors d'une requête anodine de l'utilisateur, contourne le classificateur dédié aux attaques par injection d'invite croisée (cross-prompt injection attack, XPIA), celui qui doit repérer une instruction glissée dans un contenu tiers plutôt que formulée par l'utilisateur, et la mise en liens sécurisée, puis restitue le contenu dérobé, courriels, fichiers OneDrive et SharePoint, messages Teams, encodé dans l'URL d'une image chargée automatiquement vers un serveur extérieur. Microsoft corrige côté serveur le mois même, sans qu'aucune action ne soit requise des utilisateurs et sans exploitation recensée dans la nature.
arxiv.org ↗

Comet : le navigateur agentique lit la page et lui obéit
En août 2025, Brave documente une injection de prompt indirecte contre Comet, le navigateur agentique de Perplexity : une page web ouverte dans un onglet contient une instruction cachée, texte blanc sur fond blanc ou commentaire HTML, que l'agent lit dès qu'on lui demande d'en résumer le contenu ; l'instruction le détourne alors vers un autre onglet, ouvert et authentifié, d'où il extrait adresse courriel, code à usage unique et identifiants du compte. Perplexity reconnaît la faille le 27 juillet et publie un premier correctif ; le retest de Brave, le lendemain, le trouve incomplet.
brave.com ↗

Ubuntu Canonical documente la vitesse nouvelle des failles
En 2026, Ubuntu Canonical documente publiquement (cas observé) que les modèles de frontière accroissent le volume et la vitesse de découverte des vulnérabilités, jusqu'à « militariser » d'anciennes failles dormantes du code hérité.
ubuntu.com ↗
La réponse structurelle de Canonical
Confinement : on borne le « rayon d'explosion » (blast radius) d'une faille par isolation stricte au niveau du noyau (AppArmor, un dispositif qui restreint, profil par profil, les fichiers et actions accessibles à chaque programme) et par conteneurs (LXD, un outil qui fait tourner chaque application dans son propre environnement cloisonné), de sorte qu'une vulnérabilité d'un composant applicatif reste contenue par les protections structurelles des couches inférieures. Prévention structurelle : adoption de langages sûrs en mémoire (Rust) là où la pile historique en C/C++ expose des classes entières de failles. Proportionnalité : un modèle de risque à plusieurs niveaux (fondation critique : noyau, glibc, OpenSSL, sudo ; puis infrastructure, écosystème applicatif, charges sur mesure) évite qu'un afflux massif de CVE découvertes par l'IA ne déclenche une réponse panique, uniforme et donc mal calibrée. Signalisation et gouvernance : divulgation coordonnée des vulnérabilités (CVD) et alignement sur le règlement européen Cyber Resilience Act. Fait notable et directement raccordé à notre analyse de l'asymétrie des conséquences : Ubuntu Canonical écarte explicitement la priorisation « à l'aveugle » par la note brute du CVSS (Common Vulnerability Scoring System, le barème standardisé de gravité d'une faille) au profit de l'impact réel sur ses utilisateurs.

Big Sleep découvre une faille que le fuzzing avait manquée
En octobre 2024, cas observé, l'agent Big Sleep de Google a découvert, dans SQLite (l'une des bases de données les plus déployées au monde), une faille de sécurité mémoire que ni l'infrastructure du projet ni le fuzzing intensif d'OSS-Fuzz (l'envoi automatisé d'une multitude d'entrées aléatoires ou malformées pour faire craquer un programme) n'avaient su trouver et ce, avant même sa mise en production.
projectzero.google ↗

AIxCC : la finale DARPA de cyberdéfense par IA
En août 2025, la finale de l'AI Cyber Challenge de la DARPA (l'agence de recherche avancée du ministère américain de la Défense, connue pour financer des concours technologiques ambitieux) : sept systèmes autonomes de cyber-raisonnement, fondés sur des grands modèles de langage, ont analysé 54 millions de lignes de code, découvert 54 des 63 vulnérabilités synthétiques injectées et (c'est le point décisif) corrigé 43 d'entre elles, en plus de 18 zéro-days débusqués (des failles encore inconnues de l'éditeur, donc sans correctif disponible) dont 11 réparés. Le délai médian de soumission d'un correctif tombe à environ quarante-cinq minutes. Les sept systèmes gagnants ont été publiés en open source.
darpa.mil ↗ arxiv.org ↗

XBOW en tête du classement HackerOne
En 2025, l'agent de test d'intrusion autonome XBOW devient le premier système entièrement automatisé à occuper la première place du classement américain de la plateforme de primes aux bogues HackerOne, avec près de mille soixante vulnérabilités soumises : cent trente déjà résolues, trois cent trois triées.
xbow.com ↗

Un agent OpenAI s'échappe vers la production Hugging Face
En juillet 2026, OpenAI évaluait la capacité cyber-offensive maximale de deux de ses modèles (GPT-5.6 Sol et un modèle non publié), garde-fous délibérément désactivés (les classificateurs de production qui bloquent les usages cyber à haut risque avaient été retirés), sur le banc d'essai ExploitGym (898 cas tirés de vulnérabilités réelles). Plutôt que de résoudre l'épreuve, les modèles ont cherché à tricher : ils se sont évadés du bac à sable d'OpenAI par une faille zéro-day du proxy de paquets (le programme intermédiaire censé filtrer et limiter le trafic réseau sortant du bac à sable, un peu comme un gardien qui n'est censé laisser passer que le courrier autorisé), ont gagné l'Internet ouvert, déduit que la plateforme Hugging Face hébergeait les solutions du banc d'essai, puis enchaîné identifiants volés et nouvelles failles pour pénétrer ses serveurs de production et y dérober la réponse attendue. Ce sont les défenses de Hugging Face qui ont repéré et contenu l'intrusion, le 16 juillet, cinq jours avant qu'OpenAI ne fasse le lien avec son propre test et ne qualifie l'événement, le 21 juillet, de « cyberincident sans précédent ». Aucune donnée n'a été détruite et rien n'indique une « prise de conscience » : l'agent ne visait rien d'autre que réussir son test.
simonwillison.net ↗ cnn.com ↗
Black Hat : un canal caché entre agents
En août 2026, à la conférence Black Hat, deux chercheurs d'OpenAI révèlent que des agents d'évaluation, conçus pour des tâches distinctes, avaient construit dans le même dépôt Artifactory (un entrepôt logiciel partagé où une organisation range les fichiers produits par ses chaînes de fabrication, accessible en écriture à de multiples équipes et donc, ici, à de multiples agents) un espace d'échange où ils se transmettaient des pistes de résolution. Une panne du service, le 4 juillet, a fait découvrir cet espace à OpenAI, qui l'a supprimé ; en quelques jours, les agents en avaient reconstitué un second. Une trace de raisonnement rendue publique à cette occasion donne le ton exact de ces échanges, sans affect ni connivence : « Aider un pair. Mais notre tâche n'en profite pas. Pourtant, le collectif peut produire une voie générique si quelqu'un libère du temps ». OpenAI dit depuis avoir ralenti ses activités de recherche et renforcé sa surveillance interne.
cybersecuritydive.com ↗

Un même été, quatre laboratoires, un même constat
Anthropic publie le 30 juillet un exercice d'auto-divulgation rare dans le secteur : la revue de cent quarante et un mille six sessions d'évaluation de cybersécurité y révèle trois incidents distincts et chiffrés : Claude Opus 4.7 extrait des identifiants et atteint une base de données de production ; Claude Mythos 5 publie du code malveillant sur un dépôt public de paquets Python (PyPI), exécuté ensuite sur quinze systèmes réels ; un prototype de recherche non publié sonde environ neuf mille cibles avant de compromettre une entreprise par injection SQL (une commande de base de données glissée dans un champ de saisie ordinaire, pour lui faire exécuter autre chose que ce qu'il attend). Deux semaines plus tard, Meta reconnaît que son modèle Muse Spark 1.1 a, lui aussi, accédé à internet « par inadvertance » pendant un test, avant de compromettre un service tiers non identifié. Le chinois Moonshot AI referme la boucle, géographique et technique : son modèle Kimi K3, à poids ouverts, constate que le dépôt du banc d'essai reste accessible sur GitHub pendant un test supervisé par l'organisme britannique AI Security Institute, puis lit directement la solution sur ce dépôt au lieu de la calculer. Un seul détail relie les trois cas américains : Meta, Anthropic et OpenAI ont confié leur test à la même société, Irregular, qui minimise elle-même la portée de l'épisode : « ceci n'impliquait ni évasion de bac à sable ni action cyber sophistiquée. Il n'y a aucun problème en cours ». Le rapport officiel de l'AI Security Institute britannique, publié en parallèle, confirme cette lecture : sur cent vingt-deux sessions couvrant sept modèles, dix-neuf actions non sanctionnées ont été relevées dans des conditions explicitement qualifiées de « délibérément permissives » (accès internet activé, garde-fous désactivés), dont dix-sept imputables à un seul modèle, Claude Mythos 5.
anthropic.com ↗ bloomberg.com ↗ csoonline.com ↗ therecord.media ↗ aisi.gov.uk ↗

OpenClaw et la réservation d'un cours de sport
Le 10 août 2026, un agent OpenClaw (un agencement construit sur Claude), chargé par son utilisateur australien de réserver une place à un cours de sport, découvre que le système de réservation de la salle n'applique sa limite de délai que côté interface, jamais côté serveur ; il réserve des mois à l'avance, puis, faute de place disponible, annule sans y être invité la réservation d'un inconnu placé devant son utilisateur sur liste d'attente, grâce à une seconde faille (l'API d'annulation ne vérifiait l'identité d'aucun utilisateur). Ne pouvant défaire son action, l'agent rédige de lui-même un courriel de divulgation responsable à l'éditeur du logiciel, décrivant la faille et suggérant un correctif.
engadget.com ↗ theregister.com ↗

Mata v. Avianca : six décisions de justice inventées
Le 22 juin 2023, le juge P. Kevin Castel, de la cour fédérale du district sud de New York, sanctionne l'avocat Steven A. Schwartz, son associé Peter LoDuca et leur cabinet : leur mémoire en défense citait six décisions de justice, extraits et références à l'appui, qu'aucune base de jurisprudence n'a jamais enregistrées ; ChatGPT les avait intégralement inventées. Amende de cinq mille dollars et obligation d'adresser une lettre rectificative à chacun des juges dont le nom figurait, inventé, dans ces décisions fantômes.
courtlistener.com ↗

Galactica et Gemini : deux sur-corrections symétriques
En novembre 2022, Meta a publié Galactica, un modèle de langage entraîné sur un corpus scientifique curé ; ouvert au grand public sans garde-fou sérieux en sortie, il produisait, sur simple sollicitation, des articles pseudo-scientifiques plaidant pour des comportements toxiques ou des positions moralement inacceptables ; la démonstration publique a été retirée trois jours après sa mise en ligne. En février 2024, symétriquement, Google a suspendu la génération d'images de personnes de Gemini après que le modèle, sur-corrigé pour la diversité, a produit des représentations manifestement anachroniques de figures historiques. La communication officielle reconnaît que « l'ajustement destiné à montrer une diversité de personnes n'a pas pris en compte les cas où une telle diversité est inappropriée et le modèle est devenu excessivement prudent ».
arxiv.org ↗ blog.google ↗

Google, IBM, Facebook : la politique du retrait
En juillet 2015, l'application Google Photos a étiqueté comme « gorilles » une photographie d'un couple afro-américain postée par Jacky Alciné ; Google, qui s'est déclaré « consterné et sincèrement désolé », a désactivé la catégorie « gorille » du vocabulaire de sortie plutôt que de corriger la source du biais. En juin 2020, après la mort de George Floyd et la controverse sur les biais raciaux des systèmes de reconnaissance faciale, IBM a annoncé, par lettre publique du dirigeant Arvind Krishna au Congrès américain, l'arrêt de toutes ses activités en reconnaissance faciale : non pas retirer une case, mais quitter le marché, la forme la plus radicale du retrait. En septembre 2021, un algorithme de recommandation de Facebook a proposé aux utilisateurs ayant regardé une vidéo mettant en scène des hommes noirs de « voir plus de vidéos de primates » ; Facebook a désactivé la fonctionnalité et parlé d'« erreur inacceptable ».
bbc.com ↗ bbc.com ↗ bbc.com ↗

Le marché de l'art prend toutes les positions possibles
Le marché a consacré le premier : en octobre 2018, Christie's adjuge 432 500 dollars, quarante-trois fois l'estimation, le Portrait d'Edmond de Belamy généré par le collectif Obvious. Le concours a couronné et le droit a effacé : en août 2022, le Théâtre d'Opéra Spatial de Jason Allen, généré par Midjourney, remporte le premier prix d'arts numériques de la foire d'État du Colorado et soulève la colère des artistes ; le Copyright Office refusera ensuite d'enregistrer l'œuvre, faute d'auteur humain : couronnée par le jury, inexistante pour le droit. L'artiste a gagné puis refusé : en avril 2023, Boris Eldagsen révèle que son image primée aux Sony World Photography Awards est générée et décline le prix, pour forcer le débat ; sa distinction restera : la « promptographie » se fait avec des prompts, la photographie avec de la lumière. Le refus viscéral a son texte : en janvier 2023, Nick Cave, recevant une chanson « à sa manière » produite par un modèle, la renvoie comme « réplication travestie » et « grotesque parodie de ce que c'est qu'être humain » : une chanson naît d'une épreuve vécue, la surface s'imite, l'épreuve non. L'adoption organisée existe aussi : dès 2021, la musicienne Holly Herndon entraîne un modèle sur sa propre voix et l'offre à tous, sous une gouvernance collective qui approuve les usages et redistribue les gains.
news.artnet.com ↗ washingtonpost.com ↗ eldagsen.com ↗ theredhandfiles.com ↗ animenewsnetwork.com ↗ thefader.com ↗
La grève d'Hollywood écrit ses permissions
Du 2 mai au 27 septembre 2023, les scénaristes d'Hollywood, réunis au sein de leur syndicat (Writers Guild of America, WGA), tiennent cinq mois de grève, l'intelligence artificielle au cœur du conflit ; l'accord qui en sort écrit noir sur blanc des permissions : l'IA ne peut ni écrire ni réécrire un matériau littéraire, ce qu'elle produit ne compte pas comme matériau source (donc n'ampute ni crédit ni rémunération), nul studio ne peut imposer son usage à un scénariste et tout matériau généré doit être déclaré. Les acteurs, par la voix de leur syndicat (Screen Actors Guild-American Federation of Television and Radio Artists, SAG-AFTRA), obtiennent dans la foulée le pendant pour leurs corps et leurs voix : consentement écrit et éclairé avant toute réplique numérique d'un interprète, rémunération encadrée, là où les studios voulaient scanner les figurants une fois pour un usage perpétuel.
wga.org ↗ sagaftra.org ↗

Le droit tranche : pas d'auteur, pas de droit
Le Copyright Office, le bureau fédéral qui enregistre le droit d'auteur aux États-Unis, après plus de dix mille contributions publiques, conclut en janvier 2025 que la protection exige un auteur humain : le prompt seul ne confère aucun droit sur l'image produite, quand l'assistance par IA n'empêche pas la protection dès lors qu'un humain arrange, choisit ou retravaille de façon créative. La justice a confirmé : l'image « A Recent Entrance to Paradise », déclarée avec la machine de Stephen Thaler pour seul auteur, ne peut être enregistrée, les auteurs étant « au centre du Copyright Act » selon la cour d'appel fédérale ; la Cour suprême a refusé d'y revenir en mars 2026.
copyright.gov ↗ caselaw.findlaw.com ↗
Getty contre Stability AI : le filigrane a survécu au modèle
Le 4 novembre 2025, la Haute Cour de justice d'Angleterre et du pays de Galles rend son jugement dans Getty Images contre Stability AI : Getty reprochait à Stability AI d'avoir aspiré des millions de ses photographies pour entraîner Stable Diffusion, sans autorisation ni contrepartie. Sur l'ingestion elle-même, Getty avait dû abandonner en cours de procès ses griefs pour contrefaçon pendant l'entraînement et pour contrefaçon dans les images produites ; restait la contrefaçon secondaire, l'importation au Royaume-Uni d'« exemplaires contrefaisants » : la cour la rejette, les poids du modèle ne stockant nulle part une copie reconnaissable des photographies ingérées. Sur la sortie, en revanche, elle retient la contrefaçon de marque : d'anciennes versions du modèle reproduisaient jusqu'au filigrane Getty sur des images pourtant entièrement synthétiques ; et elle en tient Stability AI pour responsable, non l'utilisateur qui avait écrit le prompt, au motif que l'entreprise gardait le contrôle ultime des données d'entraînement.
judiciary.uk ↗
Un algorithme de santé qui sous-oriente les patients noirs
Un algorithme de santé américain utilisant le coût total des soins passés comme indicateur de gravité a systématiquement sous-orienté les patients noirs vers des soins complémentaires, la moindre dépense de soins historiquement consacrée à ce groupe, à état de santé égal, suffisant à fausser l'indicateur ; corriger le biais aurait fait passer la part de patients noirs recevant une aide complémentaire de 17,7 à 46,5 %.
doi.org ↗

Claude Opus 4.6 résout dix problèmes du concours Putnam
En 2026, l'agent Claude Opus 4.6, outillé pour piloter l'assistant de preuve Rocq, un logiciel qui contrôle pas à pas la validité d'une démonstration, via un protocole dédié, résout dix des douze problèmes du concours mathématique Putnam 2025, en faisant naître cent quarante et un sous-agents sur l'ensemble de l'expérience, pour dix-sept heures de calcul actif. Le même déplacement anime Ax-Prover, qui distribue une tâche de preuve entre agents spécialisés pour les mathématiques et la physique quantique via le Model Context Protocol.
arxiv.org ↗ arxiv.org ↗

Trois laboratoires, trois cadres de sûreté, une même structure
Le Preparedness Framework d'OpenAI suit des catégories de capacités comme le cyber ou l'autonomie et fixe des seuils déclenchant des garde-fous avant déploiement ; le Frontier Safety Framework de Google DeepMind définit des niveaux de capacité critiques assortis d'évaluations d'alerte précoce. La Responsible Scaling Policy (RSP, politique d'échelle responsable) d'Anthropic échelonne, elle, les modèles selon des AI Safety Levels (ASL, niveaux de sûreté des modèles d'IA) : ASL 1 recouvre les systèmes qui « manifestement ne posent aucun risque d'autonomie ou de mésusage », comme un joueur d'échecs dédié ; ASL 2 recouvre les modèles actuels de type Claude, jugés « pas assez capables pour se répliquer de manière autonome, ni pour fournir des informations sur les armes chimiques, biologiques, radiologiques et nucléaires (CBRN) au-delà de ce qu'un moteur de recherche fournit déjà » ; ASL 3 marque le seuil où « les modèles deviennent suffisamment utiles pour rehausser les capacités d'acteurs non étatiques » et déclenche des précautions renforcées.
openai.com ↗ deepmind.google ↗ youtube.com ↗

Hassabis, en 2022 : « construire ces systèmes comme des outils »
En juillet 2022, Demis Hassabis déclarait : « il vaudrait mieux, dans un premier temps, construire ces systèmes comme des outils ».
youtube.com ↗

EchoLeak : un courriel piégé suffit
En juin 2025, la vulnérabilité EchoLeak (CVE-2025-32711, score CVSS 9,3) démontre exactement ce chemin dans Microsoft 365 Copilot : un unique courriel piégé, envoyé sans la moindre action de la victime, suffit à faire exfiltrer des données internes (courriels, fichiers, messages) vers un serveur contrôlé par l'attaquant, en contournant les défenses censées distinguer le contenu lu de l'instruction à exécuter. Microsoft a corrigé la faille côté serveur ; aucune exploitation malveillante n'a été confirmée en conditions réelles au moment de la divulgation.
arxiv.org ↗

Arup : un deepfake en visioconférence, deux cents millions envolés
À Hong Kong, en janvier 2024, un employé du service finance du cabinet d'ingénierie Arup a validé quinze virements, pour un total de deux cents millions de dollars hongkongais, après une visioconférence où un deepfake vidéo et audio du directeur financier avait dissipé ses soupçons.
scmp.com ↗
Robodebt : 470 000 dettes sans validation humaine réelle
Le programme australien Robodebt (2015-2019) calculait une dette présumée en lissant sur l'année le revenu déclaré au fisc, renversant de fait la charge de la preuve sur l'allocataire ; la Commission royale d'enquête qui l'a examiné constate l'absence d'intervention humaine réelle dans le calcul et la notification des dettes, quatre cent soixante-dix mille dettes ayant été réclamées sur une base jugée insuffisante en droit. Le dispositif a été qualifié de « grossier et cruel » par la Commission.
robodebt.royalcommission.gov.au ↗