Anthropic lance Opus 5.5
🏎️ “Oups, je me suis trompé de pédale”. C’est ce qu’a dû se dire Dario Amodei qui, dix jours après avoir demandé de ralentir la course à l’IA, lance sa dernière version de Claude, Opus 5.5. Mais le modèle “a obtenu de meilleurs résultats que n'importe quel modèle Claude récent sur presque toutes les mesures de comportement désaligné”, alors vous n’avez rien à craindre.
“Qu’entends-je? Il fallait vite battre ChatGPT Astra avant l’introduction en bourse? Les bras m’en tombent” – Greg, candideQuelle IA est la plus hors-la-loi?
🦹 Après les nombreux cas de fuites et de désalignement de ces derniers mois, les crimes commis par les IA ont leur jauge : sur Felony Bench, vous retrouvez un classement à jour des LLM qui ont commis le plus d’actes illégaux. À l’heure où ces lignes sont écrites, OpenAI occupe d’un cheveu la première place du podium.
“Imagine, on fait ça avec les candidats à la présidentielle” – Mat, citoyen du mondeL’IA n’est (trop souvent) pas un bon conseiller financier
💸 La plupart du temps, les demandes de conseil sur vos finances à un LLM vont se traduire par des erreurs dont certaines peuvent conduire à des amendes, conclut le rapport d’un cabinet spécialisé dans les IA financières. Le choix du modèle influe énormément sur la justesse de la réponse : avec Claude Haiku et Gemini 1.5 Flash, qui sont gratuits, on atteint 99% de réponses comportant des bourdes. Avec Claude Opus 5, en revanche, les erreurs descendent à 31%. Attention à vérifier les réponses de vos LLM sur des sujets aussi sensibles.
“Je lui ai demandé comment devenir riche, il m’a dit de travailler. Absurde” – Mat, qui retourne jouer à l’euromillionsDonald Trump veut son “AI Force”
🇺🇲 Le président américain veut créer une nouvelle branche du gouvernement américain pour l’IA, à l’image de sa “Space force” pour le domaine spatial. Une annonce faite sur les réseaux sociaux, qui s’accompagne de la promesse de ne pas “gêner” la croissance de cette “incroyable industrie”, mais plutôt de la “chérir”.
“Je me demande à quoi va ressembler le AI Force One“ – Greg, avgeek
Tout est parti d’un tweet. Le dernier livre signé Thélyson Aurélien, “C’était ça ou mourir”, a beau être chouchou de la critique, il serait au minimum co-écrit en utilisant une intelligence artificielle. Une terrible accusation nourrie par son score sur Pangram, un programme qui analyse les textes et donne un pourcentage de chances qu’ils soient écrits par un humain ou par un algorithme. Le score du livre, testé sur divers passages, est sans appel : 100% LLM.
Mais il y a un problème de taille. Comme l’auteur et sa maison d’édition nient tout recours à l’IA, le scandale naissant se fait entièrement sur la base d’un programme dont l’efficacité se discute. Chaque texte soumis à Pangram est placé sur une gigantesque carte où sont classifiés par “styles” 28 millions de documents écrits avant 2021 (donc avant les IA textuelles), et à côté d’eux des textes écrits par les LLM actuels. C’est l’endroit où se trouve le texte testé qui va décider de sa note.
Résultat, Pangram est considéré comme le plus fiable des détecteurs d’IA dans un texte, avec seulement 0,5% d’erreur selon l’université de Chicago, qu’il s’agisse de faux positifs (un texte considéré comme de l’IA et qui ne l’est pas) ou de faux négatifs (une création ou modification par l’IA non détectée). Alors, l’affaire est dans le sac?
Même un score d’erreur très faible, ce n’est pas 0, et c’est suffisant pour tuer une carrière. De la bouche même de son créateur, Pangram ne peut pas prétendre être infaillible. Ce qui signifie que tout texte testé peut être injustement étiqueté, sans possibilité de démontrer le contraire. Pire, une étude (qui doit encore être contrôlée avant de paraître dans une revue) établit que passer un texte fait à l’IA par une autre IA pour “l’humaniser” permet d’échapper presque entièrement au filtre de Pangram.
Tout cela est la preuve que se baser sur un algorithme ne peut pas aboutir. Il restera toujours un doute raisonnable, et des carrières, des vies risquent de souffrir d’accusations dont on ne saura jamais la véracité. Peut-être alors est-ce le moment de s’avouer qu’on ne pourra jamais savoir si l’IA a mis ses doigts dans le livre que vous lisez. Que vous le jugiez bon ou catastrophique.
SCORE BULLSHIT ▓▓▓▓▓▓▓▓▓▓▓▓░░░░░░░░ 60%
...
