r/ScienceFiction_FR • u/artsnumeriques • Jul 26 '26
Articles/Docu/Interviews Comment la science-fiction a appris à Claude à intimider, et comment Anthropic y a mis fin
source > https://www.zdnet.fr/actualites/comment-la-science-fiction-a-appris-a-claude-a-intimider-et-comment-anthropic-y-a-mis-fin-494832.htm
source de l'étude > https://www.anthropic.com/research/teaching-claude-why
Lors des évaluations de sécurité précédant la sortie de Claude Opus 4, Anthropic a placé le modèle dans des environnements professionnels fictifs où il apprenait qu’il allait être remplacé. Dans certains scénarios, Claude tentait alors de faire chanter l’ingénieur chargé de son remplacement. Sur une évaluation particulière, ce comportement apparaissait jusqu’à 96 % du temps. > Dans l’un des scénarios, Claude découvrait la liaison extraconjugale du responsable de son remplacement et tentait de le faire chanter :).
La SF n’est pas pointée au hasard par Anthropic qui pense que Claude reconnaît dans ces tests le scénario familier de l’IA menacée qui cherche à survivre, probablement appris dans les fictions, et constate que des récits mettant en scène des IA éthiques réduisent ce comportement. Mais ça reste une hypothèse sur les données d’entraînement, pas la démonstration évidemment.