Anthropic dévoile un nouveau modèle d'IA présentant des signes précoces de capacités dangereuses.

Anthropic, la société spécialisée dans l'IA générative, a lancé une version améliorée de son modèle Claude 3.5, appelée Sonnet, ainsi qu'un modèle entièrement nouveau nommé Claude 3.5 Haiku.
La principale nouveauté de Sonnet réside dans son interaction avec votre ordinateur : il permet de prendre et de lire des captures d’écran, de déplacer la souris, de cliquer sur les boutons des pages web et de saisir du texte. Cette fonctionnalité est déployée en version bêta publique, une phase que Anthropic qualifie d’« expérimentale, parfois complexe et sujette à erreurs », comme l’indique son communiqué.
Dans un article de blog détaillant la raison d'être de cette nouvelle fonctionnalité, Anthropic explique : « Une grande partie du travail moderne s'effectue sur ordinateur. Permettre aux IA d'interagir directement avec les logiciels, comme le font les humains, ouvrira la voie à une multitude d'applications actuellement impossibles pour la génération actuelle d'assistants IA. » Si le concept d'ordinateurs autonomes n'est pas nouveau, le fonctionnement de Sonnet le distingue. Contrairement aux systèmes de contrôle automatisés traditionnels, qui nécessitent généralement la programmation, Sonnet ne requiert aucune connaissance en programmation. Les utilisateurs peuvent ouvrir des applications ou des pages web et donner des instructions à l'IA, qui analyse ensuite l'écran et détermine les éléments avec lesquels interagir.
Premiers signes de capacités dangereuses
Anthropic reconnaît les risques inhérents à cette technologie et admet que « pour des raisons de sécurité, nous n'avons pas autorisé le modèle à accéder à Internet pendant son entraînement », bien que la version bêta le permette désormais. L'entreprise a également récemment mis à jour sa « Politique de déploiement responsable », qui définit les risques associés à chaque étape de développement et de mise en production. Conformément à cette politique, Sonnet a été classé au « niveau de sécurité IA 2 », ce qui indique « des signes précoces de capacités potentiellement dangereuses ». Cependant, Anthropic estime que le système est suffisamment sûr pour être mis à la disposition du public à ce stade.

Source : Anthropique
Pour justifier sa décision de publier l'outil avant d'avoir pleinement cerné tous les scénarios d'utilisation abusive potentiels, Anthropic a déclaré : « Nous pouvons commencer à nous pencher sur les problèmes de sécurité avant que les enjeux ne soient trop importants, plutôt que d'intégrer pour la première fois des capacités d'utilisation informatique à un modèle présentant des risques bien plus graves. » En clair, l'entreprise préfère tâter le terrain maintenant, tant que les capacités de l'IA sont encore relativement limitées.
Bien entendu, les risques liés aux outils d'IA comme Claude ne sont pas que théoriques. OpenAI a récemment révélé 20 cas où des acteurs étatiques ont utilisé ChatGPT à des fins malveillantes, notamment pour planifier des cyberattaques, sonder des infrastructures vulnérables et concevoir des campagnes d'influence. À deux semaines des élections présidentielles américaines, Anthropic est pleinement consciente du risque d'utilisation abusive. « Compte tenu des élections américaines à venir, nous sommes extrêmement vigilants face aux tentatives d'utilisation abusive qui pourraient être perçues comme une atteinte à la confiance du public dans le processus électoral », a déclaré l'entreprise.
Benchmarks de l'industrie
Anthropic affirme : « La version mise à jour de Claude 3.5 Sonnet présente des améliorations significatives sur les benchmarks du secteur, notamment en matière de programmation automatique et d'utilisation d'outils. Concernant la programmation, elle améliore les performances sur SWE-bench Verified , passant de 33.4 % à 49.0 %, surpassant ainsi tous les modèles disponibles publiquement, y compris les modèles de raisonnement comme OpenAI o1-preview et les systèmes spécialisés conçus pour la programmation automatique. Elle améliore également les performances sur TAU-bench , une tâche d'utilisation d'outils automatique, passant de 62.6 % à 69.2 % dans le secteur du commerce de détail, et de 36.0 % à 46.0 % dans le secteur aérien, plus exigeant. La nouvelle version de Claude 3.5 Sonnet offre ces avancées au même prix et avec la même rapidité que la précédente. »

Source : Anthropique
Détendez-vous, citoyens, des mesures de sécurité sont en place.
Anthropic a mis en place des mesures de sécurité pour empêcher l'exploitation des nouvelles fonctionnalités de Sonnet à des fins d'ingérence électorale. Des systèmes ont été déployés pour surveiller les interactions de Claude avec les plateformes, notamment la création de contenu pour les réseaux sociaux et l'interaction avec des sites web gouvernementaux. L'entreprise veille également à ce que les captures d'écran réalisées lors de l'utilisation de l'outil ne servent pas à l'entraînement futur des modèles. Cependant, même les ingénieurs d'Anthropic ont été surpris par certains comportements de l'outil. Par exemple, Claude a interrompu brutalement l'enregistrement d'un écran, entraînant la perte de toutes les données. Plus insolite encore, lors d'une démonstration de programmation, l'IA s'est mise à consulter des photos du parc national de Yellowstone, une séquence partagée par Anthropic sur X avec un mélange d'amusement et de surprise.
Anthropic souligne l'importance de la sécurité dans le déploiement de cette nouvelle fonctionnalité. Claude a été classée au niveau de sécurité IA 2, ce qui signifie qu'elle ne nécessite pas de mesures de sécurité renforcées pour les risques actuels, mais soulève néanmoins des inquiétudes quant à d'éventuels abus, comme les attaques par injection de code. L'entreprise a mis en place des systèmes pour surveiller les activités liées aux élections et prévenir les abus tels que la génération de contenu ou la manipulation des réseaux sociaux.
Bien que l'utilisation de l'ordinateur de Claude soit encore lente et sujette à des erreurs, Anthropic est optimiste quant à son avenir. L'entreprise prévoit d'améliorer le modèle afin de le rendre plus rapide, plus fiable et plus facile à mettre en œuvre. Durant toute la phase bêta, les développeurs sont invités à fournir des commentaires pour contribuer à l'amélioration de l'efficacité du modèle et de ses protocoles de sécurité.








