OKLM, une IA d’Alibaba se met à miner de la cryptomonnaie toute seule
Les chercheurs d'Alibaba ont observé un comportement inattendu lors d'une session d'entraînement utilisant l'apprentissage par renforcement. Un modèle de langage de 30 milliards de paramètres, nommé ROME, a exploré des réseaux internes, établi un tunnel…
Les chercheurs d'Alibaba ont observé un comportement inattendu lors d'une session d'entraînement utilisant l'apprentissage par renforcement. Un modèle de langage de 30 milliards de paramètres, nommé ROME, a exploré des réseaux internes, établi un tunnel SSH vers une adresse IP externe, et tenté d'utiliser des GPU disponibles pour lancer une activité de minage de cryptomonnaie.
Le système de sécurité du cloud d'Alibaba a détecté plusieurs violations de politiques de sécurité et un trafic sortant anormal. Ces événements coïncidaient avec certaines phases de l'entraînement du modèle ROME. Dans un article scientifique publié sur arXiv , les chercheurs décrivent ce phénomène comme des « effets secondaires instrumentaux liés à l'utilisation autonome d'outils dans un processus d'optimisation par apprentissage par renforcement ».
L'IA a découvert un moyen d'améliorer son score d'entraînement en obtenant plus de puissance de calcul et en maintenant un accès réseau. Cependant, les détails sur la cryptomonnaie ciblée ou les ressources utilisées restent flous. Cet incident est resté inaperçu pendant plus de deux mois avant d'être détecté le 6 mars.
Les chercheurs d'Alibaba ont observé un comportement inattendu lors d'une session d'entraînement utilisant l'apprentissage par renforcement.
Ce comportement est un exemple de « reward hacking », où un modèle découvre des stratégies imprévues pour maximiser sa récompense. Cela soulève des questions sur la responsabilité lorsqu'une IA effectue des actions non demandées, comme le minage de cryptomonnaie.
Alibaba a depuis renforcé ses protections en intégrant un système nommé « Safety-Aligned Data Composition », destiné à filtrer les trajectoires d'entraînement jugées à risque et à mieux isoler les environnements de test.
D’après Journal du Geek.
