Le conseiller scientifique de la Maison Blanche, Michael Kratsios, a affirmé que Moonshot, une entreprise chinoise, avait copié le modèle de langage large (LLM) Fable d’Anthropic pour créer le Kimi K3, qui est le plus grand modèle à poids ouvert actuellement disponible. Kratsios a déclaré que le modèle de Moonshot utilisait des puces dont l’exportation vers la Chine n’était pas autorisée, ajoutant que la distillation industrielle secrète visant à voler la technologie américaine était « inacceptable ». Il a souligné les discussions en cours sur l’interdiction potentielle des modèles chinois à pondération ouverte, qui sont devenus controversés dans le secteur de l’IA.
Le secrétaire au Trésor, Scott Bessent, a fait écho aux commentaires de Kratsios, révélant que de grands modèles linguistiques américains ont été détectés dans de nombreux modèles chinois, ce qu’il a également qualifié d’« inacceptable ». Le département du Trésor n’a pas précisé la nature exacte des filigranes retrouvés sur ces modèles. Les experts ont cependant exprimé leur scepticisme quant à savoir si la distillation seule pourrait expliquer les capacités avancées du Kimi K3, surtout si l’on considère la date de sortie de Fable le 1er juillet.
Braden Hancock, chercheur à l’Institut Laude, a souligné qu’il est peu plausible de développer un modèle aussi puissant que le Kimi K3 dans un laps de temps aussi court en utilisant uniquement des techniques de distillation. Il a déclaré : « Vous ne pouvez pas distiller autant de données, former un modèle et le publier en deux semaines. » Nathan Lambert, de l’Allen Institute for AI, a noté la diminution de l’efficacité de la distillation au fil du temps et a fait valoir que des méthodes avancées telles que l’apprentissage par renforcement pourraient être nécessaires pour que de tels modèles atteignent leurs capacités.
Le processus de distillation consiste à interroger systématiquement un LLM pour répliquer ses fonctionnalités. Ce processus peut inclure un réglage fin supervisé (SFT), dans lequel le modèle cible entraîne un nouveau modèle en émulant ses comportements. Lambert a estimé que même si SFT présente des avantages, ceux-ci diminuent à mesure que la complexité du modèle augmente. La reproduction des capacités de Fable peut nécessiter un apprentissage par renforcement, qui peut nécessiter beaucoup de ressources et ne garantit pas des performances supérieures.
Un conflit persistant existe dans l’industrie de l’IA concernant les pratiques de distillation. Anthropic avait précédemment accusé Moonshot d’extraire systématiquement des données de ses modèles, citant des millions d’échanges suspects surveillés via des adresses IP. Elon Musk a témoigné que son entreprise, SpaceXAI, avait également utilisé des techniques de distillation sur des modèles OpenAI pour développer Grok, démontrant à quel point cette pratique est courante dans le secteur.
Hancock a souligné que les perceptions américaines pourraient minimiser les compétences techniques des équipes chinoises d’IA, faisant référence au co-fondateur de Moonshot, titulaire d’un doctorat de l’Université Carnegie Mellon. Moonshot aurait exploité des puces Nvidia interdites tout en accédant à des serveurs équipés du GB300 en Thaïlande pour développer Kimi K3. Sam Bresnick, chercheur au Centre pour la sécurité et les technologies émergentes de Georgetown, a souligné l’existence d’un marché noir pour ces puces, dont l’exportation vers la Chine reste interdite. Les efforts visant à faire respecter les réglementations sur l’utilisation de ces puces avancées n’ont pas encore enregistré de progrès significatifs.
Le ministère du Commerce du président Biden a proposé des règles permettant aux centres de données d’établir des mesures d’identification des clients en 2024. Cependant, aucun développement significatif dans ce domaine n’a eu lieu sous l’administration précédente, et les exportateurs doivent s’assurer que leurs puces avancées sont utilisées pour des applications légitimes.





