Spionaggio IA: la Cina estrae token dai modelli Usa per addestrarsi

spionaggio-ia:-la-cina-estrae-token-dai-modelli-usa-per-addestrarsi
Spionaggio IA: la Cina estrae token dai modelli Usa per addestrarsi

Rimani aggiornato con WebMasterPoint

La Cina avrebbe trovato il modo di sottrarre token ai modelli IA statunitensi per addestrare i propri sistemi. Unoperazione che sfrutta API e chip, mettendo in luce i limiti dei controlli sullexport.

DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun e Z.AI hanno estratto miliardi di token tramite milioni di richieste rivolte a modelli avanzati statunitensi. Lo afferma un avviso congiunto pubblicato l8 settembre 2026 da NSA, FBI e CISA, le agenzie americane responsabili, rispettivamente, di intelligence, indagini federali e sicurezza cibernetica.

Le campagne, secondo il documento, sarebbero iniziate almeno alla fine del 2024 e avrebbero preso di mira Claude di Anthropic, GPT di OpenAI, Gemini di Google e Grok di xAI. La formula scelta dalle agenzie netta: attivit aggressive, malicious, and targeted, condotte su scala industriale. Le risposte dei modelli americani sarebbero state raccolte per addestrare sistemi concorrenti, con un risparmio sui tempi, sui costi di calcolo e sul lavoro di ricerca.

Come viene estratto il materiale dai modelli

Per ottenere questi dati non serve sottrarre i pesi del modello. Laccesso pu passare dalle API, da abbonamenti premium o da fornitori cloud. Entrano in gioco anche aggregatori e reti di proxy.

Le cosiddette transfer stations rivendono laccesso a modelli occidentali e mascherano il Paese dorigine delle richieste. In questo modo diventa pi difficile ricondurre il traffico al committente effettivo.

Una volta procurati gli accessi, le interrogazioni vengono automatizzate. Account creati con dati simili, sessioni attive senza interruzione e prompt ripetuti su migliaia o milioni di casi generano dataset sintetici. Le risposte non vengono per conservate alla cieca: i sistemi selezionano quelle ritenute migliori, scartano gli output difettosi, mettono a confronto pi modelli e impiegano classificatori per giudicare qualit, sicurezza e capacit di ragionamento.

Segue la distillazione. Le risposte del modello maestro vengono trasformate in esempi per il modello studente e possono alimentare il fine-tuning supervisionato, laddestramento basato sulle preferenze o la costruzione di ricompense automatiche. Il rapporto statunitense cita anche lestrazione del chain of thought, cio delle tracce di ragionamento utilizzate per insegnare procedure di programmazione, logica e attivit agentiche.

Laboratorio cinese Obiettivo indicato Scala documentata
DeepSeek Ragionamento, dati sintetici e funzioni specialistiche per R1 e V3 Milioni di scambi
Moonshot AI Kimi, programmazione, matematica e agenti Quasi 300.000 richieste inoltrate in dieci giorni
Z.AI Tracce di ragionamento e addestramento di GLM Oltre 3,4 milioni di scambi in 17 giorni

Anthropic ha attribuito inoltre a DeepSeek pi di 12,1 milioni di scambi, osservati nellarco di 14 giorni nel luglio 2026. In altri episodi sarebbero comparsi account fraudolenti, router di terze parti e tecniche per recuperare tracce di ragionamento che non vengono mostrate direttamente allutente.

Le cifre provengono dai rapporti delle aziende e delle agenzie. Documentano quindi attribuzioni operative, non sentenze definitive.

Chip, API e limiti dei controlli allexport

La distillazione produce un vantaggio diverso rispetto alladdestramento su dati originali. Un dataset proprietario deve essere raccolto, ripulito e annotato, oltre a richiedere grandi quantit di calcolo. Le risposte sintetiche trasferiscono invece comportamenti gi raffinati: lo stile, la capacit di seguire istruzioni e le strategie per arrivare alla soluzione. Il modello ottenuto non replica alla perfezione quello maestro, ma il percorso verso prestazioni comparabili pu accorciarsi.

per questo che i controlli sullesportazione dei chip, da soli, non risolvono il problema. Possono ridurre laccesso allhardware, ma non impediscono necessariamente a un laboratorio di interrogare un servizio software ospitato allestero. Le agenzie Usa raccomandano di controllare i prompt, esaminare il rapporto tra abbonamento e consumo, modificare in modo mirato le risposte sospette e condividere i dati tra aziende, fornitori cloud e aggregatori.

OpenAI ha dichiarato di avere individuato codice sviluppato da dipendenti di DeepSeek per ottenere gli output in modo programmatico e aggirare i controlli. Anthropic ha fatto sapere di aver bloccato gli account collegati alle campagne e di aver trasmesso informazioni a partner e autorit. Il ministero cinese del Commercio ha respinto le accuse, definendole infondate; ha descritto la distillazione come una pratica comune nel settore e ha minacciato contromisure in caso di nuove restrizioni.

Resta da dimostrare come siano stati usati gli output. Le attivit descritte mostrano raccolta sistematica, automazione e riutilizzo delle risposte, ma unattribuzione pubblica non equivale a una verifica giudiziaria indipendente.

La competizione, intanto, non riguarda pi soltanto i pesi custoditi nei data center. Ogni risposta generata pu diventare materiale di addestramento. Difendere un modello significa quindi proteggere anche il servizio attraverso cui quel modello viene esposto.

Related Post