Anthropic punta sulla trasparenza e pubblica le metriche di automazione dell’IA

anthropic-punta-sulla-trasparenza-e-pubblica-le-metriche-di-automazione-dell’ia
Anthropic punta sulla trasparenza e pubblica le metriche di automazione dell’IA

Rimani aggiornato con WebMasterPoint

Anthropic pubblica tre metriche per misurare lautomazione dellIA, chiarendo supervisione degli agenti e uso della potenza di calcolo. Un passo che ridefinisce il confronto con OpenAI e Google.

Anthropic ha pubblicato tre metriche pubbliche per misurare il ritmo dello sviluppo dell’intelligenza artificiale il 20 settembre 2026, rendendo osservabili dati che finora erano comunicati solo attraverso dichiarazioni aziendali. L’annuncio del laboratorio americano segue la proposta di rallentamento coordinato avanzata dal ceo Dario Amodei e rappresenta un tentativo di trasformare l’opacit dei laboratori di frontiera in informazioni verificabili per governi, istituzioni e cittadini.

Cosa misurano le tre metriche pubbliche

L’azienda ha reso pubblici tre indicatori interni:

  • l’indice di automazione per la ricerca e sviluppo (R&D Automation Index),
  • le metriche di supervisione degli agenti intelligenti e
  • la mappa della potenza di calcolo dedicata alla sicurezza.

Ogni metrica segue una definizione precisa, un periodo di rilevamento specifico e una base di calcolo documentata. L’obiettivo fornire una fotografia quantitativa di quanto l’IA contribuisca effettivamente allo sviluppo dei modelli, piuttosto che limitarsi a dichiarare capacit generiche.

Come funziona l’indice di automazione e cosa dicono i numeri

L’indice classifica i compiti su una scala da zero a cinque, dove il livello quattro indica esecuzione quasi completa da un’istruzione generale con supervisione finale umana. I dati aggiornati ad agosto 2026 mostrano che Claude svolge autonomamente il 26% dell’intero lavoro di ricerca e sviluppo al livello quattro. Quando si include anche la collaborazione al livello tre o superiore, il contributo fattivo dell’intelligenza artificiale supera il 90%. Queste cifre derivano da un campionamento settimanale del 20% dei compiti effettuato a luglio 2026, con un agente IA che ha catalogato 15mila attivit. Il confronto con il paniere di gennaio 2026 conferma che non sono aumentate mansioni completamente nuove svolte dagli umani, indicando stabilit nella struttura del lavoro.

Supervisione degli agenti e trasparenza della potenza di calcolo

Il secondo indicatore monitora circa 30mila agenti intelligenti operativi contemporaneamente nella piattaforma interna al mese di agosto 2026. Il sistema valuta:

  • la copertura delle azioni verificate,
  • la latenza di revisione temporale e
  • il tasso di escalation.

Per prevenire rischi, Anthropic impiega monitor online in tempo reale e analisi offline successive. Un terzo indicatore mostra che tra il 13 e il 20 luglio 2026 il 6% della potenza di calcolo R&S era destinato alla sicurezza, con un campione verificato pari al 14% di circa 10mila sessioni. Le valutazioni automatiche e umane differiscono solo di uno-due punti percentuali, dimostrando affidabilit del metodo.

Perch questo cambia il confronto con OpenAI e Google

Mentre OpenAI e Google comunicano dati comparabili con maggiore riservatezza, Anthropic propone un modello di trasparenza che potrebbe diventare riferimento per il settore. L’azienda suggerisce che governi potrebbero imporre obblighi simili prima del rilascio dei modelli sul mercato, come previsto dalla proposta Advanced AI Framework. La disponibilit di valutatori terzi con accesso equivalente a quello delle squadre interne rappresenta un passo verso standardizzazione della accountability. Tuttavia, i limiti attuali includono la copertura parziale dei compiti (solo il 20% campionato settimanalmente) e la mancanza di dati longitudinali che mostrino l’evoluzione nel tempo.

Prospettive dei ricercatori e prossimi passi

Le metriche pubblicate da Anthropic offrono una base concreta per valutare l’automazione della ricerca, la supervisione degli agenti e la quota di calcolo destinata alla sicurezza. I dati non misurano per da soli la qualit dei risultati n dimostrano che l’aumento dell’autonomia riduca tempi, costi o rischi.

Per rendere il confronto affidabile, servono rilevazioni periodiche con definizioni stabili, una copertura pi ampia dei compiti e verifiche indipendenti. L’adozione di indicatori comparabili da parte di OpenAI, Google e degli altri laboratori permetterebbe di distinguere i progressi reali nelle capacit degli agenti dalle differenze nei metodi di misurazione.

Leggi anche: Anthropic punta sulla trasparenza e pubblica le metriche di automazione IA

Related Post