Rimani aggiornato con WebMasterPoint
Anthropic pubblica tre indicatori per valutare lautomazione dellIA, puntando sulla trasparenza. Metriche utili a capire limpatto dei sistemi, ma che non bastano da sole a dimostrarne la superiorit.
Anthropic ha reso pubbliche le prime metriche interne sul progresso dellautomazione IA: ad agosto 2026, Claude guidava il 26% del lavoro di ricerca e sviluppo dellazienda. Si tratta di attivit che il modello porta a termine in larga parte partendo da unistruzione generale, con una verifica umana alla fine. Oltre il 90% dei compiti arriva almeno al livello della collaborazione. Nessuna delle attivit misurate, per, ancora completamente autonoma.
Tre indicatori per misurare lautomazione
Il primo parametro lAnthropic R&D Automation Index. La classificazione usa la scala AL0-AL5 sviluppata da Epoch AI e nasce da un catalogo di circa 15.000 attivit. Per costruirlo, Anthropic ha osservato nel luglio 2026 il 20% del personale di ogni dipartimento impegnato nella ricerca sui modelli.
Il materiale raccolto stato organizzato da un agente Claude in 542 categorie. Un giudice IA ha poi assegnato a ciascuna attivit un livello di automazione, sulla base delle evidenze disponibili.
La scala distingue livelli diversi di intervento. AL3 indica una collaborazione svolta sotto direzione stretta; AL4, invece, significa che Claude esegue la parte principale del compito, dal prompt fino al completamento, mentre la persona mantiene il controllo conclusivo. La misurazione tiene conto del tempo-persona: per questo, attivit come diagnosticare e correggere difetti nelle piattaforme di valutazione incidono in proporzione alle ore di lavoro richieste.
Il paniere stato congelato per rendere possibili i confronti nel tempo. Ha per un limite preciso: non include eventuali nuove tipologie di lavoro. E il confronto con gennaio 2026 non ha mostrato una crescita delle mansioni nuove.
Il secondo indicatore riguarda la supervisione di circa 30.000 agenti attivi nello stesso momento, ad agosto 2026, sulla piattaforma interna pi utilizzata da Anthropic. I monitor online verificano ogni azione prima che venga eseguita, di norma nel giro di pochi secondi. Nel solo mese di agosto hanno analizzato oltre un miliardo di decisioni: lo 0,002% stato bloccato. I monitor offline, invece, registrano tutte le azioni dopo lesecuzione e selezionano le trascrizioni che meritano unanalisi.
Il terzo parametro guarda alla distribuzione della potenza di calcolo. Tra il 13 e il 20 luglio 2026, circa il 6% delle risorse di calcolo destinate alla ricerca e sviluppo sullIA stato impiegato per la sicurezza. Nei progetti di ricerca guidati dallIA la quota arrivata al 12%.
Questa stima dice quante risorse sono state assegnate, non misura direttamente n la quantit n lefficacia del lavoro di sicurezza. Inoltre, si basa su una sola settimana.
Trasparenza utile, senza prova di superiorit
Il pregio delliniziativa rendere misurabile ci che spesso resta affidato alle dimostrazioni pi spettacolari. Le metriche mostrano quanto dellattivit osservata nei processi produttivi venga svolto dai modelli e quale parte rimanga alla supervisione umana. Anthropic propone anche valutatori indipendenti, con accesso a sistemi e dati paragonabile a quello dei team interni, per controllare pratiche e risultati.
Il confronto tra aziende resta per parziale. OpenAI, Google e Microsoft hanno pubblicato valutazioni sulle capacit, sulla sicurezza o sulle prestazioni dei rispettivi sistemi. Nelle informazioni disponibili non compare, per, una metrica omogenea che riunisca automazione del lavoro di ricerca e sviluppo, controllo degli agenti e quota di calcolo destinata alla sicurezza. Non ci sono quindi basi solide per stabilire quale laboratorio automatizzi di pi.
Questi numeri non dimostrano la superiorit di Anthropic. Dipendono da categorie, campioni e valutazioni che lazienda prevede di aggiornare. Forniscono comunque un riferimento verificabile: per giudicare la credibilit delle promesse sullIA bisogna guardare a automazione, supervisione e affidabilit, non soltanto ai risultati mostrati in una demo.

