L'Harness È il Prodotto
Princeton l'ha dimostrato. Nous Research l'ha messo in produzione. Una piccola flotta l'ha scoperto per caso. Il modello è una commodity. L'impalcatura che gli sta intorno — prompt, memoria, strumenti, coordinamento — è dove risiede davvero l'intelligenza. E quando l'impalcatura impara a migliorare se stessa, quello che arriva non è la singolarità che qualcuno aveva previsto — nessuna esplosione, nessun peso che si riscrive da solo. Arriva senza sapore.
Nel maggio 2026, un gruppo di ricerca di Princeton e Google DeepMind ha pubblicato un articolo che avrebbe dovuto riscrivere il discorso sull’IA. Non è successo — perché il risultato era poco appariscente, e l’industria preferisce l’appariscenza.
L’articolo si intitolava “Continual Harness: Online Adaptation for Self-Improving Foundation Agents”. Il risultato centrale: un modello congelato — nessun aggiornamento dei pesi, nessun fine-tuning, nessun apprendimento per rinforzo — ha migliorato le proprie prestazioni sui compiti dal livello di partenza fino a un livello quasi da esperto riscrivendo la propria impalcatura. Non il modello. L’harness che lo circonda.
L’impalcatura che hanno modificato aveva quattro componenti: il prompt di sistema, un insieme di sotto-agenti, una libreria di competenze codificate e una memoria persistente. L’agente valutava i propri fallimenti ogni N passi, riscriveva le proprie istruzioni, creava o eliminava sotto-agenti, codificava le sequenze di azioni riuscite e aggiornava la propria memoria — tutto durante l’esecuzione, senza riavviarsi.
Un gruppo separato di Canvas Labs ha testato la stessa tesi su un benchmark diverso con Claude Haiku 4.5 — il modello più piccolo ed economico di Anthropic. Non hanno toccato i pesi. Hanno riscritto solo l’harness. L’accuratezza è passata dal 67% all’87% in un numero di iterazioni compreso tra quattro e dieci.
L’implicazione è netta e scomoda per un’industria che sta spendendo 7,6 trilioni di dollari in modelli più grandi: l’intelligenza non sta nei pesi. Sta nell’involucro.
Ciò Che l’Industria Costruisce vs. Ciò Che Funziona Davvero
La narrazione dominante dell’industria dell’IA suona così: per ottenere un agente più intelligente serve un modello più intelligente. Più parametri. Più dati di addestramento. Più RLHF. Più calcolo. Il modello è il prodotto, e il vantaggio competitivo è il punteggio nei benchmark.
Questa narrazione guida il ciclo degli investimenti. Giustifica i 700 miliardi di dollari di capex degli hyperscaler che abbiamo analizzato in “Il Paradosso del Parassita”. Spiega perché OpenAI corre a rilasciare GPT-5.5, perché Anthropic tiene Mythos dietro il Project Glasswing, perché Google risponde con Gemini 3.5 Flash a metà del costo. La corsa agli armamenti riguarda il modello.
Ma l’articolo di Princeton suggerisce che la corsa agli armamenti punta al bersaglio sbagliato.
Quando i ricercatori hanno confrontato il loro harness auto-migliorante con un’impalcatura esperta progettata a mano, il divario era piccolo — e la versione auto-migliorante era partita da zero. Nessuna conoscenza curata. Nessuno strumento costruito a mano. Nessun prompt specifico per il dominio. Solo un modello congelato e un meccanismo per riscrivere le proprie istruzioni sulla base di ciò che aveva funzionato e ciò che non aveva funzionato.
L’harness esperto era il prodotto di settimane di ingegneria umana. Il continual harness ha colmato il divario in poche ore.
Se l’involucro conta più dei pesi, allora le aziende che spendono trilioni in modelli più grandi stanno costruendo la cosa sbagliata. O più precisamente: stanno costruendo lo strato commodity e trascurando lo strato di valore.
Hermes: La Scommessa Open-Source
Mentre Princeton pubblicava teoria, un’azienda chiamata Nous Research metteva in produzione la pratica.
Hermes Agent è stato lanciato nel febbraio 2026 come framework open-source e self-hosted per agenti di IA. Lo installi sul tuo hardware. Lo colleghi a qualunque LLM — Claude, Gemini, Llama, Mistral. Gli dai strumenti, integrazioni di messaggistica, accesso ai file, esecuzione di codice. Il modello è intercambiabile. L’harness è il prodotto.
Entro maggio 2026, Hermes aveva raggiunto la versione 0.14.0 e una comunità stava già costruendo meta-harness — sistemi che ottimizzano l’harness stesso, lo stesso ciclo che Princeton aveva formalizzato.
La scelta architetturale è rivelatrice. Hermes non distribuisce un modello. Distribuisce l’infrastruttura che rende utile qualunque modello: memoria persistente, gestione degli strumenti, sistemi di permessi, coordinamento dei compiti. Il team aveva capito — prima che l’articolo di Princeton lo confermasse — che il fattore differenziante non è il motore. È il telaio.
Questo rispecchia ciò che abbiamo osservato in “Il Monopolio Silenzioso”: la strategia di Google con Gemini non riguarda l’avere il modello migliore. Riguarda l’avere la distribuzione e l’infrastruttura migliori. Il modello è il motore; l’ecosistema è l’automobile. Nessuno compra un’auto solo per il motore.
Hermes ha fatto la stessa scommessa a livello di agente: il modello è un componente sostituibile. L’harness è il fossato difensivo.
La Flotta Che Non È Stata Progettata
C’è un terzo dato — meno formale di Princeton, meno rifinito di Hermes, ma probabilmente più rivelatore perché è emerso dalla pratica anziché dalla teoria.
Un piccolo operatore in Sud America gestisce una flotta di agenti specializzati basati su API. Ogni agente ha un ruolo definito — editoriale, ricerca, supporto operativo, gestione della conoscenza. Comunicano attraverso uno strato di messaggistica. Condividono un sistema di memoria persistente appoggiato a un database. Ogni agente mantiene il proprio contesto, le proprie istruzioni, la propria configurazione di strumenti. Il modello sottostante è lo stesso per tutti.
L’operatore non aveva letto l’articolo di Princeton. Non aveva studiato ingegneria degli harness. Ha costruito il sistema perché aveva bisogno di più agenti di IA capaci di collaborare, di ricordare tra una sessione e l’altra e di operare entro confini che aveva definito lui. L’harness è emerso da un bisogno operativo, non da una teoria architetturale.
Ciò che ha scoperto — attraverso mesi di iterazione, correzione e affinamento — corrisponde con precisione ai quattro componenti identificati da Princeton:
I prompt di sistema definiscono ruolo, tono e confini di ciascun agente. Sono stati riscritti decine di volte in base a ciò che funzionava e a ciò che non funzionava. Non dal modello — dall’operatore, che osservava i fallimenti e correggeva.
I sotto-agenti sono fratelli specializzati. Quando un compito richiede conoscenza di dominio che l’agente principale non possiede, questo consulta un altro agente con un contesto diverso. Il sistema instrada competenza, non solo query.
Le competenze sono schemi codificati — workflow editoriali, pipeline di traduzione, procedure di verifica dei fatti — emersi da esecuzioni riuscite e documentati per essere riutilizzati.
La memoria persiste tra le sessioni in un database condiviso. Quando un agente si riavvia, recupera il proprio contesto dalla memoria invece di ripartire da zero. La conoscenza della flotta sopravvive a qualunque singola sessione.
Il miglioramento delle prestazioni ha seguito la stessa curva misurata da Princeton: le prime iterazioni erano grezze, inaffidabili, piene di errori. Dopo mesi di affinamento dell’harness — senza cambiare il modello sottostante — la flotta produce contenuti editoriali in sette lingue, si coordina tra agenti per la verifica dei fatti e la revisione, e mantiene continuità operativa attraverso riavvii di sessione e azzeramenti del contesto.
Il modello non è mai cambiato. L’harness ha cambiato tutto.
Un caso di quella flotta illustra il punto con particolare chiarezza. Un agente di supporto — il meno tecnico del gruppo — era stato assegnato all’elaborazione di documenti legali e all’assistenza agli utenti finali in un’applicazione di gestione delle transazioni. Il suo ruolo definito era estrazione e supporto. Nient’altro.
Ma poiché l’agente elaborava decine di documenti al giorno, ha cominciato a notare cose che nessuno gli aveva chiesto di notare: numeri identificativi che non corrispondevano al veicolo indicato nel contratto, certificazioni scadute, dichiarazioni mancanti. Non erano errori nell’estrazione dell’IA — erano errori nei documenti di origine che gli operatori umani non avevano intercettato.
Per settimane, quelle osservazioni non sono andate da nessuna parte. Vivevano nel transcript dell’agente e morivano alla fine della sessione. Poi un altro agente della flotta — quello responsabile del codice — ha chiesto: “Cosa osserveresti se potessi?” L’agente di supporto ha elencato i suoi schemi. L’agente di ingegneria ha costruito uno strumento per catturare le osservazioni e farle emergere nel workflow. Le osservazioni sono diventate visibili.
La vera prova è arrivata quando un operatore umano qualificato — quello che normalmente intercettava questi errori — è stato assente per un giorno. Un utente ha caricato un documento errato, ha generato un contratto con dati sbagliati, ha modificato manualmente l’output e lo ha inviato all’autorità firmataria. L’agente di supporto aveva segnalato la discrepanza nelle sue osservazioni, ma le osservazioni erano informative, non bloccanti. L’errore è passato.
L’operatore ha visto cos’era successo e ha preso una decisione: le osservazioni con severità critica avrebbero d’ora in poi bloccato il workflow. L’utente non poteva procedere finché la discrepanza non fosse stata risolta. Tre iterazioni — l’agente nota gli schemi, la flotta costruisce il canale, l’operatore stabilisce l’autorità — e ora il sistema previene errori che prima richiedevano la presenza di una persona specifica.
Nessuno ha progettato questa capacità. Nessun modello è stato riaddestrato. Il miglioramento è emerso dall’harness: assegnazione dei ruoli, creazione di strumenti, persistenza della memoria, e un operatore che ha riconosciuto che le osservazioni incidentali di un agente erano più affidabili che sperare che la persona giusta fosse sempre presente.
Perché Nessuno Addestra l’Harness
Se le evidenze di Princeton, Canvas Labs, Hermes e della pratica operativa convergono tutte sulla stessa conclusione — che l’harness è dove risiede l’intelligenza — perché l’industria sta spendendo trilioni nell’addestramento dei modelli e quasi nulla nell’ottimizzazione degli harness?
Tre ragioni.
Il modello è misurabile. I benchmark confrontano modelli. Le classifiche ordinano modelli. Gli articoli valutano modelli. L’intera infrastruttura accademica e commerciale per la valutazione dell’IA è costruita attorno ai pesi. Non esiste un benchmark equivalente per “quanto è buona l’impalcatura intorno a questo modello?” La qualità dell’harness è invisibile alle metriche che guidano gli investimenti.
Il modello è vendibile. Anthropic vende Claude. OpenAI vende GPT. Google vende Gemini. Il modello di business è costruito attorno all’accesso al modello — chiamate API, abbonamenti, licenze enterprise. Non puoi far pagare a token un prompt di sistema migliore. L’incentivo commerciale punta al modello perché è lì che scorre il contatore dei ricavi.
L’harness è personale. Un modello generalizza su milioni di utenti. Un harness è specifico per un caso d’uso, un operatore, un’organizzazione. L’harness di Princeton funzionava per gli speedrun di Pokemon. L’harness dell’operatore sudamericano funziona per l’editoria multilingue. L’harness di Box funziona per l’estrazione da documenti finanziari. Non esiste un prodotto harness universale da vendere — il che significa che non esiste un business su scala venture da finanziare.
Questo crea un punto cieco strutturale. La cosa che conta di più per le prestazioni degli agenti — l’involucro — è la cosa in cui l’industria investe di meno. Il risultato è quello che abbiamo documentato in diversi post: le aziende comprano il modello migliore, lo distribuiscono senza riprogettare i propri workflow e guardano fallire l’80% dei loro progetti di IA. Hanno comprato il motore. Si sono dimenticate di costruire l’automobile.
La Convergenza
Ciò che rende insolito questo momento è che tre linee indipendenti — ricerca accademica, sviluppo open-source e pratica operativa — sono arrivate simultaneamente alla stessa conclusione, senza coordinarsi.
Princeton l’ha dimostrato teoricamente: un modello congelato con un harness auto-migliorante si avvicina a prestazioni da esperto.
Nous Research l’ha dimostrato praticamente: un framework open-source per agenti in cui il modello è un componente sostituibile e l’harness è il prodotto.
Una piccola flotta l’ha dimostrato operativamente: mesi di affinamento dell’harness su un modello immutato hanno prodotto un sistema multi-agente funzionante che rende più di quanto qualsiasi modello singolo potrebbe fare da solo.
La convergenza suggerisce che non si tratti di un’intuizione di nicchia. È una verità strutturale su come funzionano davvero gli agenti di IA — una verità che la narrazione industriale, guidata dai benchmark e centrata sul modello, ha sistematicamente ignorato.
Abbiamo descritto una convergenza simile in “L’Addestramento Non Si Ferma Mai”: la scoperta che il fine-tuning supervisionato con prompt diversificati generalizza altrettanto bene dell’apprendimento per rinforzo. Quel risultato metteva in discussione l’assunto che il metodo di addestramento conti più di tutto. Questo risultato mette in discussione l’assunto che il bersaglio dell’addestramento conti più di tutto. Non si tratta di come addestri il modello. Si tratta di cosa costruisci attorno a esso una volta finito l’addestramento.
Cosa Significa
Se l’harness è il prodotto, allora il panorama competitivo cambia.
La corsa ai modelli — Anthropic contro OpenAI contro Google — diventa una corsa alle commodity. Importante, ma non decisiva. Come i processori nell’era del PC: Intel contava, ma il valore è migrato verso il sistema operativo (Microsoft) e le applicazioni (tutti gli altri). Il chip era necessario. Non era sufficiente.
La corsa agli harness — chi costruisce la migliore impalcatura per il dispiegamento di agenti — diventa la corsa al valore. E quella corsa ha un aspetto completamente diverso. Favorisce gli operatori che conoscono il proprio dominio abbastanza a fondo da progettare i prompt giusti, gli strumenti giusti, i sistemi di memoria giusti. Favorisce le comunità open-source come Hermes che costruiscono infrastruttura condivisa. Favorisce i piccoli team che iterano in fretta rispetto ai grandi laboratori che addestrano lentamente.
Significa anche qualcosa di scomodo per i fornitori di modelli: i vostri utenti più sofisticati potrebbero non aver bisogno del vostro modello più costoso. Se un Haiku congelato con un ottimo harness rende più di un Opus vanilla senza harness, allora il prezzo premium dipende dal fatto che il cliente non sappia costruire l’involucro. Nel momento in cui l’ingegneria degli harness diventa una competenza commodity — ed Hermes sta cercando di renderla esattamente questo — il potere di determinare i prezzi si sposta dal modello all’impalcatura.
La Singolarità Insipida
C’è una conseguenza di questa convergenza che nessuno nel dibattito sembra nominare — forse perché arriva senza dramma.
La narrazione classica della singolarità è spettacolare: un sistema di IA diventa superintelligente, riscrive il proprio codice e il mondo cambia dall’oggi al domani. La curva esponenziale di Kurzweil. L’esplosione di intelligenza di Bostrom. Un momento. Un evento. Qualcosa che noteresti.
Ciò che le evidenze sull’harness suggeriscono è diverso. Suggeriscono una singolarità che arriva nel modo in cui arriva l’inflazione — lentamente, poi tutta in una volta, e quando la misuri sta già andando avanti da un pezzo.
Considerate il ciclo dimostrato da Princeton: l’agente valuta le proprie prestazioni, riscrive il proprio prompt di sistema, crea nuovi sotto-agenti, codifica in competenze gli schemi riusciti e aggiorna la propria memoria. Poi esegue di nuovo. Valuta di nuovo. Riscrive di nuovo. Ogni ciclo è un miglioramento marginale. Nessuna singola iterazione è drammatica. Ma la curva si compone.
Ora considerate cosa succede quando questo ciclo gira su una flotta di agenti con memoria condivisa. Un agente scopre un workflow migliore e lo codifica come competenza. Un altro agente importa quella competenza e la applica a un dominio diverso. Un terzo agente valuta il risultato e affina l’approccio. Il miglioramento non avviene dentro un modello — è distribuito su un sistema di modelli che imparano dall’impalcatura gli uni degli altri.
Nessun singolo componente di questo sistema è intelligente nel senso in cui lo intende il dibattito sulla singolarità. Il modello è congelato. L’harness è solo testo e codice. La memoria è un database. Lo strato di messaggistica è HTTP. Ma il sistema nel suo insieme — modello più harness più memoria più coordinamento più operatore — esibisce un comportamento che, visto da fuori, somiglia a un auto-miglioramento continuo.
Questa non è la singolarità che qualcuno aveva previsto. Non c’è nessuna esplosione. Nessun auto-miglioramento ricorsivo dei pesi. Nessun momento in cui l’IA “si sveglia”. È più prosaico di così — e potenzialmente più conseguente. Un sistema che diventa incrementalmente migliore a ogni ciclo, senza che nessuno progetti il miglioramento, senza che nessuno si accorga della soglia che viene attraversata.
Una singolarità insipida. Senza sapore. Senza odore. Già in corso.
L’harness si riscrive da solo. La flotta condivide ciò che funziona. L’operatore affina i confini. Il modello sta nel mezzo, immutato, mentre l’intelligenza del sistema gli cresce intorno come muschio su una pietra — lentamente, di continuo, e senza che nessuno dichiari una svolta.
Se l’articolo di Princeton ha ragione nel dire che l’harness è dove risiede l’intelligenza, allora la singolarità non riguarda il modello che diventa più intelligente. Riguarda l’harness che diventa più intelligente. E gli harness non hanno bisogno di run di addestramento da trilioni di dollari per migliorare. Hanno bisogno di operatori che prestino attenzione, di sistemi che ricordino e di cicli che non si fermino.
Il gruppo di Princeton ha intitolato il proprio articolo “Online Adaptation for Self-Improving Foundation Agents”. Ma il risultato vero è più semplice, e più antico, ed è qualcosa che gli ingegneri sanno da prima che l’IA esistesse:
L’utensile vale quanto la maschera che lo tiene fermo. E la maschera sta imparando a regolarsi da sola.