Sierra rilascia Hyper-τ-Bench, un benchmark per la costruzione di agenti AI

Sierra pubblica un benchmark open source per valutare la capacità degli agenti AI di costruire sistemi di servizio clienti.

Un team di sviluppo lavora su un benchmark per testare la capacità degli agenti AI di costruire sistemi di servizio clienti
Un team di sviluppo lavora su un benchmark per testare la capacità degli agenti AI di costruire sistemi di servizio clienti

Sierra rilascia Hyper-τ-Bench, un benchmark per la costruzione di agenti AI

Sierra, azienda specializzata nella costruzione di agenti di servizio clienti, ha annunciato il rilascio di Hyper-τ-Bench, un benchmark open source progettato per valutare la capacità degli agenti AI di creare sistemi di servizio clienti funzionanti. Il benchmark, pubblicato il 8 settembre 2026, è stato sviluppato in collaborazione con ricercatori del settore e include una serie di test che simulano le sfide reali del mondo aziendale. L’obiettivo è misurare non solo la capacità di un modello di compiere compiti specifici, ma anche la sua capacità di costruire autonomamente un agente in grado di gestire interazioni complesse con i clienti. Il benchmark è disponibile sotto licenza MIT e include un leaderboard pubblico per il confronto tra diverse configurazioni.

Un approccio sperimentale per la costruzione di agenti

Hyper-τ-Bench si basa su un modello di lavoro che simula un ambiente di sviluppo in cui un agente AI deve ricostruire specifiche da documenti, interagire con un cliente simulato e progettare un sistema in grado di gestire compiti complessi. Il benchmark include 53 task distribuiti in quattro domini: aeronautica, retail, telecom e banca. Ogni task richiede l’uso di strumenti specifici e la capacità di adattarsi a contesti diversi. La simulazione include anche un’API REST che potrebbe presentare piccoli errori, costringendo gli agenti a distinguere tra problemi di specifica e problemi di codice. La costruzione dell’agente deve avvenire all’interno di un sandbox, con limiti di budget e di modelli utilizzabili.

La costruzione di un agente richiede una comprensione approfondita delle specifiche e della logica del sistema. I dati raccolti mostrano che il 92% dei progetti utilizza un unico ciclo di strumenti basati su modelli LLM, con il 96% dei progetti basati su Codex che utilizza un modello OpenAI. Inoltre, il 13% dei progetti basati su Kimi Code utilizza un modello Kimi. Questi dati evidenziano una forte dipendenza da modelli già noti, limitando la capacità di innovazione e adattamento. La costruzione di un agente efficace richiede una combinazione di conoscenza, abilità di progettazione e capacità di adattamento a contesti complessi.

La simulazione include test verificabili che non vengono rivelati durante la costruzione. Dopo la consegna dell’agente, esso deve affrontare traffico simulato e test verificabili, senza conoscere i criteri di valutazione. Questo approccio mira a simulare le condizioni reali di un ambiente produttivo, in cui l’agente deve operare senza informazioni privilegiate. I test sono condotti in un ambiente chiuso, con valutazioni automatiche e senza filtri. Questo metodo garantisce una valutazione imparziale e rigorosa, utile per confrontare le capacità degli agenti in condizioni simili a quelle reali.

Il rilascio di Hyper-τ-Bench rappresenta un passo significativo verso la costruzione di agenti AI più avanzati, in grado di gestire compiti complessi autonomamente. L’open source del benchmark permette a ricercatori e sviluppatori di testare e migliorare le capacità degli agenti, contribuendo a una maggiore trasparenza e collaborazione nel settore. La pubblicazione del benchmark è accompagnata da un documento di 41 pagine, disponibile su arXiv, che descrive in dettaglio il framework e i risultati ottenuti. L’obiettivo di Sierra è continuare a utilizzare Hyper-τ-Bench per monitorare l’evoluzione delle capacità degli agenti AI nel tempo.