Sierra rilascia Hyper-τ-Bench, un benchmark per la costruzione di agenti AI
Sierra pubblica un benchmark open source per valutare la capacità degli agenti AI di costruire sistemi di servizio clienti.

Sierra rilascia Hyper-τ-Bench, un benchmark per la costruzione di agenti AI
Sierra, azienda specializzata nella costruzione di agenti di servizio clienti, ha annunciato il rilascio di Hyper-τ-Bench, un benchmark open source progettato per valutare la capacità degli agenti AI di creare sistemi di servizio clienti funzionanti. Il benchmark, pubblicato il 8 settembre 2026, è stato sviluppato in collaborazione con ricercatori del settore e include una serie di test che simulano le sfide reali del mondo aziendale. L’obiettivo è misurare non solo la capacità di un modello di compiere compiti specifici, ma anche la sua capacità di costruire autonomamente un agente in grado di gestire interazioni complesse con i clienti. Il benchmark è disponibile sotto licenza MIT e include un leaderboard pubblico per il confronto tra diverse configurazioni.
Un approccio sperimentale per la costruzione di agenti
Hyper-τ-Bench si basa su un modello di lavoro che simula un ambiente di sviluppo in cui un agente AI deve ricostruire specifiche da documenti, interagire con un cliente simulato e progettare un sistema in grado di gestire compiti complessi. Il benchmark include 53 task distribuiti in quattro domini: aeronautica, retail, telecom e banca. Ogni task richiede l’uso di strumenti specifici e la capacità di adattarsi a contesti diversi. La simulazione include anche un’API REST che potrebbe presentare piccoli errori, costringendo gli agenti a distinguere tra problemi di specifica e problemi di codice. La costruzione dell’agente deve avvenire all’interno di un sandbox, con limiti di budget e di modelli utilizzabili.
La costruzione di un agente richiede una comprensione approfondita delle specifiche e della logica del sistema. I dati raccolti mostrano che il 92% dei progetti utilizza un unico ciclo di strumenti basati su modelli LLM, con il 96% dei progetti basati su Codex che utilizza un modello OpenAI. Inoltre, il 13% dei progetti basati su Kimi Code utilizza un modello Kimi. Questi dati evidenziano una forte dipendenza da modelli già noti, limitando la capacità di innovazione e adattamento. La costruzione di un agente efficace richiede una combinazione di conoscenza, abilità di progettazione e capacità di adattamento a contesti complessi.
La simulazione include test verificabili che non vengono rivelati durante la costruzione. Dopo la consegna dell’agente, esso deve affrontare traffico simulato e test verificabili, senza conoscere i criteri di valutazione. Questo approccio mira a simulare le condizioni reali di un ambiente produttivo, in cui l’agente deve operare senza informazioni privilegiate. I test sono condotti in un ambiente chiuso, con valutazioni automatiche e senza filtri. Questo metodo garantisce una valutazione imparziale e rigorosa, utile per confrontare le capacità degli agenti in condizioni simili a quelle reali.
Il rilascio di Hyper-τ-Bench rappresenta un passo significativo verso la costruzione di agenti AI più avanzati, in grado di gestire compiti complessi autonomamente. L’open source del benchmark permette a ricercatori e sviluppatori di testare e migliorare le capacità degli agenti, contribuendo a una maggiore trasparenza e collaborazione nel settore. La pubblicazione del benchmark è accompagnata da un documento di 41 pagine, disponibile su arXiv, che descrive in dettaglio il framework e i risultati ottenuti. L’obiettivo di Sierra è continuare a utilizzare Hyper-τ-Bench per monitorare l’evoluzione delle capacità degli agenti AI nel tempo.
