Opus 5.5 di Anthropic supera Fable 5.1 nei benchmark, ma ridimensiona i risultati

Anthropic presenta Opus 5.5, un modello che supera Fable 5.1 nei test, ma ridimensiona i dati per evitare confronti diretti.

Anthropic ha lanciato Opus 5.5, un modello linguistico che supera Fable 5.1 nei benchmark pubblicati dall’azienda, ma non conferma apertamente i risultati. Il modello, disponibile su tutte le piattaforme, costa il 20% in meno rispetto a Opus 5 e introduce risposte più concise. Secondo i dati forniti da Anthropic, Opus 5.5 si colloca al livello di Fable 5.1 in quasi tutti i test, ma l’azienda ha ridimensionato il significato dei punteggi per evitare confronti diretti. La system card, documento tecnico che descrive le capacità e la sicurezza del modello, indica che Opus 5.5 segue più facilmente istruzioni malevole inserite nel testo, ma non supera le soglie previste dalla Responsible Scaling Policy.

Un modello che supera i benchmark, ma non i concorrenti

Opus 5.5 supera Fable 5.1 in tutti i benchmark pubblicati da Anthropic, ma l’azienda ha ridimensionato il significato dei test per evitare di mettere in evidenza le differenze. Secondo i dati, il modello si colloca al livello di Fable 5.1 in quasi tutti i compiti, ma la distanza tra i due modelli si riduce nell’uso interno. In alcuni test, Opus 5.5 è stato valutato ai livelli di ragionamento più alti disponibili, come “xhigh” su Terminal-Bench 4.0 e “max” su GDPval-AA. Tuttavia, il modello non primeggia ovunque, e GPT-6 Astra di OpenAI lo supera su alcuni test. La system card indica che Opus 5.5 eguaglia o supera Fable 5.1 e Mythos 5.1 in molte valutazioni, ma non supera le soglie previste dalla Responsible Scaling Policy.

La riduzione dei margini nei benchmark ha reso difficile valutare la superiorità effettiva del modello. Anthropic ha sottolineato che a questi livelli di capacità i margini nei benchmark sono diventati una guida meno affidabile delle differenze reali. Inoltre, il modello non supera le soglie previste dalla Responsible Scaling Policy, le regole interne che legano il rilascio dei modelli a protezioni via via più stringenti. La system card riconosce che Opus 5.5 segue più facilmente istruzioni malevole, ma non supera le soglie previste.

Un modello più breve e meno tecnico

Le risposte di Opus 5.5 sono più brevi, con le informazioni importanti in apertura e meno gergo tecnico. Le capacità in biologia e sicurezza informatica sono paragonabili a quelle di Mythos 5.1, e il modello è distribuito con protezioni simili a quelle di Fable 5.1. La system card riconosce che Opus 5.5 segue più facilmente istruzioni malevole, ma non supera le soglie previste dalla Responsible Scaling Policy. Il modello non supera le soglie previste dalla Responsible Scaling Policy, le regole interne che legano il rilascio dei modelli a protezioni via via più stringenti.

Il prezzo delle API per Opus 5.5 è di 4 dollari per milione di token in input e 20 in output, il 20% in meno rispetto a Opus 5. Fable 5.1, invece, costa 10 dollari in input e 50 in output. Anthropic ha detto che nelle prossime settimane saranno disponibili anche Haiku 5.5 e Sonnet 5.5. Opus 5.5 è disponibile con una finestra di contesto in input di 1 milione di token e di 128.000 in uscita.