Cloudflare lancia Clef: modelli decision open-source che battono Jev (e pure più veloci)

Nelle ultime settimane si è parlato molto di decision models — modelli che invece di generare testo lungo come un LLM classico, restituiscono decisioni strutturate, veloci e deterministiche. Il modello Jev di Typesafe AI ha fatto molto rumore in questo senso. Oggi Cloudflare rilascia Clef e Clef-flash, due modelli addestrati internamente che battono Jev sul Jev Decision Index stesso.

Non è marketing: i numeri sono visibili sul sito di benchmark live. Modelli più precisi, più veloci, compatibili con l’API di Jev, rilasciati open-source su Hugging Face sotto licenza Apache 2.0. Tradotto: prendili, usali, anche commercialmente, senza chiedere permesso.

Che cos’è un decision model

Un decision model fa classificazioni per aiutare gli agenti a decidere come agire. Passigli un messaggio di supporto clienti e ti restituisce risposte tipizzate con probabilità — ‘urgente al 90%’, ‘team tecnico 85%’, ‘severità critica 95%’. Il tuo codice può quindi instradare il ticket, attivare un’escalation, o chiamare un umano solo quando serve davvero.

Cloudflare ha testato Clef nel team di Threat Intelligence per classificare domini web. Gli passi un dominio (con Browser Run) e in 2,2 secondi ottieni una lista: 95% fashion, 85% ecommerce, meno dell’1% phishing. Il loro LLM generale più veloce, gpt-oss-120b, ci metteva 4,7 secondi nello stesso workflow e restituiva solo due classificazioni. Latenza dimezzata, risultati più ricchi.

Perché ‘Clef’?

In teoria musicale, una chiave (clef) è il simbolo che assegna nomi di note specifiche alle linee del pentagramma. Un decision model fa qualcosa di simile: definisce il dominio del contesto e le azioni che ne derivano. E poi, diciamocelo, CF suona come Cloudflare.

Clef vs Jev: cosa cambia davvero

Clef ha tre proprietà che lo distinguono. Primo: ha un vision encoder, quindi classifica anche immagini. Jev fa solo testo. Secondo: context window da 64k token, contro i 32k di Jev. Terzo: è accurato. Alcuni risultati dai benchmark:

  • BFCL (case exact): Clef 98.47%, Jev 95.75%
  • API-Bank (accuracy): Clef 91.93%, Jev 88.19%
  • CLINC150+OOS (macro-F1): Clef 97.43%, Jev 89.27%
  • Home appliances (case exact): Clef-flash 97.73%, Jev 52.27%

Cloudflare ha girato anche la suite di eval proprietaria di Typesafe: Clef batte Jev in 3 aree su 4. Clef-flash — la versione veloce — performa eccezionalmente bene considerando quanto è rapido.

Latenza

Sui 43 benchmark eseguiti, Clef batte tutti i decision models per latenza, tranne Laya, che è velocissimo ma sacrifica parecchia qualità nei benchmark di accuratezza:

  • Latenza mediana: Clef 209ms, Clef-flash 38ms, Jev 524ms
  • Latenza p95: Clef 238ms, Clef-flash 122ms, Jev 536ms

Clef-flash è quasi 14 volte più veloce di Jev sulla mediana. Gira su Workers AI, quindi su GPU edge di Cloudflare, e la latenza di rete è bassissima. Puoi metterlo nel path critico delle decisioni dell’agente e combinarlo con un LLM su Workers AI per l’esecuzione.

Come funziona sotto il cofano

Clef usa Qwen come backbone — Qwen 3.8-27B per Clef, Qwen 3.5-9B per Clef-flash. Durante l’inferenza, fa un singolo passaggio di prefill con Qwen, poi valuta in parallelo le scelte valide dello schema. Il passo decisionale è non-autoregressivo: non genera testo intermedio token per token, il che lo rende molto più veloce dei LLM classici.

Invece di generare testo per produrre risposte strutturate, Clef deriva le scelte dello schema direttamente dalle rappresentazioni interne del backbone, tramite un processo di attention routing a due stadi: ogni scelta valida estrae contesto rilevante dal prompt, i parametri dei singoli campi fanno cross-attention con altri campi e con il payload originale prima dello scoring.

I pesi di Qwen sono congelati; la routing head è ottimizzata congiuntamente con low-rank adapter rank-256. Il post-training usa cross-entropy con label smoothing per gli output validi dello schema, più una loss di Brier per calibrare le probabilità. Il training si basa su dataset sintetici interni che permutano ordini dei campi, prompt e strutture dello schema.

Cloudflare ha sviluppato anche RLCD (Reinforcement Learning for Calibrated Decisions) come target di ottimizzazione secondario: dà credito parziale a scelte ordinali adiacenti, premia output completamente precisi, e applica una penalità di riferimento per prevenire distribution shift.

Fine-tuning e il nuovo servizio RL

Molti team interni a Cloudflare hanno bisogno di un Clef specializzato: un classificatore per valutare submission Trust & Safety, fare triage di richieste di supporto, o decidere se un crawler è un bot buono o cattivo. Questi casi sono specifici, e Cloudflare ha anni di decisioni etichettate su cui addestrare. Con il fine-tuning guadagni accuratezza nel dominio specifico, a scapito di un po’ di performance general-purpose.

Il servizio funziona così: un team FDE (forward-deployed engineer) lavora direttamente con i clienti. Da queste esperienze Cloudflare costruirà poi una piattaforma self-serve per catturare dati, fare fine-tuning e ridistribuire il modello.

I primitivi della piattaforma RL

  • AI Gateway — passa il traffico AI attraverso Gateway e crei automaticamente un dataset di richieste per il tuo use case
  • Workers AI — genera rollout contro il modello Clef base
  • Containers — sandbox RL per scoring e replay delle azioni degli agenti
  • Trainer (nuovo) — aggiorna i pesi del modello fine-tuned
  • Workers AI + BYO Model — ridistribuisce il modello fine-tuned su Workers AI

La piattaforma connette AI Gateway, Containers per sandbox RL, e il lavoro Bring Your Own Model (Cog) su Workers AI avviato dall’acquisizione di Replicate.

Come provarlo

È il primo modello ML addestrato da Cloudflare rilasciato dal team Workers AI. Ancora early stage, molti miglioramenti in arrivo. Puoi provare Clef su Workers AI oggi, scaricare i pesi su Hugging Face per esplorare in locale, o contattarli per use case di fine-tuning. È completamente API-compatibile con Jev, quindi lo swap è immediato. Cloudflare non legge, non memorizza e non addestra sui tuoi dati, a meno che tu non scelga di usare il prodotto di fine-tuning.

AI LABELS_3x2_3_black