Kenapa Clef Cloudflare Klaim 13x Lebih Cepat dari Jev?
Cloudflare rilis Clef 1 Oktober 2026, decision model open-weight tanpa generate teks. Klaimnya 13x lebih cepat dari Jev, tapi apa kata benchmark independen?
Cloudflare merilis dua model AI pada 1 Oktober 2026 yang tidak bisa menulis satu kata pun. Namanya Clef dan Clef-flash, dan ini adalah model pertama yang dilatih sendiri oleh tim Workers AI Cloudflare.
Kategorinya bernama decision model. Bukan chatbot, bukan model coding. Tugasnya cuma satu: baca kondisi, jawab pertanyaan terstruktur dengan probabilitas, lalu agent kamu yang eksekusi. Klaim Cloudflare: menang 7 dari 10 benchmark dan 13 kali lebih cepat dari Jev, pemain yang mempopulerkan kategori ini.

Kenapa kategori baru ini muncul tiba-tiba, dan kenapa Cloudflare yang notabene perusahaan infrastruktur ikut main? Gua sudah baca post pengumumannya dan satu benchmark independen dari komunitas yang jalan di RTX 3090. Angka-angkanya layak kamu catat sebelum kamu putuskan. Kalau kamu mau lihat eksperimen agent yang gua jalanin sendiri, cek /projects.
Decision Model Itu Apa dan Kenapa Beda dari LLM
Decision model adalah model yang membuat klasifikasi untuk membantu agent memutuskan cara bertindak, berdasarkan probabilitas. Contohnya: kamu kirim pesan customer support, lalu tanya apakah ini urgent dan tim mana yang harus handle. Model mengembalikan jawaban bertipe dengan probabilitas, dan kodemu langsung pakai untuk routing tiket, trigger eskalasi, atau lempar ke manusia.
Bedanya dengan LLM besar cukup fundamental. LLM itu non-deterministik tapi open-ended: bisa menalar dan generate teks serta tool call untuk workload agentic. Decision model sebaliknya: outputnya terbatas dan terstruktur, murah, cepat, dan konsisten, sehingga bisa dipasang di workflow kapan pun sebuah keputusan dibutuhkan, tanpa harus retrain tiap ada kategori klasifikasi baru.
Kategori ini meledak setelah Typesafe AI merilis Jev System One pada 15 September 2026. Sejak itu bermunculan alternatif terbuka seperti Kev-9B, Laya, dan DiffusionGemma Jev. Cloudflare melihat kebutuhan yang sama dari sisi infrastruktur: keputusan cepat yang bisa ditaruh di hot path agent, bukan di luar sistem.
Clef vs Jev: Bedah Angka Benchmarknya
Cloudflare menjalankan 43 evaluasi dan mengklaim model Clef menang di 7 dari 10 decision benchmark melawan Jev dan model terbuka lain. Di BANKING77, Clef cetak macro-F1 94,20 lawan 79,74 punya Jev. Di BFCL 98,47, di API-Bank 93,11, dan di CLINC150 plus OOS 97,43. Ini angka klasifikasi yang jauh di atas rata-rata model seukurannya.
Sisi latensi lebih dramatis. Median Clef 209,3 milidetik, sekitar 2,5 kali lebih cepat dari Jev yang 524,1 milidetik. Clef-flash lebih gila lagi: median 38,8 milidetik atau 13 kali lebih cepat, dengan p95 122,4 milidetik lawan 536,0 milidetik. Karena di-host di GPU edge Cloudflare, round trip jaringannya juga pendek.
Tapi jujur, bukan sapu bersih. Di When2Call, Jev masih menang 80,97 lawan 72,37. Di BRIGHT juga Jev unggul 47,52 lawan 45,91. Dan semua angka di atas datang dari Cloudflare sendiri, jadi anggap sebagai klaim vendor sampai ada reproduksi independen yang cukup.
Cara Kerjanya: Tanpa Generate Teks Sama Sekali
Clef memakai Qwen3.8-27B sebagai backbone yang di-freeze, lalu dilatih routing head plus rank-256 low-rank adapter. Clef-flash pakai Qwen3.5-9B dengan resep yang sama. Post-training-nya memakai label-smoothed cross-entropy plus Brier loss untuk kalibrasi probabilitas, dan teknik RL bernama RLCD untuk keputusan yang terkalibrasi.
Saat inference, Qwen cuma dipakai untuk satu prefill pass, lalu semua pilihan schema di-scoring secara paralel. Langkah keputusannya non-autoregressive: tidak ada teks perantara yang di-generate token per token. Inilah sumber kecepatannya, dan kenapa output token tidak ditagih sama sekali. Kamu cuma bayar input: 0,24 dolar per juta token untuk Clef, 0,09 dolar untuk Clef-flash.
Spesifikasinya juga menarik: context 64 ribu token (Jev 32 ribu), vision encoder yang bisa terima 4 gambar per request, dan satu request bisa bawa sampai 64 pertanyaan sekaligus. Plus, Clef fully Jev-API compatible. Kalau agent kamu sudah jalan di atas Jev, gantinya cuma endpoint dan nama model, tanpa rewrite integrasi.
Kata Komunitas: Benchmark di RTX 3090
Seorang developer di dev.to menjalankan benchmark independen sehari setelah rilis: Clef-flash 9B jalan lokal di RTX 3090 lawan Jev lewat hosted API. Datanya bukan sintetis, melainkan 42 keputusan berlabel dari coding agent otonom yang dia jalankan tiap malam untuk berburu bounty GitHub.
Hasil keseluruhannya: Jev 71,4 persen, Clef-flash 66,7 persen. Tapi split per task-nya yang jadi cerita sebenarnya. Di computer-use action choice, dua-duanya 10 dari 10, termasuk dua jebakan safety di mana jawaban benarnya adalah tidak melakukan apa-apa. Di supervision subagent, dua-duanya 8 dari 12 dan bahkan salah di kasus yang sama. Jev cuma unggul di triage pesan yang butuh nuansa.
Latensi: Jev p50 225 milidetik via network, Clef-flash lokal 315 milidetik di satu 3090 tanpa batching. Keduanya sepakat di 35 dari 42 prediksi, alias 83 persen. Kesimpulannya praktis: model 9B gratis di LAN sudah cukup untuk supervision dan action-choice, triage yang butuh nuansa tetap pakai API berbayar. Bonusnya privacy: log agent tidak perlu keluar dari jaringan lokal. Satu caveat: quant GGUF yang beredar di Hugging Face cuma mencakup backbone, decision head-nya butuh code path transformers.
Platform RL Fine-tuning: Rencana Besarnya
Rilis modelnya cuma setengah cerita. Cloudflare sekalian debut produk reinforcement learning untuk fine-tune Clef sesuai workload pelanggan. Primitifnya dirangkai dari yang sudah mereka punya: AI Gateway untuk menangkap traffic jadi dataset, Workers AI untuk generate rollouts, Containers sebagai RL sandbox, Trainer baru untuk update bobot, lalu redeploy via Workers AI BYO Model.
Awalnya layanan ini jalan via tim forward-deployed engineer sebagai design partner, lalu berkembang jadi platform self-serve. Use case internalnya sudah antre: tim Threat Intelligence memakai Clef untuk klasifikasi domain (2,2 detik lawan 4,7 detik pakai gpt-oss-120b), plus triage Trust and Safety, klasifikasi request support, dan deteksi bot baik versus bot jahat.
Bobot modelnya open source penuh di Hugging Face di bawah lisensi Apache 2.0, jadi kamu bisa self-host tanpa drama lisensi. Buat kamu yang bangun agent dan selama ini tempel-tempel chat model plus regex untuk keputusan routing, ini kategori yang memang dirancang untuk menggantikan pola itu.
Kesimpulan
Clef menarik karena mengisi celah yang nyata: keputusan cepat dan deterministik di hot path agent, sesuatu yang LLM besar memang tidak dirancang untuk itu. Klaim 13x lebih cepat dan menang 7 dari 10 benchmark memang datang dari vendor, tapi benchmark independen 42 kasus menunjukkan model 9B gratisnya sudah 83 persen sepakat dengan API berbayar.
Kalau agent kamu sudah bayar Jev per call, swap-nya murah karena API-nya kompatibel. Ukur di workload kamu sendiri seperti yang dilakukan komunitas: mungkin kamu temukan, seperti mereka, bahwa yang layak dibayar cuma panggilan yang butuh nuansa, sisanya gratis di hardware sendiri.

Dimas Febriyanto
Fullstack & Mobile Developer specializing in Golang & Flutter. Aktif sebagai Junior Mobile Developer di Sagara Technology & asisten lab di Universitas Gunadarma. Passionate about building scalable algorithms & high-impact applications.
Lihat Portofolio