Kenapa Claude Sonnet 5.5 Rilis, Ngoding Agent Naik 7x Lipat?
Claude Sonnet 5.5 rilis 28 September 2026, skor Terminal-Bench 4.0 tembus 70,6 persen dari 10,3 persen. Kenapa biaya agent ngoding turun 30 persen.
Tiap kali model AI baru keluar, orang bilang ini yang paling baru. Tapi bulan ini berbeda, karena angka di dalamnya bukan main main. Claude Sonnet 5.5 rilis resmi pada 28 September 2026 dan langsung jadi salah satu model agentic coding yang paling ramai dibahas.
Yang bikin layak dicatat, di Terminal-Bench 4.0 skornya lompat dari 10,3 persen jadi 70,6 persen. Itu lompat tujuh kali lipat dalam satu generasi, bukan perbaikan kecil. Harga token-nya sendiri justru ditahan di angka yang sama dengan Sonnet 5, sekitar 2 dolar per juta input token dan 10 dolar per juta output token.

Pertanyaannya, apakah lompatan itu kepakai buat kamu yang ngoding harian? Soalnya agent ngoding tuh bagian yang paling mahal, token menumpuk dari baca file, jalanin test, sampai debug berulang. Kalau efisiensi naik drastis di titik itu, tagihan kamu juga bisa berubah drastis. Cek portofolio gua di /projects buat lihat implementasi agent real yang gua jalanin di web dan mobile.
Claude Sonnet 5.5 Itu Apa dan Kenapa Naik Kelas
Claude Sonnet 5.5 adalah model kedua di keluarga Claude 5.5 yang rilis 28 September 2026. Posisinya disengaja, bukan penantang Opus 5.5 di sisi kemampuan, tapi jago di sisi biaya dan kecepatan. Anthropic menyebutnya paling kuat untuk tugas yang well-scoped, perbaikan bug, dan pembuatan dokumen, slide, serta spreadsheet yang rapi.
Konteksnya 1 juta token, sama persis dengan Opus 5.5. Ini penting buat agent yang harus pegang repo besar atau sesi kerja panjang tanpa perlu potong potong konteks. Model ini juga sudah tersedia di Amazon Web Services, Google Cloud, dan Microsoft Azure, lengkap dengan zero data retention seperti Sonnet 5.
Lonjakan Terminal-Bench 4.0 yang Bikin Kaget
Terminal-Bench 4.0 ngukur seberapa jauh model bisa ngerjain tugas profesional multi langkah di dalam command line. Di sini Sonnet 5.5 skor 70,6 persen, sementara Sonnet 5 cuma 10,3 persen. Angka inilah yang bikin banyak orang melongo, karena di dulu Sonnet 5 di angka yang sama sering kalah telak.
Di CursorBench 4.0 yang mengambil task ambigu multi file dari sesi Cursor asli, skornya 55,5 persen. Itu cuma sekitar dua poin di belakang Opus 5.5 yang di 57,8 persen. Di FrontierCode 1.1, effort level Xhigh-nya 46,2 persen dan Max-nya 52,1 persen, sementara GPT-6 Sol di 49,3 persen.
Yang menarik dari angka angka ini bukan cuma skalanya, tapi bentuknya. Di banyak benchmark, effort level rendah sampai menengah Sonnet 5.5 bisa melampaui skor terbaik Sonnet 5 dengan biaya per task sekitar sepersepuluh sampai sepersembilan. Itu sebabnya dia terlihat murah, bukan karena harganya diturunkan, tapi karena token yang dipakainya jauh lebih irit.
Kenapa Biaya per Task Bisa Turun 30 Persen
Harga tokennya beneran ditahan. Input 2 dolar, output 10 dolar, cache read 0,20 dolar, dan cache write 2,50 dolar per juta token. Murah dibanding Opus 5.5 yang di 4 dolar untuk input dan 20 dolar untuk output per juta token.
Penghematan besar datang dari sisi perilaku, bukan dari diskon harga. Early tester dari beberapa perusahaan menyebut model ini lebih jarang nyari info di web, lebih jarang mikir bolak balik, dan lebih sering batching beberapa tool call dalam satu langkah. Hasilnya lebih sedikit langkah, lebih sedikit shell run, dan tagihan yang lebih ringan per task yang sama.
Base44 lewat uji 118 build aplikasi nyata, Sonnet 5.5 menghasilkan aplikasi dengan kualitas setara Opus 5, tapi rata rata cuma butuh 3,6 iterasi per build, sedangkan Opus 5 butuh 7,7 iterasi. Box menyebut model ini 2,4 kali lebih cepat dan memakai 12 persen token lebih sedikit. Balyasny Asset Management mencatat 121 ribu token per jawaban, bandingkan 497 ribu token di Sonnet 5.
Kapan Pakai Sonnet 5.5 dan Kapan Tetap di Opus 5.5
Aturannya cukup simpel. Kalau tugasnya well-scoped, artinya masalahnya jelas dan solusinya relatif lugas, pakai Sonnet 5.5 di effort rendah atau menengah. Tasks yang seperti itu justru paling sering muncul di kerja harian, dan di titik itu Sonnet 5.5 paling efisien biayanya.
Kalau pekerjaannya open-ended dan butuh judgment yang berkelanjutan, misalnya arsitektur sistem besar atau keputusan desain berisiko tinggi, tetap andalkan Opus 5.5. Anthropic sendiri tegas bilang di kompleks yang terbuka, Opus 5.5 masih jelas lebih kuat. Sekarang Claude Haiku 5.5 untuk penggunaan high volume dan sensitif biaya akan menyusul dalam beberapa minggu.
Bisa juga pakai dua duanya. Pola yang paling masuk akal: Opus 5.5 buat menentukan arsitektur dan kerangka besar, Sonnet 5.5 buat implementasinya. Quotes dari Creator dan Unity di halaman rilis Anthropic juga mengarah ke situ, Sonnet 5.5 kuat di implementasi sementara framework-nya dibentuk di atas model yang lebih besar.
Empat Catatan Penting Sebelum Kamu Migrasi
Pertama, ini model pertama di keluarga Sonnet yang rilis dengan cyber safeguards dan fallback seperti yang dipakai di model paling mampu milik Anthropic. Safeguards itu cuma menyasar permintaan berisiko tinggi, jadi pengembangan software rutin dan kebanyakan kerja life sciences tetap tidak terpengaruh.
Kedua, kalau kamu pakai thinking off, wajib pindah ke setting between_tools dulu sebelum naik ke Sonnet 5.5, karena setting lama sudah tidak berlaku. Ketiga, skor GDPval-AA dan AA-Briefcase di Artificial Analysis dijalankan di deployment prarilis yang punya bug, jadi angkanya bisa sedikit di bawah potensi sebenarnya. Bug-nya sendiri sudah diperbaiki.
Keempat, di FrontierCode, effort level Max justru skornya lebih rendah dari Xhigh. Penyebabnya, di Max model lebih sering menjalankan code review skill yang memecah review ke banyak subagent, dan itu kadang bikin timeout atau edit di luar scope. Jadi kalau kamu memang butuh output paling rapi, jangan buru buru naik ke Max.
Jadi kesimpulannya, Claude Sonnet 5.5 bukan model yang paling tajam di semua kategori. Tapi buat majority developer dan tim yang butuh agent ngoding jalan terus seharian tanpa bikin tagihan meledak, efisiensi yang dia bawa justru yang paling kepakai. Naiknya Terminal-Bench dari 10,3 ke 70,6 persen ditambah token yang lebih irit, itu kombinasi yang jarang.

Dimas Febriyanto
Fullstack & Mobile Developer specializing in Golang & Flutter. Aktif sebagai Junior Mobile Developer di Sagara Technology & asisten lab di Universitas Gunadarma. Passionate about building scalable algorithms & high-impact applications.
Lihat Portofolio