October 5, 2026
Updated:
7 min read

Kenapa Model 125 Miliar Parameter Ini Muat di GPU Gaming?

Strata, engine open source berlisensi MIT, menjalankan model MoE 125B Qwen3.8-Flash-Next di PC gaming biasa. 12 ribu star GitHub dalam dua minggu. Ini triknya.

Biasanya model AI dengan 125 miliar parameter cuma bisa jalan di server data center. RAM ratusan gigabyte, GPU kelas server, dan tagihan listrik yang bikin dompet menangis.

Strata mengubah asumsi itu. Engine open source ini menjalankan model 125B di PC gaming biasa, dengan GPU 12 GB dan RAM 32 GB.

Proyek yang dibuat 24 September 2026 ini langsung meledak: 12 ribu star di GitHub dalam dua minggu dan 786 poin di Hacker News. Mari bedah kenapa ini mungkin.

Strata Itu Apa dan Kenapa Ramai Dibicarakan

Strata adalah inference engine open source berlisensi MIT karya developer dengan handle Niko1221. Cara pakainya sederhana: download, jalankan START-HERE.bat di Windows atau setup.sh di Linux, jawab beberapa pertanyaan, lalu browser terbuka di alamat localhost:8080.

Yang bikin ramai adalah klaim intinya: menjalankan Qwen3.8-Flash-Next, model MoE 125B dari tim Qwen, di hardware konsumen. Syaratnya GPU NVIDIA RTX seri 20 ke atas atau AMD RX seri 7900 dan 9070 dengan VRAM minimal 12 GB, RAM 32 GB, dan ruang SSD sekitar 80 GB. Installer-nya akan bertanya ukuran model dan konteks yang muat di RAM-mu, lalu mengunduh bobot sekitar 70 GB.

Datanya sendiri yang bicara. Repo ini dibuat 24 September 2026 dan per 5 Oktober sudah mengumpulkan lebih dari 12 ribu star dan seribu fork. Thread pengumumannya di Hacker News tembus 786 poin dengan lebih dari 350 komentar, jadi diskusi terpanas tentang inferensi lokal minggu ini.

Model yang Dipakai: Qwen3.8-Flash-Next

Modelnya bukan model kecil yang dipaksakan, tapi Qwen3.8-Flash-Next, model multimodal MoE dari tim Qwen. Menurut blog resminya, model utama punya 125 miliar parameter, ditambah 51 miliar parameter embedding N-gram, dengan hanya 6 miliar parameter yang aktif per token.

Qwen membukanya sebagai preview awal arsitektur Qwen4, dengan bobot yang bisa diunduh bebas di Hugging Face dan ModelScope. Model ini mendukung konteks 262 ribu token dan bisa diperluas hingga 1 juta token.

Dari sisi kemampuan, klaim Qwen cukup berani: di benchmark coding SWE-bench Pro ia mencetak 62,5, mengungguli Claude-Opus-4.6 yang di angka 53,4. Versi cloud-nya dipatok 0,15 dolar per juta token input. Dengan Strata, model sekelas ini jalan di PC sendiri, tanpa bayar per token.

Triknya: Bagi Tugas ke Seluruh PC

Rahasianya ada di cara MoE bekerja dan cara Strata memanfaatkannya. Qwen3.8-Flash-Next tersusun dari 24.576 expert, spesialis-spesialis kecil, tapi setiap kata yang dihasilkan cuma butuh sekitar 10 expert.

Strata membagi expert itu ke seluruh komponen PC. Expert yang paling sering dipakai disimpan di VRAM GPU, seluruh expert disimpan di RAM, CPU ikut mengerjakan sisanya, dan tabel lookup raksasa disimpan di SSD. Pendekatan yang sama juga dipakai Qwen: 51 miliar parameter embedding N-gram disimpan di memori host dan diambil secara asynchronous.

Ada satu trik lagi: tebak lalu cek. Helper kecil menebak beberapa kata berikutnya, lalu model besar memverifikasi semuanya sekaligus. Hasilnya kecepatan naik 1,6 sampai 1,8 kali lipat tanpa mengubah jawaban. Konteksnya juga lega: varian IQ3_S mendukung 128 ribu token konteks dalam sekali jalan.

Seberapa Cepat? Bedah Angkanya

Strata mengukur langsung di dua PC gaming biasa. Di RTX 5070 dengan 12 GB VRAM, kecepatan menulis jawaban berkisar 53 sampai 94 token per detik tergantung kuantisasi, dengan varian Q2_0 paling cepat. Sebagai gambaran, 60 token per detik sudah lebih cepat dari kecepatan membaca manusia.

Untuk membaca prompt, angkanya jauh lebih besar: 1.620 sampai 2.650 token per detik. Artinya dokumen 32 ribu token terbaca dalam belasan detik. Di RTX 3090 dengan 24 GB VRAM diperkirakan tembus 100 sampai 140 token per detik. Di kubu AMD, RX 9070 XT dengan 16 GB VRAM menulis 60 token per detik pada varian Q2_0.

Yang punya RAM 64 GB bisa pakai varian penuh IQ3_S. Yang cuma punya 32 GB ada varian Coder: setengah expert dibuang, tapi tetap mencapai 91 persen skor SWE-bench Verified model penuh menurut pengukurnya.

Kenapa Ini Penting Buat Kamu

Strata menyediakan API yang kompatibel dengan OpenAI di localhost:8080, endpoint gaya Anthropic, dan server MCP. Artinya Claude Code, Cursor, dan Copilot bisa memakainya langsung tanpa kunci API dan tanpa data yang keluar dari PC. Mode reasoning-nya juga bisa dipilih: off, low, medium, atau high, tinggal sesuaikan dengan kebutuhanmu.

Ini mengubah kalkulasi inferensi lokal. Dulu model besar berarti server atau langganan cloud. Sekarang PC gaming yang kamu pakai main game juga bisa jadi mesin AI pribadi yang serius, dengan biaya listrik sebagai satu-satunya ongkos.

Kalau kamu penasaran dengan proyek eksperimen seputar AI dan tooling seperti ini, mampir ke /projects di blog ini. Era model raksasa yang cuma milik data center mungkin sudah lewat, dan Strata adalah buktinya.

Dimas Febriyanto - Fullstack Developer

Dimas Febriyanto

Fullstack & Mobile Developer specializing in Golang & Flutter. Aktif sebagai Junior Mobile Developer di Sagara Technology & asisten lab di Universitas Gunadarma. Passionate about building scalable algorithms & high-impact applications.

Lihat Portofolio

Liked this article?

Feel free to share it with your network or reach out if you have any questions!