Berapa Banyak VRAM yang Anda Butuhkan untuk Menjalankan LLM Secara Lokal?

Pertanyaan utama saat menjalankan LLM lokal sederhana: apakah modelnya muat di GPU Anda? Jawabannya bergantung pada ukuran model, kuantisasi, dan panjang konteks. Panduan ini memberi Anda titik awal praktis untuk memilih jumlah VRAM yang tepat.

Bagaimana kuantisasi memengaruhi VRAM

Kuantisasi mengurangi presisi yang digunakan untuk menyimpan bobot model. Kuantisasi bit lebih rendah membuat model lebih kecil dan menggunakan lebih sedikit VRAM, dengan sedikit penurunan kualitas.

Kuantisasi Bit per bobot Penggunaan umum
Q8_0 8 Kualitas sangat tinggi
Q6_K ~6.6 Kualitas sangat baik
Q5_K_M ~5.5 Kualitas dan ukuran baik
Q4_K_M ~4.5 Keseimbangan baik antara ukuran dan kualitas
Q3_K_M ~3.5 VRAM lebih rendah, lebih banyak penurunan kualitas

Q4_K_M adalah pilihan umum saat VRAM terbatas. Jika Anda memiliki lebih banyak VRAM tersedia, Q5 atau Q6 memungkinkan Anda menjalankan model yang sama dengan kuantisasi lebih rendah.

Perkiraan VRAM berdasarkan ukuran model

Ini adalah perkiraan kasar untuk bobot model. Jumlah VRAM aktual yang dibutuhkan lebih tinggi karena runtime, KV cache, dan konteks juga menggunakan memori.

Ukuran model Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Ini adalah perkiraan, bukan batas mutlak. Arsitektur model dan format kuantisasi yang berbeda dapat mengubah ukuran aktual.

Apa yang dapat dijalankan oleh berbagai jumlah VRAM

VRAM Rentang praktis Contoh terkini
8 GB Model kecil sekitar 4B hingga 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Model kecil hingga menengah sekitar 9B hingga 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B hingga 27B dengan kuantisasi lebih rendah Gemma 4 26B-A4B, Qwen3.6 27B pada Q4
24 GB 27B hingga 35B pada Q4 hingga Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B hingga 35B pada kuantisasi lebih tinggi Qwen3.8 27B, Gemma 4 31B
48 GB Model padat besar pada kuantisasi lebih rendah Model kelas 70B pada Q3 hingga Q4
80 GB Model padat besar pada kuantisasi lebih tinggi Model kelas 70B pada Q4 hingga Q6

Rentang ini untuk model yang bobotnya dapat muat di GPU. Model MoE besar berbeda: hanya sebagian parameternya yang aktif untuk setiap token, tetapi model tetap harus menyimpan seluruh set bobotnya. Model dengan total parameter 100B atau lebih karena itu tidak muat dalam anggaran VRAM sebesar 100B hanya karena memiliki parameter aktif yang lebih sedikit.

Model MoE

Model Mixture-of-Experts berisi beberapa kelompok parameter yang disebut experts. Hanya sebagian experts yang digunakan untuk setiap token, yang dapat membuat inferensi lebih efisien daripada model padat dengan jumlah parameter total yang sama.

Namun, experts yang tidak aktif tetap menjadi bagian dari model. Model MoE besar karena itu dapat membutuhkan memori jauh lebih banyak daripada yang disarankan oleh jumlah parameter aktifnya. Model yang sangat besar mungkin memerlukan beberapa GPU atau offloading ke RAM sistem.

Panjang konteks juga menggunakan VRAM

Bobot model hanyalah sebagian dari kebutuhan memori. KV cache tumbuh seiring konteks semakin panjang, sehingga menjalankan model yang sama pada konteks 64K dapat membutuhkan VRAM jauh lebih banyak daripada menjalankannya pada 4K.

  • Konteks yang lebih panjang membutuhkan lebih banyak VRAM.
  • Presisi KV-cache memengaruhi penggunaan memori.
  • Ukuran batch dan pengguna bersamaan juga meningkatkan penggunaan memori.
  • Sisakan sebagian VRAM untuk runtime alih-alih mengisi GPU sepenuhnya dengan bobot model.

Tips praktis

  • Periksa ukuran aktual model terkuantisasi yang ingin Anda jalankan.
  • Jangan gunakan ukuran file model sebagai kebutuhan VRAM yang tepat. Sisakan ruang untuk KV cache dan runtime.
  • Jika model tidak muat sepenuhnya di VRAM, sebagian dapat dioffload ke RAM sistem, tetapi inferensi biasanya akan lebih lambat.
  • Untuk beban kerja konteks panjang atau agentik, anggarkan lebih banyak VRAM daripada yang dibutuhkan bobot model saja.
  • Beberapa GPU dapat membagi model ketika satu GPU tidak memiliki VRAM yang cukup.

Jalankan di DaDesktop

Anda tidak perlu membeli GPU untuk menjalankan LLM lokal. DaDesktop memberi Anda desktop cloud dengan VRAM yang Anda butuhkan, sehingga Anda dapat menjalankan model secara langsung tanpa memiliki perangkat kerasnya.

Pilih tingkat VRAM yang sesuai dengan model Anda, muat, dan mulai gunakan. Tanpa pengaturan, tanpa pembelian perangkat keras, tanpa masalah driver. Lihat GPU yang tersedia untuk pilihan yang ada.