Berapa Banyak VRAM yang Anda Butuhkan untuk Menjalankan LLM Secara Lokal?
Pertanyaan utama saat menjalankan LLM lokal sederhana: apakah modelnya muat di GPU Anda? Jawabannya bergantung pada ukuran model, kuantisasi, dan panjang konteks. Panduan ini memberi Anda titik awal praktis untuk memilih jumlah VRAM yang tepat.
Bagaimana kuantisasi memengaruhi VRAM
Kuantisasi mengurangi presisi yang digunakan untuk menyimpan bobot model. Kuantisasi bit lebih rendah membuat model lebih kecil dan menggunakan lebih sedikit VRAM, dengan sedikit penurunan kualitas.
| Kuantisasi | Bit per bobot | Penggunaan umum |
|---|---|---|
| Q8_0 | 8 | Kualitas sangat tinggi |
| Q6_K | ~6.6 | Kualitas sangat baik |
| Q5_K_M | ~5.5 | Kualitas dan ukuran baik |
| Q4_K_M | ~4.5 | Keseimbangan baik antara ukuran dan kualitas |
| Q3_K_M | ~3.5 | VRAM lebih rendah, lebih banyak penurunan kualitas |
Q4_K_M adalah pilihan umum saat VRAM terbatas. Jika Anda memiliki lebih banyak VRAM tersedia, Q5 atau Q6 memungkinkan Anda menjalankan model yang sama dengan kuantisasi lebih rendah.
Perkiraan VRAM berdasarkan ukuran model
Ini adalah perkiraan kasar untuk bobot model. Jumlah VRAM aktual yang dibutuhkan lebih tinggi karena runtime, KV cache, dan konteks juga menggunakan memori.
| Ukuran model | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Ini adalah perkiraan, bukan batas mutlak. Arsitektur model dan format kuantisasi yang berbeda dapat mengubah ukuran aktual.
Apa yang dapat dijalankan oleh berbagai jumlah VRAM
| VRAM | Rentang praktis | Contoh terkini |
|---|---|---|
| 8 GB | Model kecil sekitar 4B hingga 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Model kecil hingga menengah sekitar 9B hingga 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B hingga 27B dengan kuantisasi lebih rendah | Gemma 4 26B-A4B, Qwen3.6 27B pada Q4 |
| 24 GB | 27B hingga 35B pada Q4 hingga Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B hingga 35B pada kuantisasi lebih tinggi | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Model padat besar pada kuantisasi lebih rendah | Model kelas 70B pada Q3 hingga Q4 |
| 80 GB | Model padat besar pada kuantisasi lebih tinggi | Model kelas 70B pada Q4 hingga Q6 |
Rentang ini untuk model yang bobotnya dapat muat di GPU. Model MoE besar berbeda: hanya sebagian parameternya yang aktif untuk setiap token, tetapi model tetap harus menyimpan seluruh set bobotnya. Model dengan total parameter 100B atau lebih karena itu tidak muat dalam anggaran VRAM sebesar 100B hanya karena memiliki parameter aktif yang lebih sedikit.
Model MoE
Model Mixture-of-Experts berisi beberapa kelompok parameter yang disebut experts. Hanya sebagian experts yang digunakan untuk setiap token, yang dapat membuat inferensi lebih efisien daripada model padat dengan jumlah parameter total yang sama.
Namun, experts yang tidak aktif tetap menjadi bagian dari model. Model MoE besar karena itu dapat membutuhkan memori jauh lebih banyak daripada yang disarankan oleh jumlah parameter aktifnya. Model yang sangat besar mungkin memerlukan beberapa GPU atau offloading ke RAM sistem.
Panjang konteks juga menggunakan VRAM
Bobot model hanyalah sebagian dari kebutuhan memori. KV cache tumbuh seiring konteks semakin panjang, sehingga menjalankan model yang sama pada konteks 64K dapat membutuhkan VRAM jauh lebih banyak daripada menjalankannya pada 4K.
- Konteks yang lebih panjang membutuhkan lebih banyak VRAM.
- Presisi KV-cache memengaruhi penggunaan memori.
- Ukuran batch dan pengguna bersamaan juga meningkatkan penggunaan memori.
- Sisakan sebagian VRAM untuk runtime alih-alih mengisi GPU sepenuhnya dengan bobot model.
Tips praktis
- Periksa ukuran aktual model terkuantisasi yang ingin Anda jalankan.
- Jangan gunakan ukuran file model sebagai kebutuhan VRAM yang tepat. Sisakan ruang untuk KV cache dan runtime.
- Jika model tidak muat sepenuhnya di VRAM, sebagian dapat dioffload ke RAM sistem, tetapi inferensi biasanya akan lebih lambat.
- Untuk beban kerja konteks panjang atau agentik, anggarkan lebih banyak VRAM daripada yang dibutuhkan bobot model saja.
- Beberapa GPU dapat membagi model ketika satu GPU tidak memiliki VRAM yang cukup.
Jalankan di DaDesktop
Anda tidak perlu membeli GPU untuk menjalankan LLM lokal. DaDesktop memberi Anda desktop cloud dengan VRAM yang Anda butuhkan, sehingga Anda dapat menjalankan model secara langsung tanpa memiliki perangkat kerasnya.
Pilih tingkat VRAM yang sesuai dengan model Anda, muat, dan mulai gunakan. Tanpa pengaturan, tanpa pembelian perangkat keras, tanpa masalah driver. Lihat GPU yang tersedia untuk pilihan yang ada.