Untitled

Ahad, 19 Julai 2026, 1:42 am

Ini baru betul llm 26b run kat 16gb vram.

hjg minggu ni belajar quantization llm. llm ni model bahasa yg berasaskan kebarangkalian ia meneka satu perkataan ke perkataan seterusnya. kebarangkalian utk setiap perkataan sudah tentu disimpan dlm bentuk nombor perpuluhan, atau floating point numbers. kadar kejituan tempat perpuluhan ini berdasarkan jumlah bit.

standard llm disimpan pada kejituan 16-32 bit. utk model dgn 26b parameter, standard kejituan 16-bit, adalah bersaiz kira2 24-26gb, dan apabila di-run guna ollama ia mengambil juga dlm 24-26gb vram, itu belum masuk lagi vram yg diperlukan utk at least 64k context length supaya dpt pakai dgn hermes agent.

satu cara utk kurangkan penggunaan vram ni adalah dgn mengurangkan kejituan kepada 8 atau 4 bit. teknik ‘compression’ llm ini adalah lossy, bermaksud ada kehilangan ketepatan data berlaku. contoh, kebarangkalian asal adalah 3.152739567392, bila di-quantize kpd 4 bit, hanya tinggal 3.15 saja. itu yg menyebabkan model yg dah heavily quantized ni lebih berhalusinasi.

saya ambil model qwen 3.6 27b dlm format huggingface, lepas tu convert ke gguf supaya ollama dpt baca. lepas tu run quantization q4_k_m, q4 tu maksudnya 4 bit, dgn 64k context length. dpt run dgn 82% gpu 18% cpu, tapi response dia slow, tak dpt nak tunggu dkt 2-3 minit utk soalan ringkas yg perlukan jwpn pendek.

dlm screenshot saya pilih gemma 4 26b dgn quantization q3_k_m dan 64k context length, dpt run 100% kat gpu, dan response time sedikit baik drpd qwen sblm ni. tapi masih tak dpt lwn laju response model 12-14b parameter. cuma saya nak tgk kualiti jwpn, adakah dia lebih faham soalan, lebih rajin buat research & lebih tepat buat kesimpulan.

Untitled

19 Julai 2026

Untitled

17 Julai 2026

Komentar (0):

Tulis komen: