Untitled
Jumaat, 17 Julai 2026, 12:16 pm
dalam post sebelum ni saya silap, patut la pelik mcm mana 27b model boleh run guna 16gb vram. puncanya dari docker compose file, saya configure utk auto build customized model dgn specific parameters guna Modelfile, tapi base model tu masih point ke gemma4:12b.
artinya saia pakai gemma4:12b saja utk semua model yg saya cuba sebelum ni 
dah fix, baru tau yg qwen3.6:27b makan 100% gpu vram & terpaksa offload ke system dram pada kadar 70% gpu 30% cpu dgn context length 64k. kat screenshot boleh tgk itulah entrypoint yg saya guna utk build custom model tu, skrg dah pakai env var yg betul