跳至內容


AI 最強的推理引擎!


llama.cpp 的核心優勢在於輕量、高效、跨平台:無需 Python 環境、無需大型依賴庫,一個執行檔就能跑 LLM。



GGUF 量化是 llama.cpp 生態系的核心。選擇正確的量化精度,可在模型品質與記憶體使用量之間取得平衡

  • Q8_0:最高品質量化,幾乎無損,檔案較大(約 FP16 的 50%),建議 VRAM 充足時使用
  • Q5_K_M:高品質量化,品質接近 Q8,檔案更小,是品質/大小的最佳平衡點之一
  • Q4_K_M:最受歡迎的量化,記憶體需求小(7B 模型約 4.5GB),品質略降但整體仍可接受
  • Q3_K_M:積極量化,記憶體極省但品質下降明顯,適合 RAM 嚴重受限的情況
  • IQ4_XS:智慧量化(i-quant),在相同大小下提供更好品質,是新一代推薦選擇