- Lượng tử hóa MXFP4/MXFP8 — Chạy model lớn trên máy cá nhân
MXFP4/MXFP8 là chuẩn lượng tử hóa 4-bit mới cho LLM. Nhờ đó, model 120B tham số chạy trên một GPU 80GB, với llama.cpp và vLLM.
3 minvi - MXFP4/MXFP8量子化 — ローカルLLM実行の新常識
MXFP4/MXFP8はLLM向け新4ビット量子化標準。120Bパラメータモデルが1枚の80GB GPUで動作、llama.cpp/vLLMが対応。
3 minja - MXFP4/MXFP8 Quantization — Running LLMs Locally
MXFP4/MXFP8 is the new 4-bit quantization standard for LLMs. Enables 120B-param models on a single 80GB GPU via llama.cpp and vLLM.
3 minen
Back