- TensorRT-LLM — NVIDIA 高性能大模型推理库
NVIDIA 开源的大模型与视觉生成推理库——自定义算子、FP8/FP4 量化、投机解码。B200 上超 4 万 token/s。
5 minzh - Lượng tử hóa MXFP4/MXFP8 — Chạy model lớn trên máy cá nhân
MXFP4/MXFP8 là chuẩn lượng tử hóa 4-bit mới cho LLM. Nhờ đó, model 120B tham số chạy trên một GPU 80GB, với llama.cpp và vLLM.
3 minvi - MXFP4/MXFP8量子化 — ローカルLLM実行の新常識
MXFP4/MXFP8はLLM向け新4ビット量子化標準。120Bパラメータモデルが1枚の80GB GPUで動作、llama.cpp/vLLMが対応。
3 minja - MXFP4/MXFP8 Quantization — Running LLMs Locally
MXFP4/MXFP8 is the new 4-bit quantization standard for LLMs. Enables 120B-param models on a single 80GB GPU via llama.cpp and vLLM.
3 minen - vLLM — High-Performance LLM Serving Engine
vLLM is the leading open-source LLM inference engine with PagedAttention, continuous batching, FP4 quantization — up to 24x faster than naive transformers.
2 minen - vLLM — 高性能LLM推論エンジン
vLLMはPagedAttention、continuous batching、FP4量子化を備えたオープンソースLLM推論エンジン。単純なtransformersと比べ最大24倍高速。
3 minja - vLLM — Serving Engine cho LLM hiệu suất cao
vLLM là open-source inference engine cho LLM với PagedAttention, continuous batching, FP4 quantization — nhanh hơn 24 lần so với naive transformers.
2 minvi - LLM Engineering — Prompt, RAG, Fine-tuning Cho AI App
Kỹ thuật xây dựng ứng dụng với LLM: prompt engineering, RAG, fine-tuning, evaluation và production deployment.
4 minvi
Back