- vLLM — 高性能LLM推論エンジン
vLLMはPagedAttention、continuous batching、FP4量子化を備えたオープンソースLLM推論エンジン。単純なtransformersと比べ最大24倍高速。
3 minja - vLLM — Serving Engine cho LLM hiệu suất cao
vLLM là open-source inference engine cho LLM với PagedAttention, continuous batching, FP4 quantization — nhanh hơn 24 lần so với naive transformers.
2 minvi - Trình Điều Khiển Cho AI — CUDA Và Hạ Tầng Phần Mềm
GPU driver, CUDA, cuDNN, TensorRT — tìm hiểu hạ tầng driver giúp AI chạy được trên phần cứng hiện đại.
5 minvi
Back