- TensorRT-LLM — Thư viện Inference Hiệu Suất Cao Của NVIDIA
Thư viện mã nguồn mở của NVIDIA cho inference LLM và Visual Gen — kernel tùy chỉnh, lượng tử hóa FP8/FP4, speculative decoding. Hơn 40k token/s trên B200.
4 minvi - TensorRT-LLM — NVIDIA's Fastest LLM Inference
NVIDIA's open-source library for LLM and Visual Gen inference — custom kernels, FP8/FP4 quantization, speculative decoding. Over 40k tok/s on B200.
3 minen - TensorRT-LLM — NVIDIAの高性能LLM推論ライブラリ
LLMとVisual Genモデルの推論を最適化するNVIDIAのオープンソースライブラリ。カスタムカーネル、FP8/FP4量子化、投機的デコード。B200で40k tok/s超。
3 minja - TensorRT-LLM — NVIDIA 高性能大模型推理库
NVIDIA 开源的大模型与视觉生成推理库——自定义算子、FP8/FP4 量化、投机解码。B200 上超 4 万 token/s。
5 minzh - vLLM — High-Performance LLM Serving Engine
vLLM is the leading open-source LLM inference engine with PagedAttention, continuous batching, FP4 quantization — up to 24x faster than naive transformers.
2 minen - vLLM — 高性能LLM推論エンジン
vLLMはPagedAttention、continuous batching、FP4量子化を備えたオープンソースLLM推論エンジン。単純なtransformersと比べ最大24倍高速。
3 minja - vLLM — Serving Engine cho LLM hiệu suất cao
vLLM là open-source inference engine cho LLM với PagedAttention, continuous batching, FP4 quantization — nhanh hơn 24 lần so với naive transformers.
2 minvi
Back