- TensorRT-LLM — Thư viện Inference Hiệu Suất Cao Của NVIDIA
Thư viện mã nguồn mở của NVIDIA cho inference LLM và Visual Gen — kernel tùy chỉnh, lượng tử hóa FP8/FP4, speculative decoding. Hơn 40k token/s trên B200.
4 minvi - TensorRT-LLM — NVIDIA's Fastest LLM Inference
NVIDIA's open-source library for LLM and Visual Gen inference — custom kernels, FP8/FP4 quantization, speculative decoding. Over 40k tok/s on B200.
3 minen - TensorRT-LLM — NVIDIAの高性能LLM推論ライブラリ
LLMとVisual Genモデルの推論を最適化するNVIDIAのオープンソースライブラリ。カスタムカーネル、FP8/FP4量子化、投機的デコード。B200で40k tok/s超。
3 minja - TensorRT-LLM — NVIDIA 高性能大模型推理库
NVIDIA 开源的大模型与视觉生成推理库——自定义算子、FP8/FP4 量化、投机解码。B200 上超 4 万 token/s。
5 minzh - Trình Điều Khiển Cho AI — CUDA Và Hạ Tầng Phần Mềm
GPU driver, CUDA, cuDNN, TensorRT — tìm hiểu hạ tầng driver giúp AI chạy được trên phần cứng hiện đại.
5 minvi
Back