- TurboFieldfare (Phần 1): Chạy LLM 26B chỉ với 2GB RAM
Khám phá TurboFieldfare, engine streaming chuyên biệt giúp nạp expert Gemma 4 26B-A4B theo nhu cầu từ SSD trên Apple Silicon chỉ với ~2GB RAM.
2 minvi - Headroom — AIエージェントのためのトークン圧縮
HeadroomはAIエージェントの入力を60-95%(JSON)・15-20%(コード)圧縮。可逆的でコード変更不要。
4 minja - Headroom — AI代理的Token压缩工具
Headroom 将AI代理的输入压缩 60-95%(JSON)和 15-20%(代码)—— 可逆,零代码更改。
7 minzh - Headroom — Nén Token Cho AI Agent
Headroom nén dữ liệu AI agent từ 60-95% cho JSON và 15-20% cho coding agent — reversible, không cần thay đổi code.
5 minvi - Headroom — Token Compression for AI Agents
Headroom compresses AI agent inputs by 60-95% for JSON and 15-20% for coding agents — reversibly, with zero code changes.
4 minen - TensorRT-LLM — Thư viện Inference Hiệu Suất Cao Của NVIDIA
Thư viện mã nguồn mở của NVIDIA cho inference LLM và Visual Gen — kernel tùy chỉnh, lượng tử hóa FP8/FP4, speculative decoding. Hơn 40k token/s trên B200.
4 minvi - TensorRT-LLM — NVIDIA's Fastest LLM Inference
NVIDIA's open-source library for LLM and Visual Gen inference — custom kernels, FP8/FP4 quantization, speculative decoding. Over 40k tok/s on B200.
3 minen - TensorRT-LLM — NVIDIAの高性能LLM推論ライブラリ
LLMとVisual Genモデルの推論を最適化するNVIDIAのオープンソースライブラリ。カスタムカーネル、FP8/FP4量子化、投機的デコード。B200で40k tok/s超。
3 minja
Back