blog.dopana

Back

TurboFieldfare là một công nghệ đột phá cho phép vận hành các mô hình ngôn ngữ lớn (LLM) lớp Gemma 4 26B-A4B trên các thiết bị Apple Silicon Mac chỉ với khoảng 2GB RAM tiêu thụ.

Chuỗi bài viết này được thiết kế để cung cấp cái nhìn toàn diện từ lý thuyết kiến trúc, giải pháp tối ưu hóa hiệu năng, đến hướng dẫn thực hành triển khai thực tế.

Danh Sách Các Bài Viết Trong Chuỗi#

1. TurboFieldfare (Phần 1): Run 26B LLM trong 2GB RAM#

  • Nguồn gốc bài toán và rào cản bộ nhớ RAM khi chạy LLM cục bộ.
  • Bản chất kiến trúc Mixture-of-Experts (MoE) của Gemma 4 26B-A4B.
  • Giải pháp cốt lõi: Giữ Shared Core (~1.35GB) và KV Cache trong RAM, stream các Expert linh hoạt từ ổ đĩa SSD NVMe.

2. TurboFieldfare (Phần 2): Swift & Metal Runtime Optimization#

  • Phân tích mã nguồn custom runtime viết hoàn toàn bằng Swift 6.2 và Metal Compute Shaders.
  • Thuật toán bộ nhớ đệm LFU (Least Frequently Used) duy trì các Hot Expert.
  • Kỹ thuật Chunked Prefill và định dạng lượng tử hóa giảm độ trễ truy xuất đĩa SSD.

3. TurboFieldfare (Phần 3): CLI, App Mac & OpenAI Server#

  • Hướng dẫn biên dịch dự án và các điều kiện phần cứng cần thiết trên macOS 26+.
  • Sử dụng giao diện dòng lệnh (CLI Mode), ứng dụng SwiftUI native và OpenAI-compatible API Server.
  • Bảng so sánh kết quả benchmark giữa chip M2 Air (5-6 tok/s) và M5 Pro (30+ tok/s).

[!TIP] Bạn có thể xem toàn bộ mã nguồn và báo cáo thử nghiệm chi tiết tại repository chính thức: drumih/turbo-fieldfare.

Tài liệu tham khảo#

  • Mã nguồn chính thức: drumih/turbo-fieldfare
  • Chuỗi bài viết phân tích kỹ thuật kiến trúc MoE & Apple Silicon SSD Streaming.