blog.dopana

Back

Chạy các mô hình ngôn ngữ lớn (LLM) ở môi trường local thường đòi hỏi dung lượng RAM rất lớn. Với những mô hình như Gemma 4 26B-A4B, việc nạp toàn bộ trọng số (weights) vào bộ nhớ hệ thống có thể tốn từ 16GB đến 32GB RAM. TurboFieldfare giải quyết triệt để rào cản này bằng cách tận dụng kiến trúc Mixture-of-Experts (MoE) để thực thi mô hình 26 tỷ tham số mà chỉ sử dụng khoảng 2GB RAM.

Nút thắt nghẽn RAM của các LLM dung lượng lớn#

Các framework inference phổ biến như llama.cpp hay MLX thường nạp toàn bộ tham số mô hình vào RAM hệ thống hoặc VRAM. Trên các dòng máy Mac có 8GB bộ nhớ hợp nhất (như M2 MacBook Air), việc chạy các mô hình lớn hơn 7B tham số thường dẫn đến tình trạng cạn kiệt bộ nhớ hoặc gặp hiện tượng tráo đổi dữ liệu đĩa (disk swap) gây giật lag nghiêm trọng.

[!NOTE] Kiến trúc Mixture-of-Experts (MoE) chỉ kích hoạt một vài expert được chỉ định cho mỗi token đầu ra thay vì phải tính toán và đánh giá toàn bộ tham số cùng một lúc.

Cơ chế Streaming của TurboFieldfare hoạt động như thế nào?#

TurboFieldfare chia mô hình thành hai thành phần chính:

  1. Shared Core & KV Cache (~1.35 GB): Được giữ cố định trong RAM để xử lý các phép tính cốt lõi và duy trì trạng thái ngữ cảnh cuộc trò chuyện.
  2. Dynamic Experts (SSD On-Demand Streaming): Các lớp expert được lưu trữ trực tiếp trên ổ cứng NVMe SSD tốc độ cao và chỉ được stream (nạp) vào bộ nhớ ngay tại thời điểm các lớp routing yêu cầu.
ExpertStreamer.swift
// Mô phỏng khái niệm nạp expert từ SSD theo nhu cầu (on-demand)
func loadExpertOnDemand(expertId: Int) async throws -> MetalBuffer {
    if let cached = cache.get(expertId) {
        return cached
    }
    let buffer = try await ssdReader.readExpertChunk(id: expertId)
    cache.insert(expertId, buffer)
    return buffer
}
swift

[!TIP] Tận dụng tốc độ đọc cực nhanh của ổ cứng NVMe trên Apple Silicon, việc stream các khối tham số theo nhu cầu giúp đạt tốc độ sinh dữ liệu từ 5–6 token/giây trên chip M2 Air và hơn 30 token/giây trên chip M5 Pro.

Tài liệu tham khảo#

  • Repository chính thức: drumih/turbo-fieldfare
  • Các điểm số benchmark và kỷ lục hiệu năng của cộng đồng TurboFieldfare.