在本地运行大型语言模型通常需要巨大的RAM资源。像 Gemma 4 26B-A4B 这样的模型,若将全部权重加载到内存中,需要16GB至32GB的内存。TurboFieldfare 利用 Mixture-of-Experts (MoE) 架构,仅需约 2GB RAM 即可运行260亿参数的模型。
内存受限情况下的运行挑战#
常规推理框架(如 llama.cpp 或 MLX)通常会将所有模型参数直接加载至RAM/VRAM中。对于8GB内存的Mac(如 M2 MacBook Air),运行超过7B的 LLM 往往面临严重的内存耗尽或磁盘交换滞后。
[!NOTE] Mixture-of-Experts (MoE) 架构在处理每个 Token 时,仅激活少数专门的“Expert”,无需 simultaneous 计算全部参数。
TurboFieldfare 核心运行机制#
TurboFieldfare 将模型划分为两个主要模块:
- Shared Core 与 KV Cache (~1.35 GB): 永久常驻在RAM中,负责核心基础计算与对话上下文维护。
- Dynamic Experts (SSD 按需流式传输): Expert 层保存在 Mac 高速 NVMe SSD 上,当路由指定时才即时流式读取到内存。
ExpertStreamer.swift
// 模拟 SSD 按需读取 Expert 的逻辑
func loadExpertOnDemand(expertId: Int) async throws -> MetalBuffer {
if let cached = cache.get(expertId) {
return cached
}
let buffer = try await ssdReader.readExpertChunk(id: expertId)
cache.insert(expertId, buffer)
return buffer
}swift[!TIP] 依靠 Apple Silicon 极其出色的 SSD 读写带宽,按需流式传输 Expert 能够在 M2 Air 上达到 5–6 tokens/s,在 M5 Pro 上达到 30+ tokens/s 的推理速度。
参考资料#
- 官方 GitHub 仓库: drumih/turbo-fieldfare ↗
- TurboFieldfare 社区性能实验与基准测试报告.