blog.dopana

Back

TurboFieldfare 是一款革命性的开源推理引擎,能够仅使用 约 2GB 的系统内存 (RAM) 在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 大语言模型。

本系列文章全面解析了其底层的架构设计、性能优化机制以及实际部署指南。

专栏系列导航#

1. TurboFieldfare (第1部分): 2GB RAM运行26B LLM#

  • 分析本地运行大模型时的内存瓶颈与挑战。
  • 剖析 Gemma 4 26B-A4B 的 Mixture-of-Experts (MoE) 架构。
  • 解密核心机制:内存常驻 Shared Core (~1.35GB) + 按需从 NVMe SSD 流式传输 Expert 模块。

2. TurboFieldfare (第2部分): Swift与Metal的运行时优化#

  • 深入基于 Swift 6.2 和 Metal Compute Shaders 的自研 Custom Engine。
  • 讲解维护热点 Expert 的 LFU (Least Frequently Used) 缓存策略。
  • 剖析降低 SSD 磁盘读取延迟的 Chunked Prefill 预填充与量化压缩技术。

3. TurboFieldfare (第3部分): CLI、Mac App与OpenAI服务#

  • macOS 26+ 与 Xcode 26 环境下的项目编译与部署流程。
  • 演示 CLI 命令行工具、SwiftUI 原生应用及 OpenAI 兼容 API 服务器的使用。
  • 汇总 Apple M2 Air 与 M5 Pro 芯片的真实推理性能基准测试。

[!TIP] 欢迎访问官方 GitHub 仓库查看完整源代码与 100+ 项性能实验记录: drumih/turbo-fieldfare

参考资料#