TurboFieldfare 是一款革命性的开源推理引擎,能够仅使用 约 2GB 的系统内存 (RAM) 在 Apple Silicon Mac 上运行 Gemma 4 26B-A4B 大语言模型。
本系列文章全面解析了其底层的架构设计、性能优化机制以及实际部署指南。
专栏系列导航#
1. TurboFieldfare (第1部分): 2GB RAM运行26B LLM#
- 分析本地运行大模型时的内存瓶颈与挑战。
- 剖析 Gemma 4 26B-A4B 的 Mixture-of-Experts (MoE) 架构。
- 解密核心机制:内存常驻 Shared Core (~1.35GB) + 按需从 NVMe SSD 流式传输 Expert 模块。
2. TurboFieldfare (第2部分): Swift与Metal的运行时优化#
- 深入基于 Swift 6.2 和 Metal Compute Shaders 的自研 Custom Engine。
- 讲解维护热点 Expert 的 LFU (Least Frequently Used) 缓存策略。
- 剖析降低 SSD 磁盘读取延迟的 Chunked Prefill 预填充与量化压缩技术。
3. TurboFieldfare (第3部分): CLI、Mac App与OpenAI服务#
- macOS 26+ 与 Xcode 26 环境下的项目编译与部署流程。
- 演示 CLI 命令行工具、SwiftUI 原生应用及 OpenAI 兼容 API 服务器的使用。
- 汇总 Apple M2 Air 与 M5 Pro 芯片的真实推理性能基准测试。
[!TIP] 欢迎访问官方 GitHub 仓库查看完整源代码与 100+ 项性能实验记录: drumih/turbo-fieldfare ↗。
参考资料#
- 官方 GitHub 仓库: drumih/turbo-fieldfare ↗
- MoE 架构与 Apple Silicon 高速 I/O 参数流式传输技术文档.