ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

【大模型部署实战】turbo-fieldfare 中文版:2GB 内存跑 Gemma 4 26B 的 Mac 端推理上手指南

【大模型部署实战】turbo-fieldfare 中文版:2GB 内存跑 Gemma 4 26B 的 Mac 端推理上手指南 项目简介turbo-fieldfare 是一个 Swift Metal 写成的自定义推理运行时能在约 2GB 内存里跑 Gemma 4 26B-A4B 模型专为 Apple Silicon Mac 打造。Apache-2.0 许可GitHub 6483 star。指标值模型Gemma 4 26B-A4B260 亿参数每 token 激活 38.8 亿权重MLX 仿射 4-bit组大小 64内存约 2GB 权重 4K KV 缓存存储文本模型约 14.3GB硬件Apple Silicon Mac8GB 起步平台macOS 26、Metal 4、Swift 6.2环境要求Apple Silicon MacM 系列芯片macOS 26 或更高版本约 15GB 磁盘空间快速开始gitclone https://github.com/drumih/turbo-fieldfare.gitcdturbo-fieldfare swift build-crelease .build/release/TurboFieldfareMac首次运行 Swift Package Manager 会下载分词器依赖。构建完成后打开 Mac 应用选「下载」自动拉取并重新打包约 15GB 模型选「加载模型」输入提示词点「生成」。工作原理核心是 MoE 稀疏性的利用常驻核心1.35GB 共享权重 FP16 KV 缓存常驻内存流式专家每次生成 token只从 SSD 读入「路由命中的专家」用完释放4-bit 量化权重本身以 MLX 仿射 4-bit 存储路由 8-bit。因为 Gemma 4 26B-A4B 每个 token 只激活 38.8 亿参数总量 260 亿大部分参数在每一步是「睡着的」可以留在 SSD 里。实测解码速度机型内存解码速度M2 MacBook Air8 GB5.1 - 6.3 tok/sM5 Pro24 GB31 - 35 tok/s中文版我已将 README 完整中文化https://github.com/yangshun2005/turbo-fieldfare-cn中文版保留了快速开始、指标表、工作原理、基准测试、103 项实验记录等完整内容适合想系统了解「Mac 端大模型极限推理优化」的读者。如果这个项目对你有帮助也欢迎动动小手去原仓库点个 Star支持作者持续维护。
返回列表