ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Bonsai-demo AMD ROCm/HIP部署实战:Strix Halo 128GB统一内存快速跑本地大模型指南

Bonsai-demo AMD ROCm/HIP部署实战:Strix Halo 128GB统一内存快速跑本地大模型指南 Bonsai-demo AMD ROCm/HIP部署实战Strix Halo 128GB统一内存快速跑本地大模型指南【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo本文介绍Bonsai-demo在 AMD ROCm/HIP 平台上的部署方法以 Strix Halo 128GB 统一内存机器为例演示如何用一条命令安装 Bonsai 1-bit 大模型并在 Radeon 8060S 上跑出最高5,000 tok/s的提示处理速度。适合想在自己电脑上免费、私有化运行本地大模型的新手。 Bonsai-demo 是什么Bonsai-demo 是一个本地大模型演示仓库让你在自己的设备上运行Bonsai1-bit和Ternary-Bonsai2-bit两个模型家族尺寸从 1.7B 到 27B 不等。它支持 MacMetal、Linux/WindowsCUDA、Vulkan、ROCm/HIP以及纯 CPU 推理其中 27B 模型还带视觉理解、工具调用和 256k 长上下文能力。上图直观展示了 Bonsai 系列的价值1.7B 的 Bonsai 模型只有不到 0.5 GB却能达到 Qwen3 数倍体量模型才能有的基准分数——这正是小机器跑大模型的关键。⚡ 为什么 Strix Halo ROCm 组合值得关注社区在 rocm-hip-strix-halo-128gb-archlinux.md 中提交了一份实测报告硬件配置为CPUAMD Ryzen AI Max 39524 核 Zen 5GPURadeon 8060SRDNA 3.5gfx115140 CU内存128 GB LPDDR5X 统一内存CPU 与 GPU 共享系统CachyOSArch Linux ROCm HIP 后端统一内存是这套方案的灵魂GPU 可以直接看见几乎全部 128 GB 内存因此 80B 的 MoE 模型Qwen3-Coder-Next能稳定跑51 tok/s108B 的 Llama-4-Scout 也能跑到21 tok/s——全程无需换页swap。这是普通独显机器很难做到的。 一键安装步骤最快部署方法得益于仓库内置的自动检测逻辑scripts/common.sh 会通过rocminfo/hipcc识别 ROCm 环境安装过程非常省心git clone https://gitcode.com/GitHub_Trending/bo/Bonsai-demo cd Bonsai-demo ./setup.shsetup.sh会自动检查并安装依赖 → 下载模型 →下载 Linux x64 ROCm 7.2 预编译二进制到bin/rocm/见 scripts/download_binaries.sh全程无需手动编译。完成后只需两条命令即可体验./scripts/run_llama.sh -p What is the capital of France? # 命令行单次问答 ./scripts/start_llama_server.sh # 启动 Web 聊天界面访问 http://localhost:8080启动脚本会自动检测 GPU 并把所有层卸载到 ROCm等效-ngl 99无需任何额外配置。 实测性能Strix Halo 128GB 基准成绩以下数据来自社区实测ROCm HIP 后端全层 GPU 卸载Q1_0 量化模型体积提示处理 PP512 (t/s)生成速度 TG128 (t/s)Bonsai-1.7B231 MB5,001231Bonsai-4B540 MB2,125126Bonsai-8B1.07 GB1,32596Qwen3-Coder-Next 80B-A3B17.6 GB66251Llama-4-Scout 108B27.2 GB32621几个值得注意的对比结论Vulkan 后端ROCm 在提示处理上全面领先8B 快 30%Vulkan 在逐 token 生成上更快——提示占主导的场景RAG、长上下文、Agent选 ROCm纯聊天流式输出可考虑 VulkanApple M4 ProROCm 提示处理速度是 M4 Pro 的 2.2–2.7 倍Bonsai 系列完整的对比表和可复现步骤都在 rocm-hip-strix-halo-128gb-archlinux.mdVulkan 对照组见 vulkan-strix-halo-128gb-archlinux.md全部硬件排行可查 community-benchmarks/README.md。⚙️ 实用调优技巧所有启动脚本都通过环境变量控制常用几个变量作用建议BONSAI_MODEL模型尺寸27B/8B/4B/1.7B默认 27B小模型更快BONSAI_FAMILY模型家族ternary/bonsai1-bit 家族在 ROCm 上有优化的 DP4A 内核BONSAI_NGLGPU 卸载层数0为纯 CPU集成显卡若解码偏慢可设 0 对比BONSAI_CTX上下文长度默认按内存自动分级128GB 机器无需担心默认即可两个针对 ROCm 的小知识图像识别不限流在 Metal/Vulkan/CPU 上单张图默认限制 1024 个视觉 token而ROCm 默认不设上限更适合 OCR 和截图理解详见 AGENTS.md。集成显卡要分情况Strix Halo 这类高性能 APU 确实受益于 GPU 卸载但弱集显机器上 ROCm 反而可能拖慢速度此时建议BONSAI_NGL0。全部 24 个变量参考 environment_variables.md。 进阶从源码编译 ROCm 版本如果你用的是非 x64 Linux 或需要特定 GPU 架构如 gfx1151 原生编译可按 README.md 中的 Linux (ROCm / AMD GPU) 章节手动构建核心就是用 CMake 打开GGML_HIPON开关指定 HIP 编译器后编译。社区实测中通过 TheRock 工具链为 gfx1151 原生编译还在升级 ROCm 7.13 后把所有 Bonsai 形状的提示处理速度又提升了 4%–21%细节同样记录在上述基准文件中。 参考资源项目总览与安装说明README.mdStrix Halo ROCm 基准实测含复现步骤community-benchmarks/bonsai/rocm-hip-strix-halo-128gb-archlinux.md社区基准排行榜与提交模板community-benchmarks/README.md硬件调优指南面向 AI Agent 与人类AGENTS.md全部环境变量说明environment_variables.md自动检测逻辑源码scripts/common.sh在 AMD Strix Halo 这类 128GB 统一内存机器上Bonsai-demo 的 ROCm/HIP 路径让你以纯本地、免费的方式获得接近服务器级的本地大模型体验——跑起来只需要一条./setup.sh。【免费下载链接】Bonsai-demoBonsai Demo项目地址: https://gitcode.com/GitHub_Trending/bo/Bonsai-demo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表