ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

英伟达 DGX Spark 64GB 版开卖:4999 美元,本地跑千亿参数模型

英伟达 DGX Spark 64GB 版开卖:4999 美元,本地跑千亿参数模型 英伟达在 10 月 2 日宣布DGX Spark 增加一个 64GB 统一内存的新配置10 月 23 日起通过 Acer、华硕、戴尔、技嘉、惠普、微星等主要合作伙伴发售起售价 4999 美元。官方口径是这一档配置单机可以在本地运行最高 1000 亿参数的模型。消息本身不复杂但里面有两个值得琢磨的数字新配置起售价 4999 美元而原先的 128GB 版本同期涨到了 6950 美元——要知道它 2025 年首发时是 3999 美元。一增一减之间本地跑大模型这件事的成本结构其实发生了变化。变了什么没变什么没变的是芯片和软件栈。64GB 版本保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整的 CUDA 加速 AI 软件栈和 128GB 版本是同一套东西。出厂就支持 NVIDIA Agent Toolkit、CUDA-X AI 库、Nemotron 开放模型以及 Ollama、vLLM、PyTorch with CUDA 等主流运行时官方称从开机到跑起模型只需要几分钟。变的是内存切分方式。关键参数是统一内存GPU 和 CPU 共用一块内存池不像普通台式机那样显存和内存泾渭分明。按英伟达的说法64GB 中约 8GB 被 DGX OS 占用空载上限实际更低剩下约 56GB 留给模型权重和 KV Cache。这 56GB 能装多少取决于量化精度。在 NVFP4约 4bit仅计权重下几个官方给的例子模型权重占用剩余可用于 KV CacheQwen3.8 27BDense约 16.5GB约 40GBGemma 4 26B-A4BMoE约 15GB约 41GBMoE 架构在这里有个天然优势虽然总参数量大但每次只激活一小部分专家权重和激活的性价比比同规模的 Dense 模型更好看。扩展方式也没变。每台 DGX Spark 内置 ConnectX-7 网卡两台机器用 QSFP 线缆直连可以把内存池化成 128GB模型支持上限提到 2000 亿参数内存带宽翻倍。英伟达的测试基于 vLLM 与 Qwen3.8-27B-NVFP4以单台 64GB 为基准单台 128GB 与之持平两台 64GB 组成的集群达到 1.7 倍。NVIDIA Sync 的 Cluster Assistant 最多能自动配置 4 台设备组网每个节点跑相同软件栈从单机扩到双机不用重配环境。对普通开发者和团队意味着什么先把一句话说清楚这是一台本地推理 轻量微调的开发机不是训练卡也不是高吞吐推理服务器。它真正解决的是这几个场景数据不想出本地。涉密数据、内网代码、合规要求高的行业模型跑在自己桌面上比把 prompt 发到云端 API 更让人放心。边缘 / 离线开发。断网环境、展会演示、保密项目里能本地起一个 agent 或推理服务。原型验证和微调。128GB 内存对跑量化后的中等规模开源模型做 LoRA 微调、做多步 agent 任务是够用的。不适合的场景也要讲清楚。它是统一内存架构带宽大约 273GB/s据报道明显低于同价位独立显卡的显存带宽。这意味着跑小模型还行一旦上到 70B 级别的 Dense 模型token 生成速度会明显掉下来不太适合做面向大量用户的推理服务。想要高并发吞吐还是得看数据中心的 GPU 或者直接租云。几个容易踩的坑最高 1000 亿参数是有前提的。这是在 NVFP4 量化、且 KV Cache 不爆的前提下。模型越大、上下文越长KV Cache 占用越高实际可用规模要打折扣。64GB 和 128GB 要按需选别只看价格。单机低配更便宜但如果你打算跑更大的模型或更长的上下文直接上 128GB 或者两台 64GB 组网更实际——双机的配置和功耗开销也要算进去。涨价不是偶然。128GB 版本从 3999 涨到 6950 美元官方给的理由是内存缺货。存储和内存颗粒价格这半年的走势做硬件的都懂买之前多对比渠道报价别只看首发价。收尾从云端 API 一把梭到桌面上放一台小超算本地大模型这条路这两年确实越走越宽。但对大多数人来说问题不是要不要买而是我到底有没有本地跑的需求。如果只是偶尔调个 API 写写代码一台 5000 美元的盒子大概率是吃灰的。你会考虑给团队配一台本地推理机吗还是继续用云 API你怎么看评论区聊聊。
返回列表