
【导语过去几年AI聚焦“训练更大的模型”到2026年风向转变。黄仁勋称这一年是“推理的拐点”推理正逼得整个硬件行业换打法需求爆炸促使巨头各寻出路多种技术路线并行发展。】推理成主角需求爆炸巨头忙布局到2026年AI的叙事风向改变推理突然成了主角。推理模型会一遍遍自我追问高推理强度下产出文本可达无推理时的20倍加上agentic AI推理不再局限于一问一答而是24小时自主干活。这导致需求爆炸巨头们纷纷寻找应对之法如OpenAI和Amazon用上Cerebras餐盘大小的Wafer - Scale芯片Nvidia花200亿美元买Groq的人才和IPAnthropic每月付超十亿美元租SpaceXAI闲置算力。训练推理性质异内存带宽成焦点训练和推理的计算性质差异很大。训练靠backpropagationGPU天生擅长推理分prefill和decode两段prefill并行度高GPU是强项但decode逐token生成要重读整个模型权重Nvidia H100跑开源LLM时有50%到80%的时间在等数据计算单元闲置。因此内存带宽成了这场革命的焦点。d - Matrix把计算die直接叠在DRAM上缩短数据搬运距离Majestic Labs用专有铜连接和memory - aggregator延长内存接口一个机架能挂128TB便宜DRAM而Nvidia的GB300 NVL72机架约有20TB HBM3E且两家都选用常见的DRAM因为HBM比普通DRAM贵两到三倍。大厂打组合拳软件侧精度优化同步行大厂采用“全都要”的组合拳。Nvidia让Rubin GPU负责prefill的注意力计算Groq 3 LPU靠500MB片内SRAM专攻decode其内存带宽是GPU的7倍256颗拼成Groq 3 LPX。AWS用Trainium负责prefill、Cerebras WSE - 3负责decode后者片上刻有44GB SRAM能装下40到800亿参数权重OpenAI用它跑GPT - 5.3 - Codex - Spark每秒吐1000多个token远超标准部署的50到125个。软件侧的比特精度优化也在同步进行。Nvidia造了4 - bit格式NVFP4AMD、Intel、Qualcomm抱团推MXFP4Nvidia称将DeepSeek - R1从FP8量化到NVFP4后七个主流基准分数下降不到1%性能提升3倍。Tensordyne用对数数制换乘法为加法声称1300 token/秒/用户、功耗不到可比Nvidia硬件的十分之一Etched把transformer结构烧进硅片跑Llama 70B能达每秒50万token但无法适应新架构。多条路线或并行推理硬件未来可期业内认为这不是单选题推理需求看不到尽头或许推理硬件会像CPU一样不是单轴升级而是多条技术路线同时开花。Moor Insights的Matt Kimball表示在组织里可以塞进一百万个agent它们一天工作24小时推理硬件发展前景广阔。编辑观点2026年推理成为AI领域的关键拐点硬件和软件层面都有诸多创新。多种技术路线并行发展有助于满足不同场景需求未来推理硬件有望在多领域开花结果推动AI产业进一步发展。