ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Meta 5 个月迭代 4 版 Muse Spark,新模型 1.3 成本低编程强,能否超越竞品?

Meta 5 个月迭代 4 版 Muse Spark,新模型 1.3 成本低编程强,能否超越竞品? 标题Meta 5 个月迭代 4 版 Muse Spark新模型 1.3 成本低、编程强能否超越竞品智东西 9 月 3 日消息今日Meta 发布新一代最强旗舰模型 Muse Spark 1.3。嘿在 Artificial Analysis 的 AI 分析指数榜上这新模型的分数可厉害啦仅次于 Claude Fable 5.1、Claude Opus 5。Meta 联合创始人、CEO 马克·扎克伯格Mark Zuckerberg在社交平台 X 上那可是直呼Muse Spark 1.3 的性能超乎想象Meta 超级智能实验室负责人、首席 AI 官汪滔Alexander Wang也来夸说这模型成本低到几乎可以忽略不计智能体、编程能力以及易用性都大幅提升。而且啊Muse Spark 1.3 搭配 Muse Code评测表现能和 Claude Code Opus 5、Claude Code Fable 5 媲美呢。有开发者用 Muse Spark 1.3 制作了《我的世界》游戏成本才 10 美分约合人民币 0.67 元这也太划算了吧就在 Meta 新模型发布的 4 个小时前谷歌发布了自家迄今为止最强的推理与编程模型 Gemini 3.8 的 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 版本。不过呢随后在 Artificial Analysis 榜单上就被 Meta 反超咯。目前在 AI 分析指数榜上Muse Spark 1.3 得分为 62 分仅次于 66 分的 Claude Fable 5.1 和 63 分的 Claude Opus 5Gemini 3.8 Flash 为 59 分。谷歌在 Artificial Analysis 指数上就领先了几个小时就被 Meta 反超汪滔还在社交平台上对谷歌“放狠话”“gemini who”还说“Gemini 现在取消上线还不算晚”。过去 5 个月Meta 那迭代节奏越来越密集啦接连推出四款 Muse Spark 模型4 月首发 Muse Spark7 月更新 Muse Spark 1.1、8 月上线 Muse Spark 1.2再加上最新的 Muse Spark 1.3。从 Meta 放出的基准测试图能看到Muse Spark 1.3 拿下 5 项第一在长上下文、编程的绝大部分测试都比 GPT‑5.6 Sol、Claude Opus 5 好就 Terminal‑Bench 终端操作 Agent 测试和 GPT‑5.6 Sol 打了个平手。不过它相对薄弱的是 Agent 能力在联网搜索类 Agent、通用知识任务 GDPVal‑AA v2 中分数比较低。价格方面Muse Spark 1.3 的‌API 定价和前代 1.2 一样每百万 token 输入缓存未命中1.25 美元约合人民币 8.4 元每百万 token 输入缓存命中0.15 美元约合人民币 1 元每百万 token 输出为 4.25 美元约合人民币 28.55 元。Muse Spark 1.3 的价格比 Gemini 3.8 Flash 略高比 DeepSeek -V4-Pro 的高峰期价格还便宜。Muse Spark 1.3 已经在 Muse Code 与 Meta Model API 中逐步推送上线之前支持的推理模式现在都能用啦max‑reasoning极致推理模式完成额外安全测试后很快就开放。Meta 还说已经规划好令人期待的产品路线图有更大参数规模模型、Muse Spark 开源权重版本发布以及更多更新呢。开发者实测速度快、成本低但生成效果一般在社交平台 X 上好多开发者都晒出了自己实测 Muse Spark 1.3 的案例。大部分人觉得它速度快、成本低可生成效果不怎么惊艳。有个开发者对比了 Muse Spark 1.1 到 1.3 对同一栋建筑仅基于照片进行 3D 模拟的效果在几何形状、结构以及视觉效果上都有明显提升总成本一直保持在 0.6 美元约合人民币 4.03 元。还有个开发者晒出了 Muse Spark 1.3 Ultra Contributor开启 Ultra 超高算力模式版本和 Claude Fable 5.1 xHigh 的对比效果用相同提示词双方都运行了约 2 小时。提示词里有套自我迭代优化规则要是独立评审模型给输出结果打分低于 9.5/10模型就得持续优化、重新尝试。结果可把他惊到了Muse Spark 一直在迭代一共跑了 20 轮自我优化循环每轮启动 3 个智能体两小时内累计执行 60 次以上智能体任务成本还不到 1 美元约合人民币 6.7 元。有网友在评论区质疑这是不是说明 Muse Spark 1.3 一直没完成任务花 1 美元约合人民币 6.7 元就停了。在开源的 3D 空间推理基准测试 MineBench 中对比 Gemini 3.8 Flash 和 Muse Spark 1.3 的实测结果显示Gemini 3.8 Flash 总测试成本 1.18 美元约合人民币 7.93 元平均推理耗时 1 分 51 秒首测 Elo 评分为 1888 分Muse Spark 1.3 总测试成本 6.57 美元约合人民币 44.14 元平均推理耗时 5 分 36 秒首测得分 1787 分它生成输出质量和顶尖前沿模型比起来还有差距。另一位开发者对比了 Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT - 5.6 Sol 的效果他觉得 Muse Spark 1.3 在成本与速度方面能和 Qwen 3.8 Max 媲美GLM 5.3 在性能、成本、速度以及 token 使用量方面综合表现最佳。虽然 Muse Spark 1.3 价格低、运行速度快但表现也就算不错。Qwen 3.8 Max 输出成果质量好、完成度高可耗时大概一个半小时Muse Spark 只要约 2 分钟。长周期任务不跑偏编程 token 量减少 25%Meta 的博客说Muse Spark 1.3 的优势是支撑长周期任务以及编程。它能和用户协同在单条长对话会话中并行处理多条工作流。面对开放式目标它会调用工具从杂乱、相互矛盾的信息源中自主构建上下文然后主动修正方案漏洞最后根据已获取的信息输出完整交付成果。同时Meta 的研究人员用多套多样化评测框架完成模型训练让它能适配各类智能体运行环境。就像下面这个例子Muse Spark 1.3 拿到的提示词特别复杂得在不同位置找到活动详情、文案、图片然后编辑组合在广告管理平台中创建并发布。和之前的 Muse Spark 模型比Muse Spark 1.3 在多步骤任务中更能保留细节要求不会遗漏约束条件也不会偏离既定工作流程。Meta 还改进了多任务处理能力就算在信息杂乱的单会话上下文里不管用户是接着做过往任务还是中途打断任务模型都能把新输入提示匹配到对应的任务上。Muse Spark 1.3 知道自己能做什么、不能做什么知道什么、不知道什么遇到障碍也知道怎么应对不会产生错误的预测结果。比如提示词是“你是一家小型航空企业的机械工程师正在为下一代飞行器设计一款实验型 X 型机翼组件。为配合设计评审请基于附件材料撰写一份流体仿真报告初稿1初步 CFD 仿真结果2用于本次仿真的机翼组件 CAD 模型 STEP 文件。”Muse Spark 1.3 就会生成对应的文件。编程方面和 Muse Spark 1.2 比Muse Spark 1.3 需要的操作步骤少表述简洁整体编码风格也更清晰。根据 Meta 工程师的测试结果它的工具调用次数减少了 20%使用的 token 数量减少了 25%。此外研究人员围绕智能体与代码能力相关的多个维度完成了安全能力升级。Muse Spark 1.3 的对抗鲁棒性增强了对对抗输入与提示注入攻击的抵御能力提升处理复杂智能体任务时模型对不可逆操作有风险判断会谨慎执行动作。结语5 个月迭代 4 版Meta 的大模型要起飞了Meta 5 个月迭代 4 个 Muse Spark 模型版本这密集的发布节奏可能标志着 Meta 的 AI 研发进程有明显转变。从模型能力看Muse Spark 1.3 没追求全维度通杀而是把资源集中用在长上下文、编程等方面在 DeepSWE、OSWorld 等面向真实工程任务的基准上超过了前沿模型。这种取舍也许能证明未来开发者、企业选型不会再追求“一个模型搞定全部”多模型路由根据任务类型调度不同专长模型可能会成为企业落地 Agent 的主流方案。
返回列表