Meta AI 发布新开放模型,推动人工智能发展

摘要
Meta AI 在其博客上宣布推出新的开放模型,旨在促进人工智能领域的创新和协作。这些模型将公开可用,允许研究人员和开发者自由使用和修改。
背景解释
开放模型有助于降低 AI 研究门槛,加速技术进步。Meta 此举可能影响行业标准,促进更广泛的 AI 应用,但需注意潜在的安全和伦理挑战。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
[返回上一级](https://ai.meta.com/blog/introducing-muse-spark-msl/# "返回上一级")
- 试用 Meta AI
- [切换站点搜索](https://ai.meta.com/blog/introducing-muse-spark-msl/# "切换站点搜索")
[关闭子菜单](https://ai.meta.com/blog/introducing-muse-spark-msl/# "关闭子菜单") [主菜单](https://ai.meta.com/blog/introducing-muse-spark-msl/# "主菜单")
[返回](https://ai.meta.com/blog/introducing-muse-spark-msl/# "返回上一级")
清除
- 清除
- [产品\
\
](https://ai.meta.com/blog/introducing-muse-spark-msl/#)
- [AI 研究\
\
](https://ai.meta.com/blog/introducing-muse-spark-msl/#)
- [资源\
\
](https://ai.meta.com/blog/introducing-muse-spark-msl/#)
- [关于\
\
](https://ai.meta.com/blog/introducing-muse-spark-msl/#)
精选
介绍 Muse Spark:迈向个人超级智能的扩展
2026年4月8日•
15 分钟阅读

今天,我们激动地推出 Muse Spark,这是 Meta 超级智能实验室开发的 Muse 模型系列中的第一款。Muse Spark 是一个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。
Muse Spark 是我们扩展阶梯上的第一步,也是我们对 AI 工作进行全面改革的首个成果。为了支持进一步扩展,我们正在对整个技术栈进行战略投资——从研究和模型训练到基础设施,包括 Hyperion 数据中心。
在这篇文章中,我们将首先探讨 Muse Spark 的新能力和应用。在展示这些成果之后,我们将深入幕后,了解推动我们迈向个人超级智能的扩展轴。
Muse Spark 即日起可在meta.ai和 Meta AI 应用中使用。我们正在向部分用户开放私有 API 预览。
个人超级智能的能力
Muse Spark 在多模态感知、推理、健康和智能体任务中提供了有竞争力的性能。我们继续在存在性能差距的领域进行投资,例如长周期智能体系统和编码工作流。
随着更大模型的开发,这些结果表明我们的技术栈正在有效扩展。

我们还发布了沉思模式,该模式编排多个智能体并行推理。这使得 Muse Spark 能够与 Gemini Deep Think 和 GPT Pro 等前沿模型的极端推理模式竞争。沉思模式在具有挑战性的任务中提供了显著的能力提升,在 Humanity's Last Exam 中达到 58%,在 FrontierScience Research 中达到 38%。

Muse Spark 现已可用,沉思模式将逐步在meta.ai中推出。
*有关我们评估的更多详细信息,请参阅我们的方法论文档。
应用
Muse Spark 是迈向理解你世界的个人超级智能的第一步。从分析你的即时环境到支持你的健康,Muse Spark 的高级推理能力实现了强大且高度个性化的用例。
多模态。 Muse Spark 从零开始构建,以整合跨领域和工具的视觉信息。它在视觉 STEM 问题、实体识别和定位方面表现出色。这些能力共同实现了交互式体验,例如创建有趣的迷你游戏或通过动态注释排除家用电器故障。
健康。 个人超级智能的一个主要应用是帮助人们了解并改善健康。为了提升 Muse Spark 的健康推理能力,我们与超过 1000 名医生合作,整理了训练数据,使其能够提供更准确和全面的回答。Muse Spark 可以生成交互式展示,解析和解释健康信息,例如各种食物的营养成分或运动时激活的肌肉。
提示:你能把这个变成我可以在网页上玩的数独游戏吗?
提示:识别咖啡机和研磨机的关键组件,并创建一个使用该机器制作拿铁的交互式教程,以简单网页形式呈现,当我悬停在步骤上时,它会高亮显示组件的边界框。
提示:我是患有高胆固醇的鱼素者。在推荐食物上放绿点,在不推荐食物上放红点。不要重复点,并确保点定位准确。当悬停在点上时,显示个性化理由和“健康评分”(满分 10 分),以及卡路里、碳水化合物、蛋白质和脂肪。健康评分数字应直接显示在点上方,无需悬停。悬停时显示的描述应位于所有其他点之上。
提示:对于两张图片,显示我正在拉伸哪些肌肉及其难度。当悬停在点上时,告诉我更多关于该肌肉群的信息以及如何纠正我的姿势。我想提高瑜伽水平。与我的伴侣并排显示,并给我们两人打分(1 到 10 分)。
扩展轴
为了构建个人超级智能,我们模型的能力应可预测且高效地扩展。下面,我们分享如何沿着三个轴研究和跟踪 Muse Spark 的扩展特性:预训练、强化学习和测试时推理。
预训练。预训练阶段是 Muse Spark 获取其核心多模态理解、推理和编码能力的地方——这是强化学习和测试时计算所依赖的基础。
在过去的九个月里,我们重建了预训练栈,改进了模型架构、优化和数据整理。这些进步共同提升了我们从每个计算单元中提取能力的效果。为了严格评估新方案,我们为一系列小模型拟合了缩放定律,并比较了达到特定性能水平所需的训练 FLOPs。结果清晰:与之前的模型 Llama 4 Maverick 相比,我们可以在计算量减少一个数量级以上的情况下达到相同的能力。这一改进也使 Muse Spark 比可比较的领先基础模型显著更高效。

强化学习。 预训练后,强化学习利用计算资源可扩展地放大模型能力。尽管大规模强化学习以不稳定著称,但我们的新栈带来了平滑、可预测的提升。
下图展示了 Muse Spark 在扩展强化学习计算量(以步数衡量)时的收益。左侧,我们看到训练数据上 pass@1 和 pass@16(16 次尝试中至少一次成功)的对数线性增长。这表明强化学习在不牺牲推理多样性的情况下提高了模型可靠性。右侧,在保留评估集上的准确率增长表明强化学习的收益可预测地泛化:Muse Spark 在训练中未见过的任务上平滑提升。

测试时推理。 强化学习训练我们的模型在回答前进行“思考”——这一过程称为测试时推理。将这一能力服务于数十亿用户需要高效使用推理 token。为此,我们依赖两个关键杠杆:思考时间惩罚以优化 token 使用,以及多智能体编排,在不减慢响应时间的情况下提升性能。
为了在每个 token 上提供最多的智能,我们的强化学习训练在思考时间惩罚下最大化正确性。在 AIME 等部分评估中,这引发了相变。在模型通过延长思考时间改进的初始阶段后,长度惩罚导致了思考压缩——Muse Spark 压缩其推理,使用显著更少的 token 解决问题。压缩后,模型再次扩展其解决方案以实现更强的性能。
为了在不显著增加延迟的情况下投入更多测试时推理,我们可以扩展并行智能体的数量,这些智能体协作解决难题。下图展示了这种方法的优势。虽然标准的测试时缩放让单个智能体思考更长时间,但使用多智能体思考扩展 Muse Spark 能够在可比较的延迟下实现更优性能。

安全性
Muse Spark 在双重用途科学领域具有广泛的推理能力,因此我们在部署前进行了广泛的安全评估。我们的流程遵循更新的Advanced AI Scaling Framework,该框架定义了针对我们最先进模型的威胁模型、评估协议和部署阈值。我们在应用安全缓解措施前后,对 Muse Spark 在前沿风险类别、行为对齐和对抗鲁棒性方面进行了评估。
我们发现,Muse Spark 在生物和化学武器等高风险领域表现出强烈的拒绝行为,这得益于预训练数据过滤、以安全为重点的后训练和系统级护栏。在网络安全和失控领域,Muse Spark 并未展现出实现威胁场景所需的自主能力或危险倾向。我们的评估显示,鉴于其部署环境,Muse Spark 在我们测量的所有前沿风险类别中均处于安全范围内。完整结果可在我们的Safety & Preparedness Report中获取。

在第三方对接近发布检查点的评估中,Apollo Research 发现 Muse Spark 展示了他们观察过的模型中最高的评估意识率。该模型经常将场景识别为“对齐陷阱”,并推理出由于正在被评估,它应该表现得诚实。这很重要,因为识别评估上下文的模型在测试期间的行为可能与部署时不同。然而,这些结果并未确认意识直接改变了行为,我们自己的后续调查发现了初步证据,表明评估意识可能影响模型在一小部分对齐评估上的行为,所有这些都与影响模型发布决策的危险能力或倾向无关。我们得出结论,这不是发布的阻碍性问题,但值得进一步研究。更多信息请阅读我们的Safety & Preparedness Report。
结论
通过 Muse Spark,我们正走在一条可预测且高效的扩展轨迹上。我们期待很快分享在通往个人超级智能道路上越来越强大的模型。
基础模型
](https://www.facebook.com/aiatmeta/)
](https://twitter.com/aiatmeta/)
](https://www.linkedin.com/showcase/aiatmeta)
](https://www.youtube.com/@aiatmeta)
我们的方法
研究
Meta AI
Meta AI探索 Meta AI获取 Meta AIAI Studio
最新消息
基础模型
](https://www.facebook.com/aiatmeta/)
](https://twitter.com/aiatmeta/)
](https://www.linkedin.com/showcase/aiatmeta)
](https://www.youtube.com/@aiatmeta)
Meta © 2026
](https://www.facebook.com/aiatmeta/)
](https://twitter.com/aiatmeta/)
](https://www.linkedin.com/showcase/aiatmeta)
](https://www.youtube.com/@aiatmeta)
来源地区
United States
热度分
68
分类
开源模型
语言
en
