发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

Meta旗舰模型Muse Spark 1.3发布,成本低性能强,谷歌Gemini被反超

2026-09-04来源:快讯编辑:瑞雪

meta近日推出新一代旗舰AI模型Muse Spark 1.3,在Artificial Analysis的AI分析指数榜上以62分位列第三,仅次于Claude Fable 5.1(66分)和Claude Opus 5(63分),成功超越谷歌同日发布的Gemini 3.8 Flash(59分)。这款模型凭借低成本、高效率的特性,迅速成为开发者关注的焦点。

meta首席AI官汪滔在社交平台高调宣称,Muse Spark 1.3的智能体能力、编程效率及易用性实现质的飞跃,其成本低至"几乎可以忽略不计"。配合Muse Code工具使用时,该模型在代码生成任务中的表现已与Claude Code + Opus 5、Claude Code + Fable 5等组合不相上下。开发者实测显示,用Muse Spark 1.3开发《我的世界》游戏模组成本仅需10美分(约0.67元人民币),印证了其极致性价比优势。

性能对比数据显示,Muse Spark 1.3在5项基准测试中登顶,编程与长文本处理能力显著优于GPT-5.6 Sol和Claude Opus 5,仅在终端操作Agent测试中与GPT-5.6 Sol持平。不过该模型在联网搜索类Agent和通用知识任务GDPVal-AA v2中表现较弱,暴露出多模态理解能力的短板。价格方面,其API定价与前代持平,输入成本每百万token最低0.15美元(约1元人民币),输出成本4.25美元(约28.55元人民币),虽略高于Gemini 3.8 Flash,但仍低于DeepSeek-V4-Pro高峰期定价。

开发者社区的实测反馈呈现两极分化。部分用户称赞其迭代优化能力惊人:某测试中模型在2小时内完成20轮自我修正,执行60次智能体任务,总成本不足1美元。但开源基准测试MineBench显示,Muse Spark 1.3的首测Elo评分(1787分)低于Gemini 3.8 Flash(1888分),且平均推理耗时是其3倍。横向对比中,Qwen 3.8 Max虽在输出质量上更胜一筹,但耗时长达90分钟,远超Muse Spark 1.3的2分钟处理速度。

meta着重强化了模型的长周期任务处理能力。Muse Spark 1.3可并行管理多条工作流,在开放式目标场景下自主筛选有效信息、修复方案漏洞。例如在广告管理任务中,该模型能准确提取不同位置的活动详情、文案和图片,完成跨平台内容发布。编程效率提升方面,与1.2版本相比,新模型工具调用次数减少20%,token使用量降低25%,代码风格更趋简洁清晰。

安全性能升级是本次迭代的另一重点。研究人员通过多维优化增强了模型的对抗鲁棒性,使其能有效抵御提示注入攻击。在处理复杂智能体任务时,模型可识别不可逆操作风险并采取审慎策略。目前Muse Spark 1.3已通过基础安全测试,极致推理模式(max-reasoning)待完成额外验证后将向用户开放。meta透露,后续计划推出更大参数版本及开源权重模型,持续完善产品矩阵。

具身智能新赛道:数据与架构双驱动,机器人“大脑”修炼进行时
举个例子,在零售场景中,让机器人按顺序抓取货架上的矿泉水,先通过百亿级别的合成仿真数据完成预训练,然后只需一个人一天的真机数据,即可完成微调,合成数据的边际成本趋近于零,这种成本结构对中小型具身智能企业非常…

2026-09-04

郎朗携手启元机器人,国产消费级人形机器人开启大众消费新征程
依托本次跨界热度,启元机器人正式登陆天猫、抖音等主流电商平台开启官方直播销售,旗下启元Q1、启元T1两款个人机器人全面面向大众消费者预售。凭借高精度运动控制技术与自然流畅的人机交互能力,启元Q1可实现肢体互…

2026-09-04

人工智能赋能科研新变革:驱动全链条融合 塑造未来创新生态
同时,企业凭借数据、算力、资本等优势,从科研的需求与应用方逐渐转变为科研活动的主要参与者,在某些领域甚至成为主导者,推动科学研究与应用场景融合发展;智能工具、支撑平台和开源社区也将成为新型技术参与主体,丰富科…

2026-09-04

奥尔特曼官宣:OpenAI进军人形机器人领域,AI硬件布局同步推进
【CNMO科技消息】当地时间9月2日,OpenAI CEO萨姆·奥尔特曼(SamAltman)在最新播客中首次明确表态,公司将会自研人形机器人本体。 据CNMO科技了解,今年6月,奥尔特曼便已在社交平台发布…

2026-09-03