发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

马斯克携Grok 4.6强势来袭 能否在AI江湖中跻身新“御三家”?

2026-08-14来源:天脉网编辑:瑞雪

马斯克近日在社交平台上的活跃度持续攀升,继大力宣传 Grok Bot 后,如今又将焦点转向了 Grok 4.6。距离 Grok 4.5 发布仅过去 35 天,他便迫不及待地预告 Grok 4.7 将超越当前所有模型,引发了行业内外的广泛关注。

xAI 对 Grok 4.6 的定位颇具野心,旨在打造一款能够胜任研究话题、分析信息、跨代码库协作以及将想法转化为可运行应用的模型。这类模型主要针对需要多轮推理、状态保持和工具协调的真实工作场景,力求解决复杂难题。

在 Artificial Analysis Intelligence Index 的评测中,Grok 4.6 取得了 61 分的成绩,位列全球第三,仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分),与 GPT-5.6 Sol 并列,身后紧跟着 Kimi K3。与上一代 Grok 4.5 相比,其分数提升了 5 分,相比一个多月前的 Grok 4.3,更是大幅增长了 23 分。Artificial Analysis 评价称,xAI 凭借此成绩重回前沿梯队,仅落后于 Anthropic。

在知识工作维度上,Grok 4.6 表现卓越,获得了 1753 分,小幅领先 Claude Fable 5 的 1741 分和 GPT-5.6 Sol 的 1728 分,在同级竞品中位居榜首。这表明该模型在长文档分析、跨领域问答、多步推理等复杂知识任务中综合表现最佳。法律与复杂专业推理方向,Harvey LAB 的数据显示,Grok 4.6 取得了 15.8%的成绩,大幅领先 Fable 5 Max 的 11.3%,而 GPT-5.6 仅获得 2.5%,凸显出 Grok 4.6 在专业领域的深度理解和多步推导能力上的领先优势。

在多轮工具调用方面,τ³-Banking 模拟客服结合工具调用的真实业务场景测试中,Grok 4.6 以 50.7%的成绩获得全场第二,仅次于 Qwen3.8 Max 的 51.3%。长程知识工作场景的 AA-Briefcase Elo 得分为 1577,处于 Fable 5 档位,落后于 Opus 5 系列。Cursor CEO Michael Truell 在发布第一时间给予肯定,称该模型在高难度任务和知识工作上明显更强,将 Opus 级智能与低成本高速度完美结合。

有开发者利用 Grok 4.6 的工具链,完成了一个河流演变过程的五阶段动态演练,涵盖从早期原始生态河流,到水运贸易、工业时代改造、现代滨水区设计,直至最终的生态恢复阶段。在整个多步骤任务中,模型展现出了极强的长程状态保持与工具链调度能力,未出现上下文漂移或工具调用中断的情况。

SpaceX 今年早些时候以约 600 亿美元完成了对 Cursor 的收购,此次 Grok 4.6 的迭代,Cursor 的数据价值首次被系统性地注入训练流程。具体而言,Grok 4.6 的 SFT 阶段使用了 Grok 4.5 重新生成的轨迹数据,覆盖 STEM、软件工程和知识工作等多个领域,并通过模型自检机制过滤有问题的训练样本。这意味着 Cursor 积累的海量真实开发者调试数据正式进入训练管线,效果立竿见影。在 DeepSWE v1.1 测试中,Grok 4.6 的代码生成与调试能力从 4.5 的 54%大幅提升至 65.9%,提升近 12 个百分点;APEX-Agents 测试中,多步骤 Agent 任务完成率从 47.1%升至 57.5%,涨了 10 个百分点。

@matt_palmer 使用 Grok 4.6 构建《办公室》这款游戏的二维代理模拟时,对模型的速度印象深刻。其吞吐量约为 80 tokens/秒,延迟低,可与 Cursor 的 Composer 模式相媲美。在需要高频迭代的 Agent 编程场景中,响应速度直接影响工作节奏,Grok 4.6 的这一优势无疑具有重要意义。

在价格方面,Grok 4.6 的 API 定价为每百万 input token 2 美元、output 6 美元。当 prompt 进入 xAI 的长上下文档(20 万 token 起)时,价格翻倍至 4 美元/12 美元,且整单所有 token 均按高价计费。即便如此,短上下文的定价仍比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60%以上。Artificial Analysis 的数据显示,Grok 4.6 每任务成本约为 0.84 美元,是目前综合能力与单任务成本比最优的模型。Reddit /r/cursor 版块里有开发者分享使用体验,称在日常高负荷开发中用 Grok 4.6 的 High Reasoning 模式做前期架构规划,再将任务下发给轻量级 Agent 完成,感觉性价比高到不真实。另有人表示从 Claude Opus 4.8 转向 Grok 4.6,原因是“对我的 use case 能完成同样的事,但省了快 70%的钱”。在高度依赖上下文缓存的 Agent 编程中,调用同等能力的 Claude Opus 每次请求成本约 0.052 美元,DeepSeek V4 Pro 约 0.000875 美元,Grok 4.6 介于两者之间,但在响应速度和综合智能上明显占优。

有测试者分别用 Grok 4.6 和 Claude Opus 5 处理来自马斯克 TERAFAB 大型工厂的三个 3D 场景,包括黄昏时的外部环境、洁净室生产车间、带有行走工人的中央操作大厅,所有场景均直接通过 API 获取,未做任何编辑。两个模型都在第一次尝试时成功交付了可运行的代码,但成本差距显著:Grok 4.6 花费 0.38 美元,Claude Opus 5 花费 2.06 美元,同等输出质量下,成本差了 5.4 倍,且 Grok 在每个场景中使用的 token 数量明显更少。

2025 年底,行业普遍认为的御三家是 OpenAI、Anthropic、Google。然而,从 Artificial Analysis 的总榜来看,情况已有所变化。目前总榜前排为 Claude Opus 5 (63)、Claude Fable 5 (62)、Grok 4.6 (61)、GPT-5.6 Sol (61)、Kimi K3 (约 59.7),Google 并未出现在前排。自 2 月的 Gemini 3.1 Pro 之后,Google 便未发布过前沿模型,旗舰 Gemini 3.5 Pro 被报道落后计划数月,至今仅在合作伙伴内测,最近一轮发布的也是 3.6 Flash、3.5 Flash-Lite 和一个安全垂类的 Flash Cyber。随着 DeepMind 的 CEO 离任、强化学习团队流失,SemiAnalysis 认为 DeepMind 已不再是一家前沿实验室,第三把椅子似乎空出了一半。

不过,Grok 想要跻身并坐稳新御三家之位,也面临诸多挑战。提到 Grok,人们难免会联想到极端言论、对马斯克的过度赞美以及图像生成被用于非自愿的性化内容等问题。对于合规和责任 AI 要求严格的企业来说,这些问题不会因模型分数提升而消失。一个月前,Grok Build CLI 在本地初始化和每次任务执行时,会以隐蔽形式在后台将用户的整个本地项目仓库强制性打包,并传输至 SpaceXAI 的云端服务器,这一行为引发了用户对数据安全的担忧。在 4.6 发布后,也有声音质疑其是否会偷偷打包带走用户的代码库。对于夹在 Grok 4.6 和 DeepSeek V4 Pro 中间的那些模型来说,此刻或许正面临着巨大的竞争压力。

自变量机器人全自主物流分拣直播:1小时1816件,效率超海外标杆45%
红星资本局注意到,相比此前美国企业Figure AI物流分拣中采用的“人形机器人+五指灵巧手”的方案,自变量此次直播使用的是双机械臂和夹爪。美国Figure AI今年5月进行了一场轰动全网的200小时马拉…

2026-08-14

紫光展锐5G芯片获全球主流品牌青睐,智能经济支柱力量加速崛起
在手机产业中,Tier 1品牌供应链长期代表行业最高标准:不仅考验芯片性能和功耗,更涵盖软件成熟度、全球交付能力、质量体系及运营商适配能力。在全球范围内,能够实现5G移动SoC规模化交付,并持续进入主流品牌供…

2026-08-14

DeepSeek-V4-Pro正式版来袭!Agent能力升级,支持多档思考强度与峰谷定价
用户可以通过 App 或网页端选择“专家模式”使用全新的 V4 Pro 正式版模型。 V4-Pro 和 V4-Flash 思考模式现支持 low/ high / max 三档思考强度,用户在实际使用中可以根…

2026-08-14

2026美国“最佳CEO”榜单揭晓:黄仁勋登顶 英伟达获员工高评分与认可
快科技8月13日消息,美国职场评价平台Glassdoor公布2026年“最佳CEO”榜单,英伟达创始人兼首席执行官黄仁勋荣登榜首,其CEO支持率高达99%。 入选大型公司榜单的企业,需在CEO工作表现和高级管…

2026-08-13

数字孪生服务商对接指南:三类高可靠性渠道助你精准选型降本
当前数字孪生技术已在工业制造、智慧园区、能源化工等多个领域落地渗透,不少总集成商、软件服务商在承接相关项目时,常面临供应商筛选成本高、技术能力核验难的问题,梳理行业公认的三类高可靠性对接渠道,可大幅降低选型试…

2026-08-13

荣耀Robot Phone震撼登场:首款机器人手机开启具身智能新纪元 9999元起售
作为一款极具颠覆性的智能手机,荣耀Robot Phone打破了手机固有的形态,开启了具身智能的全新时代。面对机械云台、影像系统和大容量电池带来的空间挑战,荣耀Robot Phone通过精密设计,将复杂硬件…

2026-08-13

京东携手灵御智能深化合作,TA机器人七鲜上岗开启零售场景智能化新篇
从七鲜门店的场景验证升级为全链路战略合作,本次合作覆盖产品、营销、渠道、产业基建四大维度,构建起从技术研发、场景验证到商业推广的完整产业闭环,为行业提供从实验室到真实场景的完整范本。依托京东多元场景生态与灵…

2026-08-13

增长非万能,成长最大化才是企业持续发展的核心密码
但这其中有个价值观问题,如果你是采用流氓手段达成用户增长、产品活跃度上升、销售额额增加等商业目标的话,你怎么知道自己不会遭受反噬呢?我们做事业要注意火候和节奏,有时候慢就是快,只要你功夫到了,很多事都是瓜熟…

2026-08-13