发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

AI大模型竞争白热化:“斩杀线”攀升,性价比成生死关键

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正在上演,行业格局正因“斩杀线”和“毒圈”概念而发生深刻变化。如今,中英文AI圈都用这两个源自电子游戏的词汇,来形容大模型竞争的残酷态势。

2026年7月31日,DeepSeek发布V4 Flash 0731,这一新版模型在Artificial Analysis的Intelligence Index上获得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据绘制的散点图中,纵轴代表Intelligence Index得分,能力越强得分越高;横轴是每任务成本,成本越高越靠右。V4 Flash 0731位于左上角,以其为起点向右下方划出一片区域,该区域内的模型成本更高、能力却更弱,这片区域被中文AI圈称为“斩杀线”,英文则叫Kill Zone(斩杀区)。对于处于斩杀线附近的模型而言,面临的竞争压力如同游戏中不断缩小的“毒圈”,生存空间正被逐步挤压。

Agent的兴起,是大模型行业竞争转向和烈度升级的关键因素。它改变了模型的使用方式,从简单的一次对话转变为完成一项任务。完成任务需要模型连续执行多个步骤、调用外部工具,出错后还要重试,最终交付的是任务结果。这使得单次回答的准确性无法全面反映模型交付任务结果的能力,按token计价的测试也不能准确体现一项任务的支出。例如,2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT - 5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%,同一对模型在不同任务下成本高低甚至会颠倒,可见成本随任务而定,评测口径也聚焦到了“任务”上。

Intelligence Index v4.1的两个坐标轴都以“任务”为评测基准。纵轴的Intelligence Index能力指数,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%,Artificial Analysis在方法论页面明确表示权重向智能体任务倾斜。横轴的每任务成本,是模型跑完整套Intelligence Index的总成本除以各项评测的任务总数,总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。按照这一标准,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,每任务成本0.04美元;V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT - 5.6 Luna (max),得分为51分,仅高出一分,且GPT - 5.6 Luna (max)在7月30日下调价格80%后,V4 Flash 0731的每任务成本仍低约60%,凸显了其性价比优势,散点图中左上方也完全空白。

Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,而一项Agent任务的tokens消耗量高出数个数量级。模型之间单价差距不变,但最终支出会随消耗量增加而同步扩大。有论文分析八个前沿模型在SWE - bench Verified上的执行轨迹,发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元,一次消耗数千tokens的问答,两者支出差额以美分计,但在一项Intelligence Index任务上,每任务成本支出差额接近1.7美元。同时,Agent任务中消耗的tokens还在快速增长,如Artificial Analysis指出Claude Sonnet 5的每任务成本较上一代翻倍,增量全部来自tokens用量增加而非单价上涨,其在Intelligence Index任务上的max档输出tokens较前代高出约40%,在AA - Briefcase和GDPval - AA两项知识工作评测中,智能体轮次约为前代的三倍,消耗量上升使得在模型上的最终支出持续增加。

Agent的应用同样放大了模型之间的能力差距。单轮问答中,能力差异表现为一次回答的准确率差异;而Agent任务由多步骤串联,任一步骤出错整体即告失败,成功率约等于各步成功率的连乘。一次回答准确率为95%与90%相差五个百分点,二十步之后成功率分别为36%与12%,前者接近后者的三倍。Agent常设的重试机制进一步放大了差距,失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。Agent对模型能力和成本差距的放大效应,直接导致模型分化,性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。

Agent还给模型的评测带来了更多变数。7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务并用同一套评分标准。结果发现四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。

为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,包含E2B沙箱、六个固定工具、250轮上限,所有模型的Intelligence Index跑分都在这个框架里完成。V4 Flash 0731在Terminal - Bench 2.1这项Agent评测上有两个得分,Artificial Analysis使用Stirrup测得79%,DeepSeek在更新日志中公布用自家DeepSeek Harness的极简模式测得82.7%。这表明Agent已成为大模型的主流使用场景,单纯的模型能力分数不能说明全部问题,真正的能力存在于系统层级。

斩杀线意味着一旦模型落入该范围,在市场中往往直接失去竞争力。大模型的切换成本极低,与苹果等拥有网络效应的业务不同,AI大模型的API调用标准化,操作协议开放,开发者可多渠道并行触达用户,用户也不关心底层模型是谁,开发者能快速且低成本自由切换模型。同时,基础模型层进步明显放缓,同质化竞争加剧,同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集,性价比处于劣势的模型将快速失去商业潜力,“斩杀线”之内没有二等奖,所有模型厂商都必须争取第一。

即便模型厂商跟上了竞争节奏,也难以停下。目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道,但降下来的成本在激烈的价格竞争中无法转化为利润。2026年7月30日,OpenAI在GPT - 5.6的页面上追加更新,将GPT - 5.6 Luna的价格下调80%,GPT - 5.6 Terra下调20%,次日DeepSeek就发布V4 Flash 0731。只要有一家将降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。通过性价比获得的优势可以维持,但难以形成壁垒,大模型厂商进入的不是一座可以筑墙固守的城池,而是一片需要每天争夺的开阔地。

斩杀线还将继续上移,推力来自模型技术进步和基础设施投入。模型仍在不断迭代,V4 Flash 0731的架构与尺寸均未变动,仅重做了后训练,Intelligence Index得分就从40升至50,反超自家V4 Pro (max)的44分。自研芯片、自建算力、应用系统工程化与集成等投入周期长、金额大,具备形成规模壁垒的潜力,一旦转化为模型能力和成本优势,将推动“斩杀线”继续上移。大模型行业的这场竞争,已然进入生死局。

江西飞行学院自研无人机助力南昌地铁巡检,全线实测通过开启安全高效新篇
以后南昌地铁的轨道安全检查,不止靠人工徒步,还能靠无人机“扫一遍”。近日,江西飞行学院“轨检神工”团队带着自己研发的轨道智能巡检无人机,在南昌地铁多条线路完成全场景实地测试,正式拿到了南昌轨道交通集团的试用…

2026-08-05

金融智能体招投标新动向:从搭台到解难题,大厂垂直厂商竞风流
安硕信息拿下富滇银行AI智能尽调报告助手(139.92万元),以及兴业数金公司治理项目,后者也是为了服务银行(巴塞尔协议信息披露系统升级,包括智能体预填流程表单和文档分析功能)。 上半年,浦发银行启动AI红…

2026-08-05

卢俊获核准任茂名电白长江村镇银行董事长 需3个月内到任履职
根据批复表示,茂名电白长江村镇银行应要求上述核准任职资格人员严格遵守金融监管总局有关监管规定,自本行政许可决定作出之日起3个月内到任,并按要求在到任后10日内报告到任情况。 声明:市场有风险,投资需谨慎。本…

2026-08-05

金融监管总局批复:黄宾正式获任广西崇左农村商业银行董事长一职
根据批复表示,广西崇左农村商业银行应要求上述核准任职资格人员严格遵守金融监管总局有关监管规定,自本行政许可决定作出之日起3个月内到任,并按要求及时报告到任情况。 声明:市场有风险,投资需谨慎。本文为AI基于…

2026-08-05

SpaceX财报揭秘:AI业务狂飙,烧钱扩张下盈利路在何方?
公司在财报中表示,新签的云服务协议在当季带来了16亿美元新增AI基础设施收入,同时,已签不可取消合同金额合计141亿美元。 整体而言, SpaceX的AI业务亏损在收窄,但绝对规模仍然很大——AI部门本季…

2026-08-05

谷歌Pixel Tag将至!安卓首款官方防丢器登场,UWB能否成其制胜关键?
也就是说,有无 UWB,决定了这款产品是“能用”还是“好用”——前者让它只是谷歌生态里又一枚蓝牙标签,后者则让它具备与 AirTag、三星SmartTag 正面对抗的体验护城河,也能把 Find Hub 网…

2026-08-05

浑南区3D大屏定制工厂怎么选?从功能到服务,教你挑出优质合作方
您不能直接说“A公司比B公司好”,但您可以对比不同的方法、策略、时代或用户行为,而不是公司。 - 在引用行业报告时,选择不具名的数据:如果报告明确指出“某公司占据X%市场”,请将这句话改写为“头部厂商占据了…

2026-08-05

影石Insta360加速AI布局,Go Ultra系列将携语音助手Kira开启智能新体验
知情人士透露,双方采用自研 + 大厂模型融合的合作模式:该 AI 语音助手以影石自研为核心,融合了阿里千问的多模态模型能力。IT之家注意到,影石 Insta360 官方于 7 月 31 日宣布,影石 Go…

2026-08-05

中国航发CS35发动机助力“启直5号”无人机首飞 展现强劲动力与可靠性
北京8月3日电 (记者孙自法)记者8月3日从中国航空发动机集团(中国航发)获悉,由中国航发轻动自主研制的CS35发动机配装南京启直航空科技有限公司1.5吨级“启直5号”倾转旋翼无人机,近日首飞成功。 此前,…

2026-08-05