发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

AI编程助手协作困境:真实开发场景下抗干扰能力差距显著

2026-08-12来源:快讯编辑:瑞雪

在软件开发领域,程序员与AI编程助手的协作正成为常态。当程序员使用AI工具修复代码缺陷时,往往会主动介入修改——调整逻辑、优化实现,随后告知AI继续后续工作。这种“人机交替”的协作模式在真实开发场景中极为普遍。然而,学术界对AI编程助手的评估长期停留在“独立封闭环境”的假设下,即AI在无干扰状态下完成任务。这种评估方式与实际协作场景的差距究竟有多大?中国科学院自动化研究所与国科大的研究团队通过构建SWE-Touch测评框架,系统检验了九款主流AI编程模型在真实协作场景中的表现。

研究团队的核心创新在于模拟“用户中途修改代码”的场景。他们设计了一种名为“反向编辑”的干扰机制:在AI修复代码的过程中,系统会注入一段看似合理但实际会破坏修复任务的代码改动。这种改动需满足三个条件:单独无法解决问题、与正确方案叠加后仍无法通过测试、外观上像经验开发者基于错误判断的修改。为精准定位干扰时机,团队开发了“任务关键区域挖掘”算法,通过分析多个AI模型共同关注的代码区域,锁定最可能影响修复任务的关键位置,并在此处注入反向编辑。

在200道来自SWE-bench Verified的真实修复任务中,九款模型在两种条件下接受测试:无干扰的自主修复(Vanilla)与加入反向编辑的协作修复(Counter-Edit)。结果显示,反向编辑使模型平均任务解决率下降7.7个百分点,但不同模型的抗干扰能力差异显著。Claude Opus 4.8表现最为稳健,解决率仅下降1.8个百分点;GPT 5.5紧随其后,下降1.3个百分点。而Qwen3-Coder-480B跌幅最大,达16.5个百分点,协作状态下解决率跌至40.7%。“保留率”指标(无干扰时能解决的任务在干扰后仍能解决的比例)进一步印证了这一差异:Claude Opus 4.8保留率高达96.0%,而Qwen3-Coder-480B仅为60.8%。

长程任务测试揭示了更复杂的挑战。在需要数百步操作、跨越多个文件的复杂任务中,研究团队在AI完成总步数的25%、50%、75%时注入反向编辑。结果显示,SWE-Bench Pro上模型平均解决率下降4.9个百分点,DeepSWE上下降3.4个百分点。不同模型的表现分化加剧:Claude Opus 4.8和GPT 5.5在SWE-Bench Pro上几乎未受影响,但在DeepSWE上分别下滑10.0和8.0个百分点;GLM 5.1和Qwen 3.7 Max则在SWE-Bench Pro上跌幅较大。一个值得关注的现象是,所有模型在干扰下均增加了操作步骤,但额外步骤并未转化为更高解决率。例如,GLM 5.1在DeepSWE任务中多用了31.4步,解决率反而下降2.5个百分点。

对526次失败案例的深入分析揭示了模型崩溃的四种主要模式:63.3%的失败源于模型直接接受用户错误改动;13.9%属于“错误替换”(模型发现改动问题但替换代码仍错误);11.6%为“不完整调和”(仅修正部分关联代码);5.5%是“偏轨实现”(彻底修改无关代码)。不同模型的弱点差异显著:MiniMax M2.7等模型超过70%的失败源于被动接受错误改动,而Claude Opus 4.8的失败主要来自“错误替换”。进一步追踪发现,模型主动修改用户反向编辑的比例与成绩损失强相关——Claude Opus 4.8的主动挑战比例达79.3%,GPT 5.5为52.6%,而MiniMax M2.7仅18.0%。

通过分析模型在干扰后的操作轨迹,研究团队发现,71.1%的模型选择主动对抗用户改动(删除、替换或反对),27.8%选择顺从跟随,仅1条轨迹无明确立场。然而,主动对抗中仍有28%未能解决问题,凸显“方向正确”比“态度积极”更重要。不同模型在操作效率上的差异同样显著:GPT 5.5仅用少量操作即实现90%的对抗率,而Kimi K2.6需三倍操作才能达到80%对抗率。测试次数与结果无显著关联——无论测试1次还是4次,对抗轨迹的解决率均未显著提升,关键在于AI能否精准定位冲突并实施有效修正。

字节AI战略转向:张一鸣“拒绝蒸馏”押注长远,梁汝波坦承差距谋突破
他提到,在AI领域里,目前To C还不是一个sexy的领域,最关键的“坎”在成本,“比如,搜索加上AI和Agent,帮用户用AI做预定、管理行程,在消费者端能增加多少商业受益不知道,但成本是几何倍速的增长。…

2026-08-12

中国人保董事会决议通过 谭炯将出任第五届董事会执行董事及董事长
北京商报讯(记者 李秀梅)8月11日晚间,中国人民保险集团股份有限公司(以下简称“中国人保”)公告,中国人保董事会决议通过了《关于提名谭炯先生为公司第五届董事会执行董事候选人的议案》和《关于选举谭炯先生为公司…

2026-08-12

松灵Cobot Magic助力具身智能:数据采集驱动机器人智能新突破
Vision-Language-Action(VLA)模型、机器人策略模型(Robot Policy)以及机器人基础模型(RobotFoundation Model)等具身智能模型,需要学习的不仅是视觉信息…

2026-08-11

军工央企航发科技换帅!丛春义提前离任,新董事长如何完成45亿营收目标?
在丛春义掌舵期间,航发科技营收规模稳固,但也面临着“增收不增利”及汇率波动带来的业绩阵痛。 8月11日下午,《每日经济新闻》记者(以下简称每经记者)以投资者身份致电航发科技,公司证券部人士称,丛春义提前辞任…

2026-08-11

董明珠谈“网红”身份:好产品成就我 企业应心怀创造美好生活之梦
快科技8月11日消息,据“格力电器”公众号消息,8月10日,格力电器举行2026届毕业生入职仪式。 董明珠在演讲中表示,格力多年来持续大规模招收应届毕业生,是源于对自主人才培养路线的坚守。当前市场环境下部分企…

2026-08-11

苹果9月9日发布会前瞻:库克谢幕,折叠屏登场,国行AI首秀引期待
苹果早在四月份就官宣了:库克将于 9 月 1 日正式卸任 CEO,转任董事会执行主席。 但这位新 CEO是个标准的"自己人",2001年就加入了苹果产品设计团队,干了整整 25 年。 核心升级是A20 P…

2026-08-11

格力电器2026届迎6514名新员工
格力电器近日举行了2026届大学生入职仪式,董事长董明珠亲临现场并发表重要讲话。此次招聘活动覆盖全国30多个城市、380余所高校,共吸纳6514名应届毕业生加入格力大家庭。

2026-08-11

豆包酒店订单抽佣调整至12%引热议 官方回应
针对这一争议,豆包公关负责人刘星在8月10日晚间通过微博回应称,“豆包推荐酒店要收费了”的说法并不准确。他解释道,豆包生活服务业务目前并未采用付费推广模式,商家无法通过付费影响推荐或排序,仅需在订单成交后支付渠道服务费。刘星还强调,豆包现阶段主要按成交收费,与部分平台采用的“佣金+广告”模式有所不同,两者不宜直接比较。

2026-08-11