OpenAI与AI芯片厂商Cerebras联合宣布,旗下旗舰模型GPT-5.6 Sol正式推出全新服务层级“超高速模式”(Ultrafast Mode)。该模式通过突破传统GPU集群的内存带宽瓶颈,将模型输出速度提升至每秒750个token,较现有标准模式提升14倍,且不牺牲输出质量。这一突破使GPT-5.6 Sol在速度与智力综合评估中占据绝对优势,其加速后性能比竞争对手Fable 5快11倍,较Opus 4.8的快速模式提升5倍。
在Cerebras公布的测试数据中,GPT-5.6 Sol在“人类终极考试”(HLE)基准测试中展现惊人效率。这项包含2500道高难度问题的测试,通常需要化学、经济学等领域博士级知识才能解答。超高速模式下的模型仅用11小时11分钟完成全部作答,而同类模型Claude Fable 5耗时长达78小时27分钟。在准确率相近的前提下,GPT-5.6 Sol的解题速度达到竞争对手的7倍,相当于用一个工作日完成人类知识前沿领域的系统性突破。
技术实现层面,超高速模式依托Cerebras独特的晶圆级芯片架构。传统GPU受限于显存带宽,在运行大模型时需频繁在片外高带宽内存(HBM)与计算核心间传输模型权重,多卡并行还会产生跨芯片通信延迟。而Cerebras最新WSE-3芯片集成4万亿晶体管,提供125 petaflops算力与44GB片上高速SRAM,使模型参数可常驻于超高带宽内存中,彻底消除数据搬运等待时间。对于参数量远超单芯片容量的GPT-5.6 Sol,Cerebras通过“多晶圆流水线并行”技术,将模型网络层分布至多颗晶圆,实现token在晶圆间的无缝传输。
实际应用场景中,超高速模式正在重塑AI工作流程。在金融领域,模型可实时分析市场信号、评估交易风险并识别异常活动;在客户支持场景,能持续处理复杂问题而不中断对话;商务系统中可在消费者犹豫期间完成产品咨询、库存检查与个性化推荐。OpenAI内部测试显示,工程师借助该模式可在系统故障发生时,同步分析日志、代码变更与工程师报告,将事件响应时间从数小时压缩至分钟级。研究团队则利用其快速搜索知识库、整合多工具信息,将传统需要隔夜运行的实验迭代周期缩短至工作日内多次完成。
对于开发者社区,超高速模式意味着任务处理范式的转变。此前因速度限制需降级使用Luna、Terra等次级模型的任务,现在可直接运行旗舰模型;涉及多轮工具调用、代码排错或复杂推理的Agent任务,处理时间从数小时骤减至几分钟。这种效率提升正引发连锁反应——AI社区开始讨论Luna、Terra等模型是否会推出类似加速服务,而Cerebras的芯片产能能否支撑大规模商用需求,已成为行业关注的新焦点。

