发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

DeepSeek-V4-Flash正式版上线公测,多项表现逼近Opus 4.8引热议

2026-08-01来源:快讯编辑:瑞雪

DeepSeek-V4-Flash 正式版 API 近日开启公测,迅速引发科技圈热议。这款经过深度后训练的模型在多项基准测试中表现惊艳,甚至被网友评价为"以闪电之势改写大模型竞争格局"。根据官方披露的测试数据,新版本在终端操作、代码理解、网络安全等场景下的能力实现质的飞跃,部分指标已逼近行业标杆水平。

在专业评测中,该模型展现出令人瞩目的技术突破:Terminal Bench 2.1终端操作测试得分达82.7,代码仓库任务NL2Repo与DeepSWE分别取得54.2和54.4分,网络安全场景Cybergym测试获得76.7分。更值得关注的是,在综合智能体评测中,Agent Last Exam与Automation Bench Public分别取得25.2和25.1分,全栈开发基准DSBench-FullStack得分68.7,难度升级的DSBench-Hard测试也达到59.6分。这些数据表明,2840亿参数规模的Flash版本在保持成本优势的同时,性能已直逼4800亿参数的Opus 4.8模型。

价格策略成为市场关注的另一焦点。新版本API定价仅为Claude同类产品的1/90,这种"性能跃升+成本骤降"的组合拳,被业界视为对OpenAI近期调价策略的直接回应。有开发者在社交平台感慨:"上周还在为模型成本发愁,现在突然有了免费午餐的感觉。"这种技术突破与商业策略的双重冲击,直接推动相关话题登上知乎热搜榜首。

技术文档显示,此次升级重点强化了Agent能力与指令遵循能力。通过大量后训练优化,模型在复杂任务分解、工具调用等场景下的表现显著提升。原生支持的Responses API与Codex专项优化,使得开发者能够更便捷地构建智能应用。值得注意的是,本次更新仅涉及Flash版本API,Pro版本及终端应用将保持现有架构,这种差异化策略为不同需求用户提供了灵活选择。

社区反应呈现两极分化态势。技术派开发者对模型性能提升赞不绝口,有用户实测发现其在代码生成、自动化运维等场景的准确率提升超过40%。而商业观察者则更关注价格战可能引发的行业变局,某投资机构分析师指出:"当性能差距缩小到10%以内,价格优势将成为决定市场格局的关键因素。"这种技术迭代与商业竞争的交织,预示着大模型领域即将迎来新的洗牌期。

随着Flash版本完成重大升级,市场目光开始转向尚未露面的Pro版本。技术社区普遍猜测,既然基础版本已展现如此强劲的竞争力,专业版本很可能在多模态处理、长文本理解等维度带来更大惊喜。有匿名消息源透露,Pro版本正在进行最后阶段的稳定性测试,其参数规模与架构设计或将重新定义行业技术标准。

字节跳动Seedance 2.5发布:长叙事能力升级,支持30秒视频生成与多素材创作
字节跳动官方表示,Seedance 2.0 发布后,用户对视频创作模型的期待正在从“生成一个片段”走向“完成一段创作”。30 秒内容内可排布多条逻辑连贯镜头,完整搭建起包含铺垫、情节推进、剧情转折与收尾的完…

2026-08-01

豆包专业版升级接入Seedance2.5:单次生成30秒连贯视频 商用创作门槛再降低
之前多数AI视频工具单次只能生成十几秒短片,想要做一段完整广告、剧情片段,就得反复生成多段素材,再手动剪辑拼接,很容易出现人物变形、画面色调脱节、镜头衔接生硬等问题。 这款模型支持一次性上传图片、短视频、音…

2026-08-01

国产AI安全智能体Sangfor AI崭露头角 全球排名前四领跑国内
CyberGym是目前全球含金量较高的代码安全大模型实战靶场,区别于传统静态理论测试,整套评测体系完全贴合工业真实场景,以海量开源软件历史高危漏洞为考题,重点考核AI智能体自主源码分析、多阶段漏洞推演、漏洞…

2026-08-01

一加16配置亮点抢先看:2nm骁龙平台加持,游戏性能再升级
PChome 7月31日消息,博主“数码闲聊站”发文透露,一加16将在性能和游戏体验方面继续加码。新机除了可能搭载采用2nm工艺的骁龙8Elite 6 Pro平台,还将独家配备新一代风驰游戏内核、极速高刷屏…

2026-08-01

GFC15D矿用本安型超声波风速传感器:精准测风速 多样通信易调校
GFC15D矿用本安型超声波风速传感器具备三大核心功能。风速精准测量功能,量程覆盖0~15m/s,分辨率高达0.01m/s,基本误差为±0.1m/s,能够精确捕捉井下风速的细微变化,为通风系统调节提供可靠数据…

2026-08-01

中国电信星辰TokenHub引入Kimi K3大模型 以智能服务推动AI普惠化发展
一是多模型聚合与智能路由:已接入中国电信自研“星辰”大模型,以及DeepSeek、Qwen、GLM、MiniMax等百余款主流模型,调用时按模型效率、Token消耗、场景匹配度自动选优,让“合适的模型服务合适…

2026-08-01