DeepSeek Harness近日完成公测后首次重大版本更新,v0.1.0-rc.8版本正式上线。此次更新以多模态能力为核心突破,通过14项功能调整覆盖输入输出、子代理协作、终端交互等关键领域,标志着该开源框架向复杂任务处理迈出重要一步。
原生图片处理能力成为最大亮点。新版本允许用户直接在指令中嵌入图片,/goal、/plan等核心命令均支持图文混合输入。对于具备视觉能力的模型,框架可自动识别并传递图像数据;针对纯文本模型,系统则通过OCR文字识别、颜色统计分析、像素行扫描等技术,将图片转化为结构化信息供模型推理。这种"工具层视觉"方案虽无法完全替代原生多模态模型,但在处理流程图、界面截图等结构化图像时已展现出实用价值。
子代理体系迎来重要扩展。Claude Code与Codex正式纳入插件库,开发者可根据任务需求灵活安装配置。Codex子代理支持非交互权限模式及多实例并行,使得同一任务中可调用不同版本的代码生成工具。Windows终端体验显著优化,持久化PowerShell会话减少环境重建频率,极简模式预设中默认开启该功能。
开发团队同步修复了多项公测阶段暴露的问题。针对大尺寸图片或历史会话图片堆积导致的请求失败,新版本优化了内存管理机制;流式生成中断后的回复继承问题得到解决;自定义网关兼容性提升,确保OpenAI协议网关的稳定调用。新增web_search并发查询、子代理事件唤醒等实用功能,SQLite后端读写性能提升30%以上。
社区反响热烈,开发者迅速挖掘出新版本的潜力。有用户测试发现,当调用无视觉能力的模型处理图片时,系统会自动触发多阶段分析流程:先提取文字内容,再统计颜色分布,最后扫描关键像素区域。这种"曲线救国"的方式虽无法精准还原复杂图像,但为纯文本模型处理视觉任务提供了创新思路。GitHub仓库显示,更新发布后24小时内即收获超过200颗星标,讨论区涌现出数十个基于新功能的创意应用方案。
该框架的插件化设计理念持续深化。从模型适配到工具调用,从子代理管理到用户界面,所有组件均可通过插件机制动态扩展。此次更新后,原生多模态模型与工具层视觉方案形成互补,开发者既能调用视觉大模型直接处理图像,也可为文本模型配备OCR等辅助工具,构建符合特定需求的混合架构。这种灵活组合方式为复杂AI工作流的开发提供了新范式。
