发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

谷歌Gemini 3.5 Transcribe语音转文本模型:提升速度,智能优化转录内容

2026-08-27来源:快讯编辑:瑞雪

谷歌近日悄然推出了一款名为Gemini 3.5 Transcribe的新型语音转文本AI模型,在语音输入领域引发关注。这款模型并非外界期待的Gemini 3.5 Pro,而是专注于优化语音转写体验的专项工具,能够自动过滤口语中的冗余表达,生成更符合书面语习惯的文本内容。

据技术文档显示,该模型已率先应用于Pixel 11手机Gboard键盘的"Rambler"功能,后续将逐步扩展至谷歌生态内的其他产品。相较于前代Chirp 3引擎,新模型在转写速度上提升约70%,实时语音场景的错误率从7.32%降至5.5%。虽然准确率提升幅度看似有限,但对于高频语音输入用户而言,错误率的降低意味着后期校对工作量显著减少。

模型的核心优势在于语义理解能力。当检测到用户使用"嗯""啊"等填充词时,系统会自动删除这些影响流畅度的表达;若用户中途修正错误表述,模型也能实时调整已生成的文本。更值得关注的是,用户可上传自定义词汇库,帮助系统准确识别专业术语或特定领域的特殊用语,这在医疗、法律等垂直领域具有重要应用价值。

目前该模型支持85种语言的转写,可处理包含最多3名说话者的预录音频。不过技术团队也指出,模型在"智能润色"过程中可能改变用户原始表述方式,这在需要精确还原原话的场景(如法庭记录、学术访谈)中可能存在适用性问题。从实际测试效果看,模型对短文本的优化表现良好,能有效清理前后矛盾的表达和口语化磕绊。

这项技术的推出,标志着语音输入正从单纯的"听写"向"智能整理"阶段进化。虽然完全信任AI的语义理解仍需时间,但其在提升输入效率方面的价值已得到初步验证。随着模型持续优化,未来可能重塑人们的文字输入方式。

AI赋能网络管理:智能网络自治之路能迈向何种新高度?
Roseboro表示,网络仍像一个将数据从A点传输到B点的公用设施,但借助AI,它变得"比以前更有响应力,因为它能接收比以前更多的信息"。电信行业组织TMForum制定了自治网络等级分类体系,从0级到5级,…

2026-08-27

智谱开源GLM-5.3-Flash多模态模型:320B参数性能超越前代,成本大幅降低
GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低长上下文服务成本;并采用流形约束超连接(Manifold-Con…

2026-08-27

最小最萌“小擎”登场!首经贸大一新生携它亮相世界机器人赛场
新京报记者从首都经济贸易大学获悉,它就是约65厘米高的“小擎”,本次赛事中,该校共派出两支学生队伍参赛,憨态可掬的小机器人火出了圈。他表示,对人形机器人这类需要反复试错的任务而言,两个月是相当紧张的周期,但“…

2026-08-27