发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

谷歌发布“最精准”语音转文本模型,加速语音交互,重塑AI交互新格局

2026-08-27来源:快讯编辑:瑞雪

谷歌近日推出了一款被其称为“迄今最精准”的语音转文本模型——Gemini 3.5 Transcribe,并同步将其整合至旗下多款核心产品中,同时通过Gemini API向开发者开放预览功能。这一动作标志着谷歌在语音交互领域的战略布局进一步深化,试图通过技术升级重塑用户与AI系统的交互方式。

该模型的核心优势在于其“意图理解”能力。与传统语音转文本工具仅能逐字记录不同,Gemini 3.5 Transcribe可自动过滤“um”“uh”等口语化填充词,并智能添加标点符号、调整文本格式,将非结构化的口述内容直接转化为结构化文本。例如,用户无需手动修正,即可获得一段排版整齐、逻辑清晰的会议记录或备忘录。

在产品落地层面,谷歌已将该模型嵌入Android版Gboard的Rambler语音输入功能,以及Mac版Gemini应用中。用户可通过语音直接完成消息回复、帖子撰写等操作。更值得关注的是,谷歌计划将其引入Chrome浏览器,未来用户可在网页文本输入框内直接通过语音输入内容,覆盖从日常聊天到向Gemini发出指令的多元场景。

开发者生态方面,Gemini 3.5 Transcribe已通过Gemini API进入预览阶段,支持实时语音流与录制音频文件两种处理模式。这意味着开发者可基于该模型开发语音助手、会议记录工具等应用,进一步拓展语音交互的应用边界。

从商业逻辑看,语音转文本正从后台基础能力升级为AI应用的核心交互入口。随着模型具备“听懂—理解—整理—执行”的全链路能力,用户与AI的交互方式有望从键盘输入向语音指令转移。对谷歌而言,将Gemini 3.5 Transcribe嵌入Chrome、Gboard、Docs等高频产品,不仅可提升用户粘性,更能在语音交互这一新兴赛道巩固其技术领先地位。

此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental共同构成谷歌新的Gemini Audio系列,标志着其语音战略从文本、图像向实时对话、语音翻译等场景的全面延伸。尽管谷歌股价在发布当日盘中下跌1.37%,但市场普遍认为,语音交互的普及趋势将为谷歌带来长期增长空间。

从商用展示到赛场竞技,“爱湫”助力成都高新区具身智能产业腾飞
从世界机器人大会面向客商展示商用产品、做服务接待,到人形机器人运动会的高强度实战检验,“爱湫”的连续亮相,是成都高新区具身智能产业发展的一个缩影。 作为国家新一代人工智能创新发展试验区、国家人工智能创新应用…

2026-08-27

高通高管畅谈6G与AI融合前景,数据中心四大布局引领未来趋势
6G网络将成为AI网络,计算任务将无处不在,这也是高通一直在用的“计算连续体”概念,即计算从终端一直延伸到数据中心。马德嘉告诉智东西,AI原生网络是建立在高性能计算处理器之上的,包括CPU和AI加速器,这意味…

2026-08-27

阿里发布Qwen3.8-Flash模型:开源新架构雏形,成本大降性能跃升
模型采用了与此前千问大模型不同的全新架构:在注意力方面,引入独特的QSA(Qwen SparseAttention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tok…

2026-08-27