谷歌发布号称“迄今最强”语音转文本模型
8 月 26 日,谷歌发布新一代语音转文本模型 Gemini 3.5 Transcribe,可以在转录过程中自动处理“嗯”“啊”等语气词、口误和重复表达,并补充标点、大小写及文本格式。
谷歌将其称为“迄今最精确的语音转文本模型”,谷歌 CEO Pichai 在 x 上宣布了该模型。

与只追求逐字记录的传统语音识别模型不同,Gemini 3.5 Transcribe 希望直接将原始语音转换为更接近成稿的文本,减少用户后续整理会议记录、采访速记和通话内容的工作量。
例如,当用户说“我们周二开会——不,改成周三”时,模型能够理解后半句是对前面内容的修正,并在最终文本中保留正确结果,而不是机械记录整段口误。

Gemini 3.5 Transcribe 支持 85 种以上语言和地区变体,并能够自动判断当前使用的语言。用户不需要提前设置语种,即使在一句话或者同一段对话中切换语言,模型也可以继续转录。
这项能力主要面向跨国会议、多语言访谈、客服通话以及同时夹杂中英文专业术语的场景。
在真实录音中,影响转录准确率的往往不只是口音,还包括背景噪声、多人同时发言和专业词汇。谷歌称,Gemini 3.5 Transcribe 针对嘈杂环境、不同口音和多语言对话进行了优化,并增强了对电话号码、邮政编码、订单号等字母与数字混合信息的识别能力。

Gemini 3.5 Transcribe 可处理实时语言切换和无缝流式转录
模型还支持自定义词表。开发者最多可以提供 1000 个专业词汇、缩写、人名或产品名称,引导模型优先识别这些内容。谷歌表示,在实际使用中,自定义词表控制在 100 个词以内通常效果更好。

使用 Gemini 3.5 转录功能,通过智能转录功能清除语音不流畅之处。
这对于技术采访可能更实用。例如,用户可以提前加入 Kubernetes、BigQuery 以及公司和产品名称,减少模型将专业名词识别成发音相近词语的情况。
Gemini 3.5 Transcribe 还提供“说话人分离”能力,可以识别最多 8 名说话人,并把不同语音片段分配给相应的说话人标签。不过,谷歌同时提醒,三名以上说话人的识别目前仍属于实验性能力。
对于预先录制的音频,模型还能输出逐词时间戳,标明每个词在录音中的起止时间,方便用户制作字幕、检索原始录音或者定位采访原话。启用说话人分离或逐词时间戳后,单次录音长度上限为 30 分钟;普通音频转录则支持单次最长 1 小时。
3.5 转录功能提供多说话人归属和单词级时间戳的转录。
流式转录词错误率 4.0%
根据谷歌引用的 Artificial Analysis 测评数据,Gemini 3.5 Transcribe 在实时流式场景中的平均词错误率为 4.0%,非流式录音处理的平均词错误率为 2.6%。
词错误率通常用于衡量语音识别结果中替换、删除和新增词语所占的比例,数值越低,意味着转录结果越接近原始语音。不过,不同测试集的语言、噪声和口音分布会影响最终成绩,这组数据不能直接代表模型在所有录音条件下的准确率。

与谷歌上一代语音转录模型 Chirp 3 相比,Gemini 3.5 Transcribe 的最终转录延迟缩短了 70%。实时版本可以通过 WebSocket 持续接收语音,并以低于一秒的延迟返回阶段性转录结果。
谷歌此次提供两个版本:`gemini-3.5-transcribe-live`面向实时字幕、语音输入和 Voice Agent;`gemini-3.5-transcribe`则用于处理采访录音、会议、通话记录等预录制音频,支持说话人分离和逐词时间戳。
开发者目前可以通过 Google AI Studio 中的 Gemini API,以及 Gemini Enterprise Agent Platform 调用该模型。实时转录的综合价格约为每分钟 0.009 美元,非实时转录约为每分钟 0.005 美元,同时提供免费测试额度。
语音转录开始从“听写”走向“整理”
Gemini 3.5 Transcribe 最值得关注的地方,并不只是词错误率进一步下降,而是语音转录工具正在改变输出目标。
过去的自动语音识别主要追求忠实记录:说话人讲了什么,系统就尽量逐字写下什么。但真实口语中充满语气词、重复、停顿、临时改口和不完整句子,即使识别完全准确,输出结果往往仍然无法直接阅读。
Gemini 3.5 Transcribe 加入的 Smart Transcription,会主动清理语气词和重复内容,根据上下文处理自我修正,并把口语转成带有标点和结构的文本。它还支持“逆文本规范化”,例如将英文口述的“twenty six million dollars”直接转换为“$26M”。
这意味着,模型给出的不再只是原始速记,而是一份经过初步整理的文本。
不过,这种“智能整理”也带来了新的风险。对会议纪要和日常语音输入而言,删除语气词通常不会影响信息;但在新闻采访、法律取证和需要逐字核对的场景中,自动删除重复表达或改写数字,可能改变说话人的原始措辞。
为此,Gemini 3.5 Transcribe 同时提供 Verbatim 模式,允许开发者获得更接近逐字记录的文本。实际使用时,是否启用语气词清理和智能格式化,应当根据场景决定,而不能简单地把“更整洁”视为“更准确”。
目前,这项技术也开始进入谷歌自己的产品。Android 版 Gboard 的 Rambler 功能可以将口述内容转换为格式化文本,并允许用户通过语音继续修改措辞和风格;在 macOS 版 Gemini 应用中,模型还可以结合屏幕上下文识别文件名和当前文档,并通过语音指令调用其他 Gemini 模型完成文件总结、文本改写和图片生成。
从这个角度看,Gemini 3.5 Transcribe 并不只是一款新的听写模型。谷歌正在把语音转录变成 AI 操作系统的入口:用户不必先把语言整理成标准指令,而是可以直接带着停顿、口误和临时修改说出需求,再由模型理解真正意图并继续执行任务。
谷歌看不清形势?
在行业狂卷多模态、Coding Agent 的大环境中,表面上看,谷歌此时单独发布一款语音转文本模型,很容易给人一种“还在解决上一代问题”的感觉,所以在 x 上,有也用户评价谷歌“看不透形势”。
可以说,网络上不看好的声音巨多。



更尖锐的批评来自一名 Gemini Ultra 用户。
他表示,自己已经后悔升级,因为所谓的额外功能,只有在模型能力和产品迭代真正跟上行业进度时才有意义。他曾经希望谷歌能够赢下这场竞争,这份信心很大程度上来自 Demis Hassabis 及其领导下的 DeepMind。但随着 Demis 不再负责 DeepMind 的日常运营,他感觉“DeepMind 的灵魂已经离开了”。在他看来,失去鲜明的研究方向和领导者之后,谷歌面对的就只剩下一场赤裸的模型能力较量,而它目前正在这场竞争中落后。

Gemini 3.5 Transcribe 的发布进一步强化了这种失望:当同行都在强调更强的 Agent、端到端语音交互和复杂任务执行时,谷歌却把一款语音转文本模型推到台前,容易让付费用户产生一种产品节奏与行业焦点错位的感觉。需要指出的是,这更多反映了用户对谷歌整体 AI 进展和产品体验的不满,并不能单凭一款转录模型判断其技术路线已经落后。
那么,谷歌真如上述网友所言,已经到了很糟糕的境况了吗?
事实上, Gemini 3.5 Transcribe 的目标并不是重新发明听写工具,而是补齐语音 Agent 进入生产环境前最基础、也最容易被忽视的一层:让机器先稳定听懂人类。
在客服、会议、采访、医疗记录等场景中,背景噪声、多人说话、临时改口、中途切换语言以及订单号等复杂信息,仍会直接影响后续 Agent 执行。
自动去除“嗯、啊”、理解自我修正,并输出带格式的文本,实际上是在把语音从原始输入整理成更适合模型继续处理的结构化上下文。
因此,这款产品在叙事上不如端到端语音模型性感,笔者认为它未必落伍。
真正的问题在于,谷歌如果只把它作为一项孤立的转录服务,价值确实有限,只有将其嵌入 Gboard、Gemini、Chrome 和企业 Agent 工作流,让语音成为调用工具和执行任务的入口,它才可能体现战略意义。
参考链接:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
https://ai.google.dev/gemini-api/docs/pricing?hl=zh-cn
文章来自于微信公众号 “InfoQ”,作者 “InfoQ”
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】Whisper是由openai出品的语音转录大模型,它可以应用在会议记录,视频字幕生成,采访内容整理,语音笔记转文字等各种需要将声音转出文字等场景中。
项目地址:https://github.com/openai/whisper
在线使用:https://huggingface.co/spaces/sanchit-gandhi/whisper-jax