• 回答数

    0

  • 浏览数

    14

  • 收藏数

    0

作者:mary 发表于 前天 13:08
跳转到指定楼层
IT之家 8 月 27 日消息,在外界仍等待 Gemini 3.5 Pro 发布之际,谷歌先推出了 3.5 系列中的另一款模型。 该公司今日发布了 Gemini 3.5 Transcribe 语音转文本模型,这是一款旨在优化语音输入体验的 AI 模型,能够自动删除语音中的“嗯”“呃”等口头禅以及说错后自行纠正的内容,最终生成更加通顺、整洁的文本。 IT之家注意到,这款模型目前已经为 Pixel 11 上 Gboard 键盘的“Rambler”功能提供支持,接下来还将陆续进入谷歌旗下更多产品和服务。 谷歌表示,与此前名为 Chirp 3 的语音转文字引擎相比,Gemini 3.5 Transcribe 在速度和准确性方面都有提升。 从用户说话到最终生成转录文本,整体速度预计可提升约 70%; 在实时语音场景下,其错误率已经降至 5.5%。 不过,准确率的提升幅度并不算特别大。 按照谷歌的数据,Chirp 3 的错误率为 7.32%。 但对于经常使用语音输入的用户来说,即便只是少打几个错字,也意味着后续需要手动修改的内容更少,因此依然是一项实用的改进。 Gemini 3.5 Transcribe 的能力也不只是“听清楚”用户说了什么,它还试图理解用户真正想表达的意思。 在说话过程中,模型可以自动删除“嗯”“呃”等影响语句流畅度的口头禅。 如果用户说错话后立即进行修正,它也能够实时调整已经生成的文本。 此外,用户还可以提供自定义词汇表,让模型更好地识别专业术语和特定领域的词汇。 该模型目前支持 85 种语言,并且可以处理最多包含 3 名说话者的预录音频。 当然,这种功能也存在一个明显的问题:用户需要相信 AI 能够准确理解自己真正想表达的内容。 至少在较短的文本中,从 Rambler 功能的实际体验来看,模型确实能够较好地清理前后不一致的表达和说话时的磕绊,让文本看起来更加自然。 但与此同时,Gemini 3.5 Transcribe 并不只是简单地把语音转换成文字。 AI 在整理内容的过程中,实际上可能会改变用户原本的措辞。 因此,在一些需要严格保留原话、不能随意修改表述的场景中,这种“智能润色”未必适合使用。 [来源链接] https://www.ithome.com/0/994/960.htm ...
该板块内容需要购买后才能完整浏览
立即购买
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接