• 回答数

    0

  • 浏览数

    72

  • 收藏数

    0

作者:admin 发表于 2026-7-20 17:18:15
跳转到指定楼层
AI 总结 • 7 月 20 日阿里千问发布语音合成大模型 Q IT之家 7 月 20 日消息,阿里千问今日发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本。 官方表示,新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从“能说话”走向“会表达”。 在全球第三方权威榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斩获冠军 。 据介绍,Qwen-Audio-3.0-TTS 支持在文本中嵌入 结构化标签 ,用户可直接在文本里嵌入 [gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这类标记,直接对语气、情绪和 breath 类细节进行精准调控。 此外,该模型配套开箱即用的 精品音色库 ,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为可直接调用的音色资源,将陆续上架指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 小语种音色。 并将音频输出从提升 24KHz 到 48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格, 单次语音合成可达 3 分钟 。 面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus 进行了专项优化,覆盖中、英、日、韩、德等 16 种语言 ,新增阿拉伯、越南、马来、菲律宾语; 并支持广东、重庆、东北、陕西、上海、四川、云南等 20 种方言 。 Qwen-Audio-3.0-TTS 现已全面开放,IT之家附链接: • Plus 版本: https://bailian.console.aliyun.com/cn-beijing ?tab=model# /model-market/detail/qwen-audio-3.0-tts-plus • Flash 版本: https://bailian.console.aliyun.com/cn-beijing ?tab=model# /model-market/detail/qwen-audio-3.0-tts-flash [来源链接] https://www.ithome.com/0/979/128.htm
该板块内容需要购买后才能完整浏览
立即购买
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接