首页  >  微软发布 DragonV2.1 模型,AI 转录语音更自然、更富表现力

微软发布 DragonV2.1 模型,AI 转录语音更自然、更富表现力

时间:2025-07-31作者:佚名

7 月 31 日消息,科技媒体 NeoWin 今天(7 月 31 日)发布博文,报道称微软推出了 DragonV2.1Neural 零次学习(Zero-Shot Learning)模型,仅凭少量数据就能创建更加自然、表现力强的声

 7 月 31 日消息,科技媒体 NeoWin 今天(7 月 31 日)发布博文,报道称微软推出了 DragonV2.1Neural 零次学习(Zero-Shot Learning)模型,仅凭少量数据就能创建更加自然、表现力强的声音,并支持超过 100 种语言。

引博文介绍,这是一种零次学习的文本到语音(TTS)模型,承诺提供更加自然和富有表现力的声音,并提高了发音的准确性以及增强了可控性。

新模型仅需几秒钟的语音样本即可合成超过 100 种语言的语音。相比之下,之前的 DragonV1 模型在处理专有名词时存在发音问题。DragonV2.1 模型可以应用于多种不同场景,包括定制聊天机器人声音和为视频内容跨多语言配音。

微软表示,DragonV2.1 提高发音准确性,与 DragonV1 相比,该模型单词错误率(WER)平均降低了 12.8%。

该模型还提升了声音的自然度,用户使用此模型时,可以利用 SSML 音素标签和自定义词典对发音和口音进行细致控制。为了帮助用户入门,微软构建了 Andrew、Ava 和 Brian 等多个声音档案,供用户测试。

标签:
微软 DragonV2.1 AI 
近期热点

鸿蒙版微信喜提7大实用功能更新,太实用了! 07-29

支付宝联合魔搭上线“支付MCP Server” 04-15

微信新功能!网友:有意思,立马试试! 04-05

iOS 18.4 更新引入了一个设置默认导航应用的选项 03-13

苹果史上最大软件革新即将来袭:界面统一 visionOS 风格化 03-11

热门文章
娱乐 电竞 首页 视频 软件