文章摘要
8月7日,阿里推出国内首款一站式AI语音生产力平台CosyVoice Studio,基于自研Qwen - Audio语音模型打造。该平台有语音键盘CosyVoice、语音智能体CosyAgent、音频内容创作工具CosyCreative三大核心功能,能满足不同用户的AI语音需求。普通用户可在各大应用商店免费下载使用,企业用户部分功能处于白名单测试阶段,详情可官网查询。

随着大模型技术的持续成熟,语音已经成为人机交互的核心入口之一,越来越多用户更倾向于用语音对话替代文字输入,行业的语音工具也从早期的零散转写、合成工具,逐步向端到端的语音智能体方向演进。在这样的行业背景下,8月7日,阿里正式推出国内首款一站式AI语音生产力平台CosyVoice Studio。

这款平台基于阿里自研的Qwen-Audio语音模型打造,此前该模型在全球权威AI评测平台Artificial Analysis中,一举拿下语音识别(ASR)、实时交互(RealTime)以及语音合成(TTS)三个赛道的全球第一。CosyVoice Studio包含三大核心功能模块,可以全面覆盖企业、开发者以及普通用户的各类AI语音需求,此次也是阿里首次将自研语音模型能力以聚合产品的形态对外开放,企业用户可以先在平台体验实际效果,再按需调用API接口,个人用户则可以直接通过产品完成各类语音操作。

平台的核心功能之一语音键盘CosyVoice,不仅具备基础的语音转文字能力,更在转写流程中叠加了语义理解与文本生成能力。在日常闲聊场景中,它可以自动过滤掉“那个”“嗯”之类的口语填充词,将用户零散的口语表达整理为逻辑清晰的结构化文本;即使用户在说话时进行自我修正,比如反复改口“不对不对,我意思是”,系统也不会保留改口痕迹,只会保留用户最终的真实意图。在正式工作场景中,用户只需要口述一段内容,就能直接生成符合规范的邮件、工作汇报或者会议纪要话术。

针对专业办公场景,CosyVoice还支持数字、公式类特殊文本的智能转写,比如将“三点五八亿”“百分之十二点六”直接转换为标准的阿拉伯数字格式3.58亿、12.6%,能够帮助金融分析师口述行情速报、科研人员整理实验数据、媒体记者梳理采访要点时,直接得到可直接使用的结构化内容。此外,它还内置了“随记”模式,专门适配会议、访谈、课堂等需要长时间持续记录的场景:开启该模式后,系统会实时将语音内容转换为逐字稿,还能通过声纹智能区分不同发言人,让参会者的发言内容一目了然;录音结束后,系统会自动生成结构化的章节内容,会议结束时,完整的会议纪要和待办事项就已经自动生成。随记模式还支持一键多语言翻译,跨国会议或者海外客户访谈的录音,无需事后人工整理就能完成翻译;同时支持上传已有的录音文件进行转写,单次最长支持6小时的连续录音内容。

平台的第二项核心功能是语音智能体CosyAgent,这是一款便捷的AI Agent搭建工具。用户只需要通过自然语言描述,就能快速创建具备企业专属知识、工具调用能力以及实时语音交互能力的智能体,同时支持通过prompt与workflow进行深度配置,能够适配智能客服、电话营销等多种企业业务场景。

第三项功能为音频内容创作工具CosyCreative,该工具内置了上千种不同的音色,同时支持用户进行声音复刻,生成的音色与真人声音高度相似。用户只需要上传文档、网页链接,或者直接输入一段文字内容,就能快速生成一段对话播客或者多角色有声书,完整覆盖音频内容创作的全流程链路。

目前,普通用户可以在iOS、Android、Mac以及Windows各大应用商店搜索“CosyVoice”下载体验,并且可以不限量免费使用。而面向企业用户的CosyAgent和CosyCreative功能,目前处于白名单邀请测试阶段,近期将全面开放,更多详细信息可以前往CosyVoice Studio官网cosyvoice.net查询。

以上内容不代表本平台立场,仅供读者参考