Noiz声学智能:环境变化驱动的实时声音推演

高中时第一次戴上耳机听陈奕迅,陈伟嘉就被歌词之外的声音细节吸引——音色、歌手的状态、所处的声音环境。这份对声音的敏锐感知,成为他后来创业的核心方向。如今,他创立的音频智能公司Noiz,正试图让AI跳出仅识别“人在说什么”的局限,转向理解和模拟声音本身的物理逻辑。
过去两年,音频AI在不少讨论中被等同于语音AI,行业聚焦的自然语音合成、精准语音识别、低延迟人机交互,大多围绕“文本内容”展开。多数音频模型只处理了最容易被文字描述的表层信息,能识别声音“代表什么”,却无法理解“为什么会这样发生”——比如一句“我没事”藏着的情绪,一声关门声背后的力度、材质和空间感,这些语言之外的信息,恰恰是现有模型难以捕捉的核心盲区。
带着对音频智能的全新理解,陈伟嘉在2025年9月创立Noiz,目标是构建声学智能基础设施,让AI不仅能识别、生成声音,更能理解声音如何产生、传播并被感知。据行业观察了解,Noiz AI已完成数千万元种子轮融资,最新一轮投资方为金沙江创投,此前还获得北极光创投、英诺天使基金的投资。目前Noiz全球用户已突破200万,ARR达百万美元级别。
核心团队背景
Noiz团队目前正职员工十余人。创始人陈伟嘉拥有丰富的行业履历:曾在Meta、TikTok任职,参与视频、自动语音识别与智能体相关工作;回国后创办玉符科技,打造身份管理类SaaS产品,2020年该公司被腾讯收购;此后他在腾讯参与智能体模型的工程化落地,先后经历语音克隆、多模态模型、代码开发等技术阶段,也是语音克隆开源项目Mockingbird的作者。联合创始人陈前拥有北大、清华与MIT的教育背景,此前曾任百川智能用户增长及运营负责人;首席科学家Zeyue Tian是最早系统研究音视频联合生成的研究员之一,其开源的全曲生成模型ChatMusician曾被杨立昆转发。团队其他成员来自Meta、Dolby、TikTok等公司与实验室,覆盖声音模型、多模态预训练、空间音频、产品工程与商业增长等方向,其中不少成员同时兼职乐队乐手与音乐创作者。
产品与业务布局
Noiz并未将自身定义为单一的配音工具或音频生成产品,而是从通用音频模型出发,逐步搭建音视频智能底座。公司认为,新一代音频模型应当具备对声音的产生、传播、空间响应及感知过程进行统一理解、生成与模拟的能力。
创立初期,Noiz自研开源音频模型底座AudioX,并推出面向创作者的音频产品Noiz AI进入市场,通过付费产品验证技术能力。Noiz AI面向短视频、内容制作与泛娱乐场景的创作者,提供语音、音乐、音效、视频配音与声音编辑能力。目前产品已积累约200万海外创作者,不过C端用户并非Noiz的主要现金来源,而是作为模型初期的数据雷达,帮助AudioX不断迭代优化。
这一思路源于陈伟嘉首次创业的教训:在研发身份认证SaaS时,团队打磨技术近20个月才尝试商业化,却因缺乏市场反馈导致效果不达预期。2020年疫情期间,腾讯会议用户规模大幅跃升,玉符科技被腾讯收购,意外获得商业出口。这段经历让陈伟嘉坚信,必须以市场反馈指引技术迭代,因此Noiz的模型从第一代起,就根据用户的实际创作与付费行为持续优化。
除C端产品外,Noiz还通过两类业务验证底层模型能力:一是API与企业集成服务,将同一套模型以接口和系统集成的形式,接入内容平台、视频生产工具与企业工作流,企业客户可根据业务需求调用语音、音乐、音视频、翻译与空间音频等不同能力,主要客户来自短剧、游戏、视频生产等领域;二是与3D与具身智能领域的合作,目前Noiz正在将通用声音底座拓展到3D世界与具身智能场景中。与传统后期贴音效的方式不同,Noiz的目标是根据场景的几何结构、材质、距离与听者位置,实时生成匹配的空间声场。
对于机器人而言,听觉具备全向、连续且不受视线遮挡的优势,可帮助机器人更早感知身后的脚步声、周围的碰撞声、设备内部的异常摩擦声,以及动作是否产生了合理的物理结果。今年6月,Noiz团队发布AudioX-Turbo,进一步解决音频生成速度问题。在无声视频生成声音的场景中,模型需要让脚步、碰撞、运动与画面中的事件尽可能同步发生,而非等待长时间离线渲染。这款模型也是团队从离线内容制作走向交互式声学系统的基础——只有声音能够足够快速地生成,才有机会进入实时视频、游戏、虚拟角色与人机交互系统。目前,随着底层模型逐渐统一,公司正从“生成音频内容”,进一步走向“实时音视频交互”。
构建物理导向的数据壁垒
早在2022年,陈伟嘉在进行声音克隆与情绪模型训练时就发现,仅依赖文本转语音技术,无法还原人类说话时的真实状态。他认为,除了语言本身,咳嗽声、非语言声响、沉重的关门声等,本身都承载着大量信息量,甚至能预示事件后续发展,但过去的声音AI完全没有捕捉到这些信息,声音需要连接到环境上下文,而非仅文本上下文。
在陈伟嘉看来,当前声音模型的竞争主要集中在语音识别、语音合成与实时对话领域,行业普遍依赖互联网音频数据,再通过文本标签或多模态模型补充事件描述。但这类数据通常只会告诉模型“发生了关门”,却不会记录房间的大小与结构、门的材质与厚度、声源与麦克风的距离、空间中的混响与反射、施加在门上的力度,以及听者的位置与方向等关键信息。因此现有模型能够复现一段听起来合理的声音,却无法判断在全新的空间中,声音应当如何发生。这也是声音模型长期面临的数据痛点:互联网上有大量音频资源,但很少有数据会系统标注声音背后的物理条件。
为了构建这一核心壁垒,Noiz正重点采集具备物理条件的训练数据,并搭建三类数据来源:第一类是真实世界采集,通过专门设计的流程控制空间、材质、距离、方向与事件,获取未经重度后期加工的高保真声音,比如团队中来自相关领域的成员会采用空间音频方法,录制时使用两个或四个麦克风,处理声道同步、设备位置统一与空间信息;第二类是物理声学仿真,批量生成现实中难以穷举的材质、空间与声源组合,扩大训练条件的覆盖范围;第三类来自产品端,创作者在平台中的生成、重试、编辑、保留、导出与付费行为,会被转化为偏好信号,帮助模型判断哪些声音更匹配画面、哪些情绪更具表现力。真实采集保证数据真实性,仿真补足数据规模,用户行为提供审美反馈,三者共同形成完整的数据闭环。
行业判断与未来方向
陈伟嘉认为,做音频模型这件事,“跟文本走得越近越卷,反之则越蓝海”。在Noiz提出的声学智能框架下,语音并非声音智能的全部,而只是其中一个重要特例。当模型真正理解声音如何发生时,情绪、空间感与距离感就不需要作为后期效果附加,而可以成为同一生成与理解过程中的内生变量,这也是Noiz与传统语音合成、素材型音效生成,以及以对话为核心的音频语言模型之间的核心区别。
Noiz正在推进的下一代模型,希望让声音能够随着环境变化实时调整:一扇门被打开或关闭,物体从木材变成金属,听者从房间走到走廊,声源从正前方移动到身后,空间从铺有地毯的卧室变成空旷的地下车库,在这些场景下,Noiz希望声音表现能够根据新的空间、材质、位置与事件状态实时产生变化。这意味着模型需要从“生成一段看起来合理的声音”,进一步走向“在当前条件下推演此刻应该听见什么”,根据正在发生的事件,实时生成匹配的音效、音乐与环境声。
从通用音频模型出发,Noiz希望构建理解声音产生、传播与感知过程的声学智能底座,让模型从复现既有数据分布的“生成器”,进一步变成能够根据空间、材质、事件与位置推演声音的“模拟器”。与之相对应,陈伟嘉正在聚焦实时交互内容平台与具身智能市场。
在他看来,传统短剧、视频或游戏仅在制作阶段调用一次模型,生成的声音可反复使用;但在互动游戏、虚拟世界等实时交互内容平台中,用户每做出一个动作,系统都要根据场景、材质、距离与方向实时生成声音,只要用户在线,平台就需要持续调用接口,因此调用频率与收入上限更高。音频模型在具身智能领域的机会,则被陈伟嘉概括为“给机器人戴上耳朵”。
他表示,机器人不能仅依赖摄像头与语音指令,还需要持续理解环境声音。比如身后掉落的杯子、隔壁房间的碰撞声、设备的异常摩擦声,这些都可能处于视觉盲区;如果机器人能听懂声音的来源与发生的事件,就能主动采取行动。未来,声音还可用于多机器人协作以及机器人与人类的长期互动。目前Noiz已与一家具身智能公司合作,通过技术咨询与模型适配的方式,为对方提供模型以帮助识别空间声音事件,据介绍,机器人已经能够通过声音判断身后或旁边有杯子掉落并主动处理,未来双方还将进一步拓展相关合作。

