文章摘要
中国电信人工智能研究院在WAIC 2026上发布智传网(AI Flow)技术,可让轻小型无人机直连卫星实时回传高清视频。该技术改变传输对象,以“计算换带宽”,解决了载荷与带宽矛盾,已应用于应急救灾等场景。此外,其应用场景还拓展到具身智能机器人、水下通信等领域,有望建设AI时代的新一代通信网。

你或许已经习惯了大模型交互界面中流转的Token,但你见过在无人机和卫星之间传递的Token吗?近日,行业内推出了一项全新的融合AI与通信的技术,让轻小型无人机能够直接连接卫星实时回传高清视频——这就是中国电信人工智能研究院在WAIC 2026上发布的智传网(AI Flow)技术。

在传统应急通信场景中,当洪水、地震等灾害导致地面通信中断时,保障人员往往需要在灾区搭建临时地面接收发射设备,无人机再将拍摄的画面传回地面终端,最后通过卫星传输到后方指挥中心。这套方案存在两个核心痛点:

  • 作业范围受限:无人机必须依赖地面通信设备,无法深入超出地面覆盖的偏远区域
  • 带宽与载荷矛盾:轻小型无人机搭载的卫星设备带宽有限,高清视频实时回传困难,降低码率又会导致画面模糊、卡顿或关键细节丢失

智传网的核心思路彻底改变了传统通信的传输对象,不再直接传输视频比特流,而是先在发送端通过端侧设备对画面进行语义理解,提取场景、物体、运动状态等关键信息编码成Token序列,通过卫星或其他通信链路将Token传输到接收端后,再利用生成式模型重建出完整的视频画面。

这项技术实现了国内首次轻小型无人机直连卫星的高清视频实时稳定传输,解决了长期困扰行业的载荷与带宽矛盾。就在此次发布的前一天,智传网还拿下了WAIC大会最高奖项卓越人工智能引领者奖(SAIL)中的赋能(Applicative)奖

目前,智传网的生成式智能传输能力已经进入实际应急场景。今年,研发团队与合作方将基于该技术的千余套设备投入全国31个省份的一线防汛抗洪工作,从技术演示走向了跨省的实际应用。而轻小型无人机直连卫星这项新近跑通的能力,也将进一步推进产品化落地,在灾区勘察、远程救援等场景发挥作用。

除了终端设备的优化,研发团队还在推进将智传网的解码模型部署到在轨卫星上。传统星地链路通常上行带宽有限、下行带宽相对充裕,将部分计算和重建工作放在卫星端完成,可以减少对地面算力节点的依赖,进一步提升通信效率。

当通信链路回到地面,智传网的应用场景进一步扩展到具身智能机器人领域。具身智能在现实环境中执行任务时,需要实现人与机器、机器与机器之间的高效通信协同:操作人员需要实时获取机器人的现场画面,机器人需要及时接收远程控制指令,多台机器人协同作业时还要共享环境感知信息和任务进展。

智传网结合5G低时延能力,将具身智能遥操作的端到端时延压缩至20-50毫秒,让机器人的远程控制半径从局部区域扩展到跨城际乃至全国范围,即使进入无基站的荒野区域,也能通过卫星链路回传画面并接收指令。

远程控制范围的拓展只是其一,智传网采用统一编码的词元流,还能够打通不同类型、不同厂商的机器人设备。自研机器人与合作厂商的机器人可以共享环境感知数据、目标位置信息和任务进度,一台机器人发现道路受阻后,可以将信息同步给其他设备,另一台找到通行路线的机器人也能将经验共享到系统中,减少重复的感知和计算工作,逐步形成分布式群体智能,实现基于连接与交互的智能涌现。

这套通信逻辑还延伸到了水下场景。水下通信一直是行业难题,自然水域中的水体对信号的吸收、散射会造成严重衰减,远程实时传输高清视频尤为困难。依托智传网技术,研发团队实现了自然水域中的远程无线实时高清视频传输,相关核心载荷已经搭载在自研的空海跨域潜航器上,可用于海底光缆巡检、水下勘探、海洋牧场管理和应急搜救等场景,将水下现场画面实时传回地面。

从轻小型无人机直连卫星,到跨城遥操作机器人,再到水下高清视频传输,智传网的技术逻辑已经覆盖了天空、卫星、地面和水下多个场景。这些设备形态各异,但都面临着同样的核心问题:如何在带宽有限、网络不稳定的环境中,高效传递真正有价值的信息。

这个问题的答案,就藏在智传网对传输对象的重构中。传统视频通信处理的是比特流:摄像头采集画面后,编码器通过分析像素变化进行压缩,再将处理后的数据通过网络传输到接收端。这套方案在光纤、5G等带宽充足的环境中已经非常成熟,但在卫星窄带、远洋、水下和灾区等场景,高清视频的数据量依然会超出链路承载能力。

智传网的思路是让通信从“比特流”转向“词元流”,通过发送端的神经编码器对原始视频进行语义理解,提取关键信息编码为Token序列,接收端再结合预训练的世界知识重建视频。我们可以用一个简单的比喻来理解两者的区别:传统视频通信就像把一幅画切成无数小块,尽可能完整地送到目的地;而生成式智能传输则是先提炼出画的构图、人物、动作和关键细节,将这些高度浓缩的信息传递到接收端,再由模型完成画面重建。本质上是用更多的计算资源来置换通信带宽资源,也就是“计算换带宽”

这种“计算换带宽”的实现,背后依托于研发团队提出的“信容律”:通信资源与计算资源可以在一定条件下相互置换,当链路带宽受限时,通过发送端和接收端的模型计算,减少需要传输的数据量。除了信容律,研发团队的理论研究还延伸到了“正激励噪声”,证明在特定条件下,噪声不仅不会干扰模型,反而可以促进模型的训练和演化。

这项技术到底能节省多少带宽?研发团队用一句话概括:“用发信息的带宽通电话,用通电话的带宽传视频”。此次发布的两组数据印证了这一点:在音频传输场景中,智传网可以在0.266Kbps的极低码率下完成语音通话和音乐播放,相比传统编解码方案降低约500倍,实现了全球最低速率的语音通话;在视频传输场景中,测试用的足球视频仅需100Kbps码率就能传输并重建1080P@30fps的画面,而传统方案需要3600Kbps的码率。虽然实际效果会受到信道状况、模型规模、设备算力和视频内容的影响,但这组数据已经清晰展示了词元流的核心价值:当带宽成为瓶颈时,模型能力可以承担原本由网络完成的部分工作。

随之而来的一个关键问题是:接收端通过生成式模型重建的画面是否可信?当生成式模型参与视频重建后,通信系统需要同时满足视觉质量、语义准确性和任务有效性三个要求。我们可以借助香农—韦弗通信模型来理解这个问题:Level A关注符号能否准确传输,Level B关注语义能否正确表达,Level C则关注接收到的信息能否帮助目标完成任务。传统视频编码主要关注像素和符号层面的准确传递,而智传网将评价范围延伸到了语义理解和任务执行层面。

以灾区救援场景为例,一棵树的纹理是否与原视频完全一致其实优先级很低,真正影响救援决策的是哪里有被困人员、道路是否中断、房屋是否存在坍塌风险等关键信息。因此,智传网的评价指标覆盖了通信速率、重建质量和理解能力,重建后的画面既要清晰连贯,也要保留识别、推理和任务执行所需的关键信息,研发团队将这一目标概括为“全息世界的可信重建”

除了极端环境下的通信问题,智传网还应对了城市级视频网络的规模化挑战。目前,相关视联网已经形成覆盖1亿路摄像头的视频资源基座,这些摄像头需要7×24小时持续运行,随着4K、8K设备的普及,视频数据量和存储压力持续增长。虽然这些视频已经经过了成熟的编解码处理,但面对海量的全天候监控数据,进一步降低传输和存储成本依然至关重要。

智传网的不同之处在于,它不仅识别画面变化,而是从根本上改变了视频的表达和存储方式:将视频编码为更加紧凑的Token序列,仅在需要时通过生成式模型还原完整画面。传统视频压缩主要利用前后画面的冗余信息,而生成式智能压缩则借助模型能力对背景、人物、车辆和事件等内容进行统一编码,在保留关键视觉信息的同时,大幅降低传输和存储的数据规模。以1亿路摄像头的存储为例,智传网仅需要保存视频中提取的精简词元,按需解码还原画面,存储空间仅为传统方案的四十分之一,原本仅能留存一周的影像资料,如今可以完整存储接近一整年,存储成本得到大幅压降。

从服务全国防汛的千余套设备,到覆盖1亿路摄像头的视频基座,智传网面对的场景涵盖了断网、窄带、水下等极端环境,以及城市级的规模化传输存储压力。这些场景共同指向了一个容易被AI行业忽略的问题:过去几年,行业讨论AI时更多关注模型参数、训练算力、芯片性能和应用入口,但当AI从聊天框进入无人机、机器人、摄像头和水下设备后,它就成为了一个分布在物理世界中的分布式系统。不同终端需要交换感知结果、传递任务指令、共享模型能力,还要在网络条件不断变化的环境中保持协同。如果通信网络无法跟上,端侧设备就只能停留在单机状态,小模型受限于算力只能处理有限任务,云端模型能力再强也无法及时触达灾区、荒野、远洋和水下。

智传网想要建设的,正是AI时代的新一代通信网:它不仅连接设备,还要承载Token、模型能力和任务指令,让智能在不同终端之间流动起来。回顾通信技术的发展历程,每一代网络都催生了新的应用形态:2G时代承载语音和短信,3G推动移动网页和图片普及,4G带来短视频和移动互联网,5G支持高清直播、低时延连接和海量终端。

进入AI时代,网络中流动的内容也发生了变化:除了文字、语音、图片和视频,还会出现Token、中间推理结果、模型能力和任务指令,连接的对象也从手机和电脑延伸到了无人机、机器人、摄像头和水下设备。智传网的出现,正是在回答这个新时代的问题:当越来越多设备拥有智能,如何让这些智能跨越终端、网络和空间,真正实现连接与协作?模型负责产生智能,而通信网络的使命,就是让这些智能抵达更远的地方。

以上内容不代表本平台立场,仅供读者参考