文章摘要
当前AI基础设施竞争从“算力规模竞赛”转向“算力效率竞赛”。7月17日上海WAIC 2026展会上,是石科技聚焦效率发布拓元(Vectron)。它是国产Token优化工厂,能解决算力统一调度等难题,兼容多种芯片、模型。该产品有多项核心技术突破,助企业降本增效,也让是石科技驶上规模化发展快车道。

当前AI基础设施领域的竞争逻辑已经发生根本性转变,此前的赛道比拼集中在硬件规模,而如今核心已经转向算力的高效利用——谁能把算力用得更好,才是下半场的关键。

7月17日,上海WAIC 2026展会开幕,智算赛道有超过200家企业参展,各类芯片、模型新品密集发布。在一片争相晒硬件参数、秀技术指标的氛围中,是石科技的发布会显得格外与众不同:创始人兼董事长闫博文全程没有讲解芯片或模型本身,而是将整场分享的核心聚焦在一个词上——效率。

据行业观察,国内当前已建成50余个智算中心,智能算力总规模突破1000 EFLOPS,但整体算力平均利用率远未达到满负荷状态,算力浪费现象普遍存在,具体表现为算力调度效率低下、长上下文响应能力下降等问题。闫博文指出:“大量算力正在被浪费,算不快、长上下文多模态响应下降,是普遍现象。”

基于国家级计算中心的工程经验积淀,是石科技长期投入大规模集群研发,建成并稳定运营万卡级国产大集群,打通了从底层芯片到上层应用的全链路超智融合体系,真正让国产算力集群从“点亮可用”升级到“满负荷高效运行”,将庞大的国产算力转化为产业可用的稳定Token生产力。

闫博文在分享中提出核心思考:“在算力基础设施建设提速的同时,如何进一步释放算力价值?”他提到,“十五五”期间国内算力产业总投资预计将达到7万亿元,如果算力利用效率能够提升10到20个百分点,将释放万亿级的算力价值空间,帮助各行各业以更低成本接入AI应用,激发出更多落地场景的需求。这也印证了行业共识的转变:AI基础设施的竞争,正从“算力规模竞赛”转向“算力效率竞赛”。

未来AI基础设施的核心竞争力,不再单纯取决于芯片的数量,而是能否将芯片、互联、内存、散热、调度与软件栈整合为稳定可用的大规模系统。而是石科技推出的拓元(Vectron),正是为这场效率竞赛交出的系统性解决方案,被定义为国产Token优化工厂

当前AI基础设施面临的效率难题主要包括:异构算力难以统一调度、大模型推理缺乏深度优化、长上下文场景下显存与成本压力骤增、国产芯片生态适配成本高昂等。针对这些痛点,拓元并非单一的模型或工具,而是一套完整的AI Infra优化体系,具体涵盖多个维度的优化能力:

  • 任务自适应优化:依托请求画像匹配最优计算链路,实现算力按需分配,避免资源浪费,让不同推理任务自动匹配最合适的算力资源,而非采用统一的调度模式。
  • 算子库优化:针对硬件专属设计算子融合编译方案,充分释放芯片的极限算力,让每一颗国产芯片不仅能够正常运行,更能发挥出最优性能。
  • 模型与推理框架优化:兼容主流国产芯片与各类大模型,通过异构深度调优提升业务并发处理能力。
  • 异构集群调度:破除跨地域、多芯片带来的算力孤岛问题,实现统一纳管与调度,盘活闲置算力资源。

据闫博文介绍,拓元全面兼容昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等10余种国产算力芯片,适配20余个主流大模型,实现了国产异构算力池的统一调度与推理加速,单日Token吞吐量可达千亿级别。对于企业客户而言,无论底层采用何种国产芯片,拓元都能帮助其统一管理算力资源池、优化调度方案,最终产出更多可用的Token。

发布会上,闫博文重点介绍了拓元的多项核心技术突破,每一项都直击企业使用大模型过程中的真实痛点。

企业在使用大模型时普遍面临的一个现实困境是,模型能力越强,运行成本越高,尤其是当处理长上下文场景时,显存压力会急剧攀升。传统的信息价值判断方法多依赖输入阶段的静态筛选,但真实业务中的信息需求往往是动态变化的。拓元的结果感知驱动KV Cache压缩技术,可以在不牺牲模型效果的前提下,显著压缩KV Cache占用空间,降低显存压力,让长文本处理、大规模AI应用能够以更经济的方式运行。

在大模型运行过程中,并非所有输入的信息都具有同等价值,如何保留关键Token、减少无效计算,是提升算力效率的核心命题。拓元在全模态场景中提出了基于模态自适应的免训练Token压缩方法,针对文本、视频、语音等不同类型的输入数据,实现更加精准的信息筛选。这意味着未来AI可以用更少的计算资源完成更复杂的任务,在多模态时代,这种能力的重要性将愈发凸显。

企业知识库、智能助手、复杂分析等越来越多的场景,都要求模型具备超长记忆能力。拓元通过混合位置索引合成的长上下文偏好训练方法,以及记忆引导的重读机制,在远小于同类方法的训练数据量下,实现了模型效果的显著提升。

传统的大模型部署完成后,往往需要大量人工反馈来持续优化输出质量,就像一个需要不断投喂、调教的系统。拓元提出的“基于元奖励的可扩展奖励建模方法”突破了这一难题,闫博文将其比喻为从“养一个需要不断人工训练的AI”转变为部署一个能够持续自我优化的AI系统。这大幅降低了企业的AI落地成本,让系统能够理解企业标准,在复杂业务场景中持续输出稳定、可靠且符合要求的结果。

智能体在执行长程检索任务时,有时会无法判断缺失或未读到的信息是被丢弃还是原本就不存在,从而产生负面影响。拓元明确了以目标导向的信息记忆策略,突破了稀疏信息难监测、长程建模受资源限制、注意力机制二次复杂度开销大等难题。闫博文表示,拓元可以帮助模型实现更低训练成本,更高上下文理解能力,更强复杂推理能力

我们希望AI不只是能够回答问题,而是能真正理解复杂世界。

是石科技成立于2021年,创始团队源自清华大学计算机系,具备国家级计算中心的工程化经验。闫博文本人是清华大学航院博士、计算机系博士后,核心团队成员主要由高性能计算、人工智能领域的资深专家,以及清华大学、北京大学、北京航空航天大学等重点高校的学者组成。

成立以来,公司快速成长,已服务超过200家重点客户,覆盖互联网大厂、头部大模型公司、航空航天、生物制药、新能源等多个行业,在并行优化、算力调度等业务领域形成了深厚的技术护城河。

拓元的发布,意味着是石科技将长期积累的领先技术能力凝结为一款商业化、标准化的产品,正式驶上了规模化发展的快车道。闫博文在发布会上强调:

技术创新的最终目的,不是停留在实验室,而是创造产业价值。

不仅如此,拓元也进一步明确了是石科技独特的赛道定位。国产芯片生态的成熟离不开中间件支撑,未来中国AI产业必然需要构建自主可控的技术体系。像拓元这样能够统一管理异构资源、屏蔽底层差异的平台,正是国产算力生态走向“好用”的关键拼图。

在算力效率这一核心命题上,当大多数行业参与者还在讨论具体的落地路径时,是石科技已经将产品带到了WAIC的展台上,同时也打开了公司从算力服务到Token服务的商业化新空间。闫博文在发布会结尾说道:

对于我们这些技术出身的人来讲,最希望听到的声音就是两种,第一是每次交付给客户的大规模集群,满负荷跑起来发出的万卡集群的轰鸣声;

第二就是我们每次帮用户优化终极效果之后,客户对我们的高度评价

这两种声音我们认为也是未来中国的AI走得更强、走向世界的最强音。

以上内容不代表本平台立场,仅供读者参考