星环科技GPU原生数据库:AI推理不再干等,性能提升超70倍

2026年的行业展会中,大模型、智能体等热门技术占据了核心展示区域,但一款扎根大模型背后的基础软件,同样吸引了大量产业用户驻足关注。这款被称为全球首个完整GPU原生数据库的产品,让来自金融、制造、科研等领域的技术负责人开始思考:AI Agent时代,企业的数据底座是不是该迎来一次彻底更新了?
7月中旬,相关企业推出了面向AI Agents的新一代高性能AI数据库——GPU原生认知数据库。在全球数据库领域,将整个数据库的计算链路从CPU彻底迁移到GPU体系,并且刷新全栈性能测试成绩,这无疑是一次大胆且彻底的架构革新。
相关企业创始人表示,当前很多企业虽然部署了数百上千个AI Agent,但真正能够稳定落地的并不多。要让Agent真正发挥价值,首先需要解决数据质量和数据组织的核心问题。
AI Agent正在重构数据消耗模式
过去两年的大模型应用大多以单轮问答为主,用户提出问题后模型给出一次回复即可。而当前AI Agent的工作模式已经转向多步骤循环推理:一次复杂任务可能触发数百次数据访问,当多个Agent并发运行时,数据处理需求会出现数量级的增长。
“Agent会反复尝试,先推理分解任务,再调用数据库和工具验证结果,发现错误后还会调整修正。”相关负责人解释,这种计算方式的变化,对底层数据架构带来了深远影响。
传统CPU数据库的瓶颈首先体现在并行度和内存带宽上。单颗CPU通常只有数百个通用核心,内存带宽约为400GB/s;而GPU拥有上万级并行计算单元,显存带宽可达数TB/s。在大规模数据扫描、复杂聚合、向量检索和图计算场景中,两者的硬件性能差距已经非常明显。
更棘手的是数据搬运带来的链路延迟。当前AI模型推理大多运行在GPU侧,但数据库查询和知识检索仍依赖CPU侧完成,数据需要在CPU内存和GPU显存之间反复搬运。存储墙的存在让数据传输速度慢、延迟高,调用次数越多,整体等待时间就会被进一步放大。
“用户把任务交给AI后,它就像在图书馆里查找资料,如果资料太多、处理太慢,最终的输出结果自然会变慢。”相关负责人打比方道,“AI其实就是在干等,等着数据处理完成。”
这种等待会直接侵蚀昂贵GPU算力的利用率。数据处理速度慢会导致GPU闲置,其利用率可能仅维持在30%到40%之间。模型本身还有大量未被激活的计算能力,但整条推理链路却被数据查询、解析、检索和传输环节卡住。
如果单纯增加CPU节点数量,也无法从根本上解决问题。随着CPU数量扩容,企业还需要同步增加内存、交换机、电力和散热系统的投入,系统间通信还会带来新的开销。“功耗、散热和交换机成本都会同步上升,总成本的增长速度会比算力提升更快。”相关负责人补充道。
因此,Agent时代的数据瓶颈并非单纯的存储容量问题,而是计算、带宽、存储和数据组织方式共同形成的系统性瓶颈。模型权重、KV缓存和上下文需要更快的显存、内存和存储介质,而数据准备、关联分析和知识检索则需要更强的计算核心。
“数据处理是一个综合问题,需要高速存储、更大容量的内存和显存,也需要更强劲的计算核心。”相关负责人强调,“CPU已经无法跟上需求,就必须用GPU来承担计算任务。”
全栈迁移:把数据库“户口”迁到GPU上
基于这样的认知,相关企业做出了激进的架构决策:将数据库的完整计算链路迁移到GPU体系内。与市面上常见的“GPU加速数据库”不同,该企业强调的“GPU原生数据库”有着本质区别。
相关负责人用形象的比喻解释了差异:“如果只是将部分数据库功能放到GPU上,就相当于坐飞机一段路后再步行一段,反复切换会拖慢整体数据分析的时间。”
该项目的核心思路是将存储层、计算层、编译层和执行引擎全部围绕GPU进行重写,让SQL分析、向量检索、图计算等核心操作尽可能留在同一套GPU计算和显存体系内完成。
技术层面,该团队实现了GIDS(GPU-Initiated Direct Storage)技术,由GPU直接发起存储访问,完全绕过CPU和主机内存,实现真正意义上的GPU直连存储。这种架构带来了三大核心价值:消除CPU瓶颈、降低数据传输延迟和最大化GPU利用率。
只有实现全流程加速,GPU较高的硬件投入才能转化为实际的经济性优势。如果GPU仅能将查询速度提升一两倍,其高昂的硬件价格很难被摊薄;但当性能提升达到数十倍甚至上百倍时,企业完成相同任务所需的机器数量和运行时间都会显著下降,单位任务成本才会迎来拐点。
根据公开的测试结果,在TPC-DS SF1000基准测试中,该数据库完成全部99项查询测试,相较主流开源数据库DuckDB获得了70倍的加速。在与全球头部云数据仓库的对比中,其性能更是展现出了代际优势。相关负责人指出,当性能提升达到几十倍甚至上百倍时,即使GPU硬件成本高于CPU,经济性拐点也已经到来。
“Agent时代,数据库有两个核心变化。”相关负责人表示,“一是数据处理速度要能够跟上GPU的算力,二是数据库需要能够理解语义。”
在该企业的GPU原生架构中,数据库不再仅仅是存储和查询数据的容器,而是进化为能够理解语义、管理长期记忆、并主动为Agent供给上下文的认知基础设施。相关负责人认为,AI Agent需要的不是零散数据的堆砌,而是完整、可信且可持续调用的业务上下文。
他进一步解释,在AI时代,数据库必须成为AI的“真相所在”:“数据是客观真相的载体,模型给出的是概率性答案,而数据库提供的是精准的确定性答案。”为了支撑这一定位,数据库需要统一承载关系型、向量、图、全文和文档等多模型数据,并将数据分析、知识检索、上下文供给和记忆管理融合在同一底座中,减少多个数据库拼接带来的数据复制和系统割裂问题。
真实场景的性能验证
除了标准基准测试外,该GPU原生认知数据库已经进入真实数据和业务场景进行验证。
在复杂企业知识问答场景中,系统需要处理8.9万页文档、2600多万个数值以及大量分析和推理任务。测试结果显示,包含OCR的文档解析与知识入库性能提升约10倍,数据检索性能提升约20倍,单题端到端推理性能提升约6倍,最终任务准确率达到79.3%。
这类场景的难点往往集中在推理之前的准备阶段。企业需要先解析文档、抽取表格和数值、完成知识入库,再让Agent持续查询和校验。相关负责人提到,有客户将数据导入向量库需要等待一个月,一旦数据更新,又需要重复漫长的流程。“如果一次数据入库需要等待一个月,企业根本无法接受这样的效率。”
智能投研场景对数据处理速度的价值更加直接。因子计算、历史回测、参数搜索和策略验证都需要反复扫描多源数据。该团队在不同测试任务中实现了30倍至5881倍的性能提升。研究人员可以在同一天内验证更多因子和策略,扩大搜索空间,也更有机会在市场窗口关闭前完成验证。
“投资机构一天能够尝试的策略数量比原来多几百倍,就有机会找到更优的投资策略。”相关负责人说,“谁能够先将有效的策略投入市场,谁就能更早获得收益。”
率先突破的技术底气
为何是该企业率先完成完整的GPU原生数据库?相关负责人打了个形象的比方:“把完整数据库搬到GPU上,就像从地球移民到火星。原来成熟的软件包和工具大多无法直接使用,很多核心组件都需要重新开发。”
背后支撑的是该企业长达十二年的分布式技术积累。自2013年成立以来,该企业长期投入分布式数据库和多模型数据管理技术,并于2020年提出多模型数据库的发展方向。对该企业而言,GPU带来的高并行计算架构与既有技术路线存在天然的延续性。分布式时代积累的任务拆解、调度、数据分区和多模型统一能力,构成了此次架构迁移的核心基础。
相关负责人认为,过去在分布式系统领域积累的经验,在此次架构迁移中发挥了关键作用。过去二十年,数据库行业通过Scale-out(水平扩展)解决单机性能不足的问题;如今,GPU强大的算力与高速互联技术推动计算重新走向高密度Scale-up(垂直扩展)。
可以说,对并行计算的深刻理解,以及对多模型数据库一体化架构的长期探索,最终成为了该企业率先跨越架构鸿沟的核心基石。
数据库迎来“GPU时刻”
当AI Agent深入企业业务场景后,模型、工具与数据之间的调用频率持续上升。企业能否让Agent快速获得可信数据、精准上下文和连续记忆,开始决定AI应用的响应速度、准确率和单位成本。
GPU原生认知数据库仍处于产业化早期,其测试成绩还需要更多生产系统的长期验证,国产算力适配、超大规模数据管理和生态兼容也将持续推进。但整体方向已经清晰:AI Agent正在重写企业的数据底座,数据库的计算架构与能力边界都需要随之发生变化。
当GPU从原本仅服务于模型推理的专属算力,进一步进入数据分析、知识检索和记忆管理领域,数据库也终于迎来了属于自己的“GPU时刻”。

