文章摘要
华中科技大学联合科研机构推出人工智能系统AlphaOracle辅助甲骨文破译。它完整模拟专家释读流程,分拓片解析、形态分析、语境对齐、文献佐证四环节。性能测试及专家评估显示,它能节省64%分析时间,偏好率高,还解决了部分有争议字形的释读问题,未来有望拓展至其他古文字研究领域。

当研究者面对一片带有模糊刻辞的甲骨残片时,想要辨认其中一个未释读的文字,往往需要耗费大量时间:翻检数百上千张拓片,比对青铜器铭文、战国文字与小篆的字形演变,再从古籍、学术论文中逐一查证用例。分散在不同年代、不同载体的海量证据,常常让一轮查证耗时数日之久。

针对这一行业痛点,华中科技大学联合多家科研机构推出了AlphaOracle——首个完整模拟专家释读流程的人工智能系统,旨在辅助学者高效完成繁杂的甲骨文破译工作。该系统的每一步释读分析都会附带完整的出处、候选答案与置信度,方便专家逐条复核,目前相关论文已被《The Innovation》期刊接收。

目前已发现的甲骨残片超过15万片,承载着四千五百余个不同的甲骨文字形,其中仅有约1500个得到了较为可靠的释读,剩余三千余个未释读的文字,如同尘封的密码,背后藏着早期汉语的词义、地名、族名,以及商代社会的运行细节。甲骨文的释读不仅能让三千年前的祖先生活图景重现,更是探寻中华文明源头的关键依据。

然而,甲骨文的破译与释读过程繁琐且耗时。传统的专家释读需要研究者分析文字的历史异体形态,从海量语料库中检索语境佐证材料,结合多条铭文与传世文献验证假说,这不仅要求研究者具备广博的知识与丰富的经验,还需要长期收集、整理并反复比对大量文献。尽管独立研究已取得诸多重要成果,但这种模式耗费大量时间与人力,且评估过程高度依赖专家主观判断,难以形成统一结论,无法实现规模化推进。

人工智能技术的发展为古文字释读带来了新的可能,但以往的研究大多仅依托孤立字形的视觉信息,很少结合文本语境与传世文献进行交叉佐证,即便部分结果在字形层面合理,也缺乏语言学与史料层面的论证依据,能为专家提供的实际帮助十分有限。因此,亟需构建能够贯通破译全流程、模拟专家推理过程的计算框架,让相关推论建立在全面可核查的证据基础之上。

AlphaOracle的核心价值,在于将原本依赖个人经验、难以规模化的古文字考释流程,转化为可复核、可重复、可协作的计算框架。系统整合了大规模甲骨拓片、摹本、传世典籍与两万余篇权威研究资料,所有分析过程中的候选结果与证据来源都会被完整保留,最终汇集成一份可溯源、可核查的辅助考释报告,供专家逐项检验与讨论。这一技术思路让人工智能有潜力进入古文字研究的核心环节,帮助学者从分散庞杂的材料中快速发现线索、汇集证据并比较不同解释。

系统的完整释读流程

AlphaOracle严格遵循专家释读甲骨文字的完整逻辑,分为四个核心环节:

第一步:拓片解析

输入原始甲骨文拓片后,系统首先完成字符检测、分类与句子重建:先定位每个甲骨文字符,通过分类器辨认已释字,将仍有争议的未释字交给后续模块;随后将每个字符视为节点,利用图神经网络结合空间信息,判断句子的起点、终点与字符间的连接关系,恢复甲骨拓片的阅读顺序,最终将零散拓片转化为带有完整读序的独立语句。

第二步:形态分析

基于清晰的单字图像与阅读顺序,系统从历时演变与内部结构两个维度生成破译假设:通过扩散模型模拟古代字形向后世形体的演变,对多次生成结果进行识别与汇总;拆解甲骨字形中的构件,映射为汉字的IDS序列,根据部件组合推测对应汉字;将甲骨文、金文、战国文字、小篆与隶书等不同时期的字形放在同一时间线比对相似度。三个专家模型各自给出候选与概率,系统按照模型可信度加权,判断该字是否已有公认释读,为未释字保留多个可能的破译答案与对应置信度。

第三步:语境对齐

形态分析得到的破译假设需要放回语句上下文中验证,并从其他相关拓片中寻找相似案例。系统先从《甲骨文合集》《甲骨文摹本大系》《甲骨文校释总集》等数字化资料中,依据图像与文本信息检索目标字符的全部已知用例,再利用专门面向甲骨文训练的掩码语言模型分析前后搭配。训练阶段,模型学习根据已知甲骨上下文补全被遮蔽的字;推理阶段,模型一方面重新排序形态模块给出的多个候选,判断哪个放入句子最通顺,另一方面独立提出语义候选。此外,语境对齐还包含一个经过监督微调和强化学习的解释模型,用于汇总同一字在不同卜辞中的用法,生成便于研究者核查的现代汉语说明。

第四步:文献佐证

经过字形与语境筛选的破译候选,将通过传世文献与现代研究论文进行进一步佐证。系统所用资料包括25部古代传世文献与23755篇权威现代研究,涵盖《说文解字》、先秦两汉典籍以及《古文字诂林》《甲骨文诂林》《甲骨文字林》等专业著作。检索时,系统会将异体字与近义词一并纳入查询,同时从文字语义与字形图像两个途径寻找相关材料。不同文献的相关程度、资料权威性、文献类型与时代早晚都会影响证据权重,每条材料都会保留书目信息与检索理由,方便研究者追查原文。最终生成的综合报告将依次呈现字形依据、语境用例与文献证据,指出当前支持度最高的读法及其可信度,同时明确保留尚未解决的学术分歧。

整体而言,AlphaOracle会自主提出假设并为每个假设收集相关证据,全程仅做少量必要判断,不会替代专家做出最终结论,其核心作用在于帮助研究者更高效地发现线索、核查证据与比较不同解释,将最终的裁决权留给专业学者。

性能测试与专家反馈

由于甲骨文释读缺乏公认的统一基准,研究团队将大问题拆分为多个可测任务,从组件性能与专家使用价值两个维度评估AlphaOracle。

在字形分析实验中,团队采用「模拟未释字」设置,将88个训练阶段从未出现的已知字类作为测试集,AlphaOracle的Top-1准确率达到23.1%。在语境分析任务中,系统从残缺卜辞中恢复被遮蔽文字的准确率为56.1%,并能以95.2%的准确率从字形分析给出的候选结果中选出更符合上下文的释读,两项指标均高于最佳通用大模型基线的22.2%与65.4%。在以现代汉语释义作为代理任务的综合解释评测中,AlphaOracle的BLEU、ROUGE和METEOR分别达到0.491、0.586和0.659。需要说明的是,GPT-5、Gemini 2.5 Pro和DeepSeek等通用模型在测试中采用零样本设置,未经过甲骨文领域数据微调,这一结果也凸显了专门语料与领域化流程对于古文字释读任务的重要性。

在专家实际使用评估中,86名来自甲骨文、人工智能及相关领域的专家与博士研究者匿名参与了测试。其中78.7%的参与者认为系统「有帮助」或「非常有帮助」,并估计平均可节省64%的分析时间。在满分为5分的模块化评估中,拓片解析、字形分析、语境对齐和文献依据检索四个部分的平均得分分别为4.20、4.44、4.38和4.01。研究团队随机抽取42个甲骨字进行人工检查,发现系统文献检索环节的命中率为90.2%,准确率为74.8%,这意味着系统会将大部分有价值的材料呈现出来,但其中仍会夹杂需要专家排除的无关资料,这一设计有效减少了研究者的文献翻检成本,让节省下来的时间可以更多用于证据判断。

此外,团队还组织了一场盲评「人类竞技场」,邀请来自故宫博物院、上海博物馆、中国社会科学院、清华大学、复旦大学等十余所高校与科研机构,以及韩国、日本、美国相关学术团体的资深甲骨学者,完成210次上下文解释任务盲测。结果显示AlphaOracle获得45.2%的最高偏好率,DeepSeek为34.8%,Gemini 2.5 Pro为12.9%,GPT-5为7.1%。

实际释读案例

AlphaOracle针对「屯南307」拓片中长期存在争议的甲骨文字形(早期研究常将其释作「卒」),综合字形演变、辞例分布与文献材料,将其解释为「勞」的异体字,为该字作为地名或族名的解读补充了证据支持。此外,研究还报告了22个有争议异体字的消歧结果,部分分析已进入甲骨文权威学术数据库,展现出人工智能辅助专家高效考察争议文字、推进学术讨论的巨大潜力。

研究总结与展望

AlphaOracle通过模拟人类专家的研究流程,将甲骨文字形演变、辞例分布与文献材料整合为完整的证据链,帮助研究者发现线索、寻找文献、核对材料,大幅提升了甲骨文释读的效率。同时,它为计算古文字研究打开了一条更接近真实实践的路径——人工智能不应只是端到端地给出无依据的最终答案,而应在研究者的每一个工作流程中提供可靠的证据辅助。

这一技术思路同样可以延伸到其他古文字领域,为分散而庞杂的古文字研究建立更系统的AI辅助整理与研究方式。古文字研究终究离不开人的判断:机器擅长从海量材料中迅速提出假设、完成检索、进行比对与归纳,学者则负责辨别证据的轻重、把握最终的学术决策。未来更值得期待的,正是这样一种人机协作的研究图景,人工智能拓展材料搜索的广度,人的学识守住学术判断的深度,让更多沉睡在甲骨与古文字中的历史信息被重新看见。

论文链接:https://doi.org/10.1016/j.xinn.2026.101462

补充材料:https://arxiv.org/abs/2607.17849

代码网址:https://github.com/Yuliang-Liu/AlphaOracle

Demo链接:http://vlrlabmonkey.xyz:7685/?lan=zh

以上内容不代表本平台立场,仅供读者参考