让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统
一片龟甲或牛肩胛骨摆在案头,裂纹穿过刻辞,几个字还缺了笔画。
研究者想确认其中一个生字,往往要翻检成百上千张拓片,比对青铜器铭文、战国文字和小篆的形体,再到古籍与现代论文里寻找用例。证据散在不同年代、不同载体和不同数据库中,一轮查证可能持续数日。
近日,来自华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,以辅助专家完成繁杂的甲骨文破译工作。
论文链接:https://doi.org/10.1016/j.xinn.2026.101462
补充材料:https://arxiv.org/abs/2607.17849
代码网址:https://github.com/Yuliang-Liu/AlphaOracle
Demo链接:http://vlrlabmonkey.xyz:7685/?lan=zh
AlphaOracle先考察甲骨字形在历史上的演变轨迹,随后回到完整辞例和同类卜辞中,结合上下文进行检验,最后查阅古籍与研究文献加以佐证,形成完整的证据链条。
AlphaOracle的每一步释读分析均附有出处、候选答案和置信度,方便专家逐条复核,提供便捷、高效且可靠的智能辅助。论文已被《The Innovation》接收。
研究背景
甲骨文把商王朝的战争、农事、疾病、祭祀、天象和日常决策留在了三千多年前的骨片上。已发现的甲骨碎片超过15万片,至少包含4500个不同字形,得到较可靠释读的约有1500个。
余下约3000多个字像一扇尚未推开的门,门后藏着早期汉语的词义、地名、族名,也藏着商代社会运行的细节。甲骨文的释读,让三千多年前祖先的语言、观念与社会生活重新变得清晰可见,也使中华文明绵延不绝的历史脉络变得生动而璀璨。
甲骨文记录着商代社会的生活图景,是中华民族珍贵的文化瑰宝,也是探寻中华文明源流的重要依据。
然而,甲骨文破译与释读的过程困难且繁琐。专家释读未破译文字时,通常会分析文字的历史异体形态,从海量参考语料库中检索语境与文本对证材料,并结合多条铭文与传世文献对相关假说进行验证。这一过程既要求研究者具备广博的知识积累与丰富的研究经验,也需要他们长期收集、整理并反复比对大量文献资料。
依靠专家独立开展的相关研究虽取得诸多重要成果,但该模式耗费大量时间和人力,且相关评估过程往往依赖专家主观判断,高度依靠研究者个人学识,不易达成一致结论,难以规模化推进。
人工智能技术的迅速发展为辅助专家释读古文字带来了全新可能。以往的研究工作通常依据甲骨文字的孤立字形预测其对应的现代汉字。
然而,这类方法基本仅依托视觉信息,很少结合文本语境用法与传世文献进行交叉佐证。因此,尽管部分输出结果在字形层面看似合理,但却缺少语言学与史料层面的论证依据,能够给予专家的帮助十分有限。
这些挑战表明,亟需构建能够贯通破译各阶段、模拟专家推理过程的计算框架,并将其扩展于大规模语料分析,使相关推论建立在全面且可核查的证据基础之上。
工作亮点
团队提出首个完整模拟专家释读流程的人工智能系统AlphaOracle,将难以规模化、依赖个人经验的古文字考释流程,部分转化为可复核、可重复、可协作的计算框架。
AlphaOracle整合了大规模甲骨拓片、摹本、传世典籍和两万余篇相关研究,分析过程中产生的候选结果和证据来源都会被完整保留下来,最终汇集成一份可溯源和核查的辅助考释报告,可供专家逐项检验和讨论。
帮助学者从分散庞杂的材料中快速发现线索、汇集证据并比较不同解释,这一技术思路让人工智有潜力进入古文字研究的核心环节。
在86名领域专家和博士研究者参与的评估中,78.7%的参与者给予AlphaOracle较高评价,并认为其平均可节省约64%的分析时间。
研究方法
AlphaOracle沿着专家开展真实考释的思路,将甲骨拓片解析、字形演变分析、辞例检索与语境判断、传世文献和现代研究核验依次串联起来。
系统先从整字演变、部件构形和跨时代字形关系中提出多个候选释读,再到大规模甲骨材料中考察这些候选在不同卜辞中的分布和用法,最后从古代典籍与现代学术研究中寻找进一步的支持或质疑,形成完整的证据链。
AlphaOracle释读流程:先解析拓片,再依次完成形态分析、语境对齐和文献校验,最终形成可供专家核查的证据报告。
第一步:拓片解析
输入一张原始甲骨文拓片后,系统先完成字符检测、分类和句子重建。检测模型首先定位每个甲骨文字符,并通过一个分类器辨认已释字,并把仍有争议的未释字交给后续模块。
接着,系统把每一个字符看作节点,利用图神经网络并结合空间信息,同时判断句子的起点、终点和字符之间的连接关系,再据此恢复阅读顺序。最终拓片解析模型将甲骨拓片拆分为若干个带有阅读顺序、具备初步字符识别结果的独立语句。
第二步:形态分析
有了清晰的单字图像和读序,系统开始从历时演变与内部结构两个方向为未释字提出可能的若干个破译假设。
字形演变网络利用扩散模型模拟古代字形向后世形体的变化,并对多次生成结果进行识别和汇总;
部件演变网络拆解甲骨字形中的构件,并将其映射为汉字的IDS序列,根据部件的组合推测对应的汉字;
历史时期演变网络则把甲骨文、金文、战国文字、小篆和隶书等阶段放在同一条时间线上比较相似程度。
三个专家模型各自给出候选及概率,系统按照模型的可信程度加权,判断该字是否已有公认释读,再为未释字保留多个可能的破译答案和相应置信度。
第三步:语境对齐
形态分析给出的破译假设还要放回语句上下文中检验,并从其他相关拓片中寻找相似案例。
系统先从《甲骨文合集》、《甲骨文摹本大系》和《甲骨文校释总集》等数字化资料中依据图像信息和文本信息检索目标字符的全部已知用例,再用面向甲骨文训练的掩码语言模型分析前后搭配。
训练时,模型学习根据已知甲骨上下文补回被遮住的字;推理时,它一方面重新排列形态模块给出的多个候选,判断哪个放进句子最通顺,另一方面独立提出语义候选。
语境对齐还包含一个解释模型,经过监督微调和基于反馈的强化学习,用来汇总同一字在不同卜辞中的用法,并生成便于研究者核查的现代汉语说明。
第四步:文献佐证
经过字形与语境筛选的破译候选,随后将使用传世文献和现代研究论文进行进一步佐证。
系统所用资料包括25部古代传世文献和23,755篇权威现代研究,涵盖《说文解字》、先秦两汉典籍以及《古文字诂林》《甲骨文诂林》《甲骨文字林》等专业著作。
检索时,它会把异体字和近义词一并纳入查询,同时从文字语义和字形图像两条途径寻找相关材料。
不同文献的相关程度、资料权威性、文献类型和时代早晚都会影响证据权重,每条材料都保留书目信息和检索理由,便于研究者追查原文。
最后生成的综合报告依次呈现字形依据、语境用例和文献证据,指出当前支持度最高的读法及其可信度,也明确保留尚未解决的分歧。
总的来说,AlphaOracle会自己提出假设,并针对每一个假设收集相关证据,然后呈现给研究者。
整个过程系统只做少量必要的判断,但并不替代专家作出最终判断,其核心作用在于帮助研究者更高效地发现线索、核查证据和比较不同解释,并将最终的裁决权留给研究者。
实验结果与专家评估
甲骨文释读缺少公认的统一基准,因此论文把大问题拆成几个可测任务,并从组件性能和专家使用价值两方面评估AlphaOracle。
在字形分析实验中,研究团队采用「模拟未释字」设置,将88个训练阶段从未出现的已知字类作为测试集,AlphaOracle的Top-1准确率达到23.1%。
在语境分析中,系统从残缺卜辞中恢复被遮蔽文字的准确率为56.1%,并能以95.2%的准确率从字形分析给出的候选结果中选出更符合上下文的释读,分别高于最佳通用大模型基线的22.2%和65.4%。
在以现代汉语释义作为代理任务的综合解释评测中,AlphaOracle的BLEU、ROUGE和METEOR分别达到0.491、0.586和0.659。
需要说明的是,GPT-5、Gemini 2.5 Pro和
人类专家评估的具体调查结果
在专家实际使用评估中,86名来自甲骨文、人工智能及相关领域的专家和博士研究者匿名参与了系统评估。
其中78.7%的参与者认为系统「有帮助」或「非常有帮助」,并估计平均可节省64%的分析时间。在满分为5分的模块化评估中,拓片解析、字形分析、语境对齐和文献依据检索四个部分的平均得分分别为4.20、4.44、4.38和4.01。
文献检索环节随机抽取42个甲骨文字进行人工检查,命中率为90.2%,准确率为74.8%。这意味着系统会将大部分有价值的材料呈现出来,但其中仍会夹杂需要专家排除的文献资料。
对研究者而言,这减少了文献的翻检成本,而把节省时间更多留给证据的判断上。
论文还组织了一场盲评「人类竞技场」,由来自故宫博物馆、上海博物馆、中国社会科学院、清华大学、复旦大学、南京大学、吉林大学、郑州大学、河南大学、河南师范大学、首都师范大学、西南大学、中国海洋大学、甲骨文信息处理教育部重点实验室、及韩国、日本、美国相关学术团体的资深甲骨学者对上下文解释任务完成210次盲测。
结果显示AlphaOracle获得45.2%的最高偏好率,
对疑难字的具体释读
AlphaOracle针对「屯南307」拓片中,长期存在争议的甲骨文
(早期研究常把它释作「卒」),综合字形、辞例和文献材料,将其解释为「勞」的异体字,为其作为地名或族名的解释补充了证据。
此外,论文还报告了22个有争议异体字的消歧结果,部分分析已进入甲骨文权威学术数据库,展现出人工智能辅助专家高效考察争议文字、推进学术讨论的潜力。
总结
AlphaOracle通过模拟人类专家的研究方式,将甲骨文字形演变、辞例分布与文献材料被放进同一条证据链中,帮助研究者发现线索、寻找文献、核对材料,提高了甲骨文释读的效率。
同时,它为计算古文字研究打开了一条更接近真实实践的路径,机器不该只是端到端地、没有依据地给出一个最终答案,而是应该在研究者进行的每一步工作流程中提供可靠的证据辅助。
这样的思路同样可以延伸到其他古文字领域,为分散而庞杂的古文字研究建立更系统的AI辅助整理与研究方式。
古文字研究终究离不开人的判断。机器擅长从海量材料中迅速提出假设、完成检索、进行比对与归纳,学者则负责辨别证据的轻重、把握最终的决策。
未来更值得期待的,正是这样一种彼此配合的研究图景,人工智能拓展材料搜索的广度,人的学识守住学术判断的深度,让更多沉睡在甲骨与古文字中的历史信息被重新看见。
参考资料:https://doi.org/10.1016/j.xinn.2026.101462
本文来自微信公众号“新智元”,作者:ASI启示录;编辑:LRST,36氪经授权发布。















