当AI开始读圣训:一场关于真实性的技术长征

2019年,有一件事让研究圣训计算的学者们心里犯嘀咕。

那一年,Azmi等人发表了一篇综述,给圣训计算领域画了张地图。地图上密密麻麻标注着规则系统、传统机器学习、小型语料库、专门任务流水线。这些方法能做segmentation(文本切分)、能抽取传述者信息、能建本体、能做检索、能辅助真伪判断。

听起来还不错,对吧?

但这张地图有个致命的时间戳:它画的是transformer模型和生成式AI大爆发之前的世界。

圣训*:伊斯兰教先知穆罕默德的言行录,由一条条经过传述链传下来的记录构成,是仅次于《古兰经》的重要宗教文献。

几年过去,大语言模型来了。整个自然语言处理的游戏规则变了,评估标准变了,人们对"规模"和"表征能力"的期待也变了。圣训计算这个领域跟着变了,但变得很不均匀。有些任务像是突然开了窍,有些任务却依然卡在老地方,怎么都绕不过去。

这篇来自Greentech Apps Foundation和伦敦玛丽女王大学的论文,做的就是一件事:把这场技术变革掰开揉碎了看,告诉你哪些进步是真金白银,哪些只是在特定测试集上刷了个好看的分数。

现有综述为什么不够用

先说一个容易被忽略的问题:市面上不是没有关于圣训AI研究的综述,而是这些综述回答的问题不对。

作者列了一张表,把近年的几篇重要综述挨个点评了一遍。Luthfi等人2018年的综述聚焦数字圣训真伪验证,但完全停留在transformer出现之前。Azmi等人2019年的综述奠定了整个领域的技术基线,可它也没赶上后来的技术浪潮。Hakak等人2022年专注真伪验证的进展和挑战,但没有重新审视LLM给整个领域带来的冲击。Sulistio等人2024年的综述更像是机器学习技术清单,对哪个研究真正改变了这个领域缺乏深入判断。Azwar等人2025年的两篇综述,一篇做文献计量分析,一篇用PRISMA系统综述方法梳理趋势,但都停留在描述层面。

PRISMA*:一种系统综述和荟萃分析的国际报告规范,用来保证文献筛选过程透明可追溯。

这里有个很关键的判断标准:文献计量学的证据不等于技术成熟的证据。

发表的论文数量在涨,不代表核心问题真的被解决了。这就好比统计一个城市新开了多少家餐馆,这个数字本身说明不了这些餐馆里到底有没有好吃的菜。你得亲自去尝一尝,才知道哪家是真功夫,哪家是徒有其表。

这篇论文想做的,就是那个"亲自尝一尝"的角色。它不满足于罗列有哪些应用场景,而是要问:这个方法在干净的测试集上表现好,换一批更乱的真实数据它还行吗?这个数据集能不能被别人拿去复用?这个任务解决的是学者真正头疼的问题,还是只是一个替代性的技术指标?

审查是怎么做的

作者没有简单地把所有论文扔进一个池子里评分,而是设计了一套结构化的评估维度。

这套框架从六个角度审视每一篇论文:语料库是不是真实多样的,还是局限在几本经典典籍;评估设置是端到端的工作流,还是简化的标注任务;有没有测试过跨语料库的迁移能力;数据代码是不是公开可复现的;有没有请专家来验证结果;这个任务距离真实的学术工作流程有多远。

这套评估体系背后藏着一个更深的判断标准:光看准确率、F1值这类数字是不够的,因为不同论文的任务定义、数据集、评价指标千差万别,硬凑到一起比较反而会掩盖真相。所以作者没有给论文打一个总分排名,而是坚持在各自的任务语境里理解每一个数字。

这就好比评价不同学科的考试成绩,你不能拿数学的100分和语文的100分简单相加求平均,因为它们衡量的根本不是同一件事。硬要凑出一个综合分,反而会让人误以为存在某种客观的高低之分,实际上只是自欺欺人。

审查团队最初收集了42篇文献,经过范围精修后留下32篇核心文献,时间跨度覆盖了2025年末到2026年初的迭代检索。检索平台包括谷歌学术、Scopus、ACL文献库、SpringerLink、ScienceDirect、arXiv,以及一些专门的领域资源库。

isnad*:圣训中的传述链,记录一条圣训是经过谁传给谁,一代一代传下来的完整链条。

matn*:圣训报告的具体内容本身,也就是先知说了什么、做了什么的实质记述。

论文还特别强调了一个三层框架,用来理解整个领域的技术布局。第一层是isnad-matn分离,也就是把传述链和内容本身切分开来的基础工作。第二层涉及传述者身份分析、来源验证、问答系统这些更复杂的任务。第三层则关乎知识图谱构建、语料库大规模处理这样的基础设施级工程。

这个三层框架帮我们理解了一件很重要的事:为什么进步这么不均衡。第一层任务受益于清晰的任务定义和可复用的标注数据,进展最快。第二层和第三层则严重依赖结构化知识整合和跨文档链接,需要更多专家介入才能真正往前走。

老方法和新方法之间没有简单的取代关系

你可能以为,故事应该是这样的:老的规则系统和传统机器学习方法逐渐被transformer取代,transformer又被大语言模型取代,一代更比一代强。

事实并非如此。

在稳定的、边界清晰的低层任务上,老的符号方法和混合方法依然能拿出最扎实的证据。真正被transformer和LLM改变的,是整个领域的野心、工作流设计和证据标准。

这就好比问"锤子有没有被电钻淘汰"。如果你只是要钉一颗小钉子,锤子反而更快更准更省事;但如果你要在混凝土墙上打洞、要处理成百上千个不同规格的孔位,电钻带来的就不只是效率提升,而是从根本上改变了你能承接什么样的工程规模。圣训计算领域发生的正是后者:LLM没有让老方法变得毫无用处,而是让原本不可能做的事情变得可能。

具体来说,LLM带来了三个层面的变化。

第一,规模变了。像Asgari-Bidhendi等人2025年提出的Rezwan系统,能够处理超过120万条圣训narration,并配套多层次的知识增强、多语言接入和专家复核。这在过去以小型语料库为核心的手工作坊模式下,是完全不现实的。

narration*:一条具体的圣训记录,包括它的传述链和内容。

第二,工作流设计变了。创新的单位不再是一个孤立的分类器,而是一整套编排好的流水线,包含OCR修复、文本切分、检索、来源核查、简化改写、语义标注、人工验证等环节。

OCR*:光学字符识别技术,用来把扫描图片或古籍照片里的文字转换成可编辑的电子文本。

第三,什么才算"令人信服的证据"这个标准变了。在LLM之前的时代,一个在精心整理的语料库上跑出的漂亮数字,常常就能撑起整篇论文的核心结论。现在这已经不够有说服力了。读者想知道的是:这个系统在结构混乱的真实数据上表现如何,输出的内容能不能追溯到权威原始来源,专家是否认为它犯的错误可以接受,整个工作流是否可靠到值得信任。

论文特别提醒读者,LLM没有改变的东西同样重要。它没有解决传述者身份消歧问题,没有让文本预处理变得无关紧要,没有消除对显式传记和文献学证据的需求,也没有抹平流畅的文本生成和真正可靠的圣训学术研究之间的鸿沟。所以作者用"混合阶段"来形容当前的技术格局,而不是简单地说"LLM时代来了"。

数据基础设施变成了研究本身

有一个变化值得单独拿出来说:数据工作从模型的配角,变成了研究的主角。

早期论文往往把数据集当作模型训练的原料,用完即弃。现在的研究越来越把语料库、标注体系、基准测试资产本身当作独立的学术贡献。

Altammami等人2019年和2020年的工作帮助建立起可复用的标注资源体系,覆盖切分任务和双语圣训处理。Mghari等人2022年更进一步,推出了名为Sanadset 650K的数据集,涵盖926本典籍,把之前只依赖典籍数据造成的结构假设问题彻底暴露出来。开放基础设施如OpenITI也进一步拓宽了整个文本处理生态。

这个变化改变了我们对整个领域的判断方式。当语料库变得更大更多样,我们就很难再把六大圣训典籍当成整个圣训文献世界的代表了。Sanadset的数据显示,大规模narration数据里有相当一部分根本不符合过去实验中默认的结构假设。

这提示我们,过去部分所谓的"进步",其实只是相对于特别整齐的语料库而言的局部进步。

但更多数据不等于更干净的证据。Mahmoud等人2022年做了一个很有价值的传述者消歧数据集,却也留下了一个耐人寻味的对比:模型在人工合成的传述链上验证效果很好,换成真实测试数据表现就明显下滑了。

这个反差就像用模拟考试题反复训练学生,考出来的分数确实节节攀升,但一到真正的高考现场,题目稍微换个说法学生就懵了。合成数据能推动任务被更清晰地定义出来,却掩盖不了从合成数据到真实数据之间那道迁移鸿沟。

如果研究者只满足于合成数据上的高分而不去做真实数据测试,他们很可能会误判一个任务已经"解决",实际上只是在一个人造的、比现实简单得多的环境里表现良好。这不是苛责,而是提醒:数据基础设施建设得越好,越需要诚实地报告它和真实世界之间的差距。

第一层任务跑得最快,但评估本身也在进化

在整个三层框架里,进展最明显的是第一层,也就是isnad-matn分离和相关的传述链抽取任务。

Altammami等人2019年、2020年,以及Tarmom等人2020年的两篇论文都显示,混合方法、基于压缩的方法、以及新型分类器在稳定的任务环境下都能表现出色。作者没有把这解读成"某个架构彻底赢了",而是认为这说明切分任务本身变成了一个更可复现的基准测试领域。

真正更深层的进步,来自评估方式本身变得更成熟了。Muther和Smith在2020年的两篇论文里指出,精确的边界划定和传述链抽取并不总是客观清晰的,尤其是在篇幅较长的古典阿拉伯语文本里。

这一点很关键,因为它改变了我们该怎么解读性能数字。一个系统可能已经准确识别出了正确的区域,却在某个连人类专家都会有分歧的边界点上"犯了错"。也就是说,近年的工作不只是把分数刷高了,更重要的是把评估这件事本身变得不那么天真了。

即便如此,这个领域也还没到收工的地步。AlShuhayeb等人2025年的研究表明,圣训领域的阿拉伯语分词依然比很多通用NLP流水线预设的要难得多。

这是一个很实在的提醒:LLM时代的乐观情绪容易掩盖底层语言处理的脆弱性。如果分词和形态学切分这一步都做不稳,那再往上一层的成果无论看起来多么亮眼,都是建在沙地上的。

第二层任务变宽了,但离成熟还有距离

圣训计算领域现在不再只围绕文本切分或者简单的真伪二分类做文章。它现在包括传述者消歧、来源验证、问答系统、知识表示等一整个任务族。

作者认为这种广度扩张本身就是有意义的进步。但广度不等于成熟度。

Syed等人2019年的工作把领域推向了更接近文献学错误检测和引用核实的方向,而不只是通用文本分类,这一点很重要,但它仍然聚焦在一个具体的纠错性问题上,还没有形成完整的真伪判断框架。Abdi等人2020年展示了语言学知识如何帮助圣训问答系统,但系统运行的环境比真实的学术检索场景要受控得多。Wiharja等人2022年和Kamran等人2023年推动领域走向基于图谱的语义访问,但这些系统的能力上限,取决于他们构建的知识库本身的覆盖面和质量。

所以作者用"在压力下变得多元化"来形容第二层任务的现状,而不是说它已经"解决"或者"收敛"了。任务更多了,建模策略更丰富了,形式化程度更高了,但跨语料库的鲁棒性、跨传记传统的实体链接、能支撑"整体进步"这种说法的基准标准,依然是薄弱环节。

第三层从零散工具走向了流水线级的基础设施

早期的图谱构建和跨文档工作,比如Azmi和Bin Badia 2010年的研究,展示了技术上的可能性,但规模始终有限。相比之下,现在的研究越来越倾向于把圣训计算构建成一整套端到端环境,涵盖OCR修复、切分、验证、语义标注、知识图谱构建、多语言接入、专家审核。

Asgari-Bidhendi等人2025年的Rezwan系统是这个转变最清晰的体现之一。它的重要性不只在于技术本身,而在于它把大规模圣训内容增强重新定义为一个研究基础设施问题,而不是单一任务的基准测试。与此同时,Mubarak等人2025年提出的grounded评估框架表明,LLM时代也在推动这个领域更明确地检视幻觉问题、来源忠实度和检索可靠性。

grounded*:指AI系统的输出内容能够被追溯并核实到权威原始文献,而不是凭空生成或编造的说法。

hallucination*:大语言模型自信地生成看似合理实则错误或虚构信息的现象,在宗教文献这样对准确性要求极高的领域尤其危险。

最新的研究进一步印证了这个方向。Abbas等人2026年的工作转向了有约束的多智能体伊斯兰问答系统,而不是无约束的自由生成。这说明整个领域的走向,不是朝着纯生成式系统前进,而是朝着更加流水线化、更加有据可循的方向前进。这个区别很关键,因为对圣训计算来说,流畅但无法溯源到权威证据的输出是没有价值的。

四个还没填上的大坑

论文用了相当大的篇幅,梳理出四个领域内至今没有被真正解决的结构性缺口。

第一个坑是语料库过度集中在六大圣训典籍上。这些典籍编校精良、数字化程度高、结构规整,做实验很方便,但这份便利也塑造了整个领域的盲区。圣训学术研究的疆域远远大于六大典籍,还包括按传述者组织的musnad、按主题编排的musannaf、按人名或师承排列的mu'jam、小册子式的ajza'合集,以及大量部分数字化或者OCR质量堪忧的文本,这些内容基本被排除在了主流基准测试之外。

musnad*:一种按传述者(通常是先知的门徒)组织编排的圣训集。

musannaf*:一种按主题或法律章节分类编排的圣训汇编。

Mghari等人的Sanadset扩展到926本书,Asgari-Bidhendi等人证明更大规模、更多样化的资料库如今在技术上是可处理的,但整个领域的基准测试文化依然落后于这一传统实际的文本多样性。

这不只是"公平对待冷门文献"的问题,更是科学有效性的问题。一个主要从结构规整的典籍中学习出来的系统,很容易高估自己的可迁移性,低估OCR和元数据处理上的困难,把编校干净和任务真正成熟这两件事搞混。

第二个坑是圣训学术的解释性层面几乎无人问津。大多数圣训NLP论文止步于切分、传述者处理、分类、检索、来源验证,很少触及注释、变体报告的调和、法律含义的讨论、词汇和语境难题的解决这些注解层面的工作。

sharh*:对圣训文本的注释和讲解,用来阐明词义、背景或诠释。

takhrij*:来源追溯,把某条圣训在不同典籍中的出处、传述链变体逐一核实标注的学术工作。

fiqh al-hadith*:从圣训中推导出的法律和教法诠释分析。

这个缺口之所以重要,是因为圣训学术从来不只是"传述链加正文"这么简单。学者常常依赖注释、交叉引用、真伪等级判定、叙述背景讨论、法学诠释来判断一条narration到底意味着什么、该怎么用。在《古兰经》一侧,已经出现了连接经文与tafsir(经注)的问答和检索资源,但圣训这边至今没有针对主要注释传统的对等资源。

这意味着未来需要构建能把基础narration和注释段落、诠释性释义、真伪等级论证、法学推论对齐的数据集,以及能区分"这是基础报告本身""这是注释者的转述""这是从中得出的法律推论""这是特定教法学派施加的限制"这几层含义的模型。少了这一层,圣训计算就只是文本处理很勤快,学术含金量却很薄。

第三个坑是圣训和更广阔的伊斯兰知识网络之间连接薄弱。圣训隶属于一个更大的伊斯兰学术体系,它的诠释常常取决于古兰经语境、先知传记、传述者传记、经注、法学章节、后世法学综合成果。但大多数计算研究依然把圣训当成一个孤立的文本集合来处理。

Altammami等人的多篇论文、Alnefaie等人2023年、Al-Azani等人2025年的工作显示,连接古兰经和圣训、构建古兰经问答与检索系统在技术上是可行的,Nakhlah等人2023年的QASiNa显示先知传记也能进入计算问答领域。但这些努力大多是两两配对的、任务特定的,还没有真正融入圣训计算的核心。

真正的缺口不是"完全没有跨来源工作",而是缺少一个成熟的多跳研究框架,能把经文、圣训、先知传记事件、注释、法学章节、传述者传记、后世学术应用都串联进一个可检视的证据图谱里。这样的框架才能更真实地反映伊斯兰学术是如何推导含义和裁决的。

第四个坑,也是最贴近现实应用的一个:圣训计算和当代教法之间的桥梁还很不完善。伊斯兰问答、遗产继承推理、教法裁决(fatwa)生成这些新兴系统显示,应用层的法学工作已经在计算化的路上迈进了,但圣训计算研究和这股浪潮的连接还只是局部的。

fatwa*:伊斯兰教法学者针对具体问题作出的宗教法律裁决意见。

madhhab*:伊斯兰教法学派,不同学派对证据的权衡方式和方法论各有不同。

这个断裂之所以重要,是因为教法几乎从不孤立地依赖某一条圣训。它依赖证据的筛选、真伪评估、表面矛盾narration的调和、法学诠释、学派特定的方法论过滤,以及和古兰经及历史语境证据的联动。一个只会返回单条narration、却没有溯源信息、注释、变体版本或法学框架的圣训处理系统,还算不上一个严肃的教法辅助工具。

论文的立场很明确:圣训计算在当代教法中该扮演的角色不是自动裁决,而是证据支持。未来的系统应该帮助学者、研究者和高阶学生检索相关narration,呈现平行或变体报告,把它们和古兰经及先知传记的语境关联起来,揭示相关注释和溯源信息,标明不同教法学派用法上的分歧所在,并且呈现不确定性而不是掩盖它。

评估这件事本身,现在也成了研究对象

有一个细节特别值得单拎出来讲:近期一些论文开始主动邀请伊斯兰学专家参与验证,而不只是靠自动化指标打分。

Altammami2025年的工作明确请了一位伊斯兰研究专家来核验文本简化的输出结果。Asgari-Bidhendi等人2025年用六位领域专家来评估他们那套大规模LLM辅助流水线,而不只是依赖自动化指标。Mubarak等人2025年干脆把幻觉检测和纠错设为明确的评估目标,对照权威的古兰经和圣训原文进行核实。

这几篇论文放在一起看,能看出一种缓慢但清晰的转向:从"模型中心"的评价方式,转向"专家、来源、grounding都算数"的评价方式。

Elmahjub 2023年的伊斯兰AI伦理研究主张多元化的伦理评价基准,而不是单纯追求技术指标最优;Nawi等人2021年的调查显示,穆斯林专家普遍认为需要以maqasid al-shari'ah(伊斯兰法的高阶目标)为基础建立监管框架。

maqasid al-shari'ah*:伊斯兰法学中关于法律最终目标和精神实质的理论体系,常用来指导具体法律条文之外的原则性判断。

这些不是圣训专属的论文,但它们解释了为什么专家对齐的评估在宗教文本领域不是可有可无的加分项。作者也提醒读者,不要把某一篇学者视角的论文当成"整个伊斯兰学界"的代言。目前这类专家视角文献大多是概念性、规范性的,或者基于小规模的专家样本,还没能形成横跨不同教法学派、机构和技术素养水平的广泛比较证据。

接下来该往哪走

论文最后给出了一个五个层面的研究议程,不是零散的建议清单,而是一组互相咬合的研究方向。

第一是基准测试改革。共享基准测试需要从典籍内部测试,走向跨语料库迁移测试、结构不规则的narration、冷门典籍、含OCR噪声的手稿类材料。这一步要求未来的研究更清楚地报告语料库边界、预处理假设、数据代码开放程度、跨领域测试策略和失败模式。

第二是知识基础设施和长尾语料库建设。这个领域需要一场超越六大典籍、覆盖musnad、musannaf、mu'jam、传记文献、注释文献的长尾语料库工程。这不只是科学上说得通,现实中很多塑造学术走向的文本至今数字化程度低、编校不统一、跨版本对齐困难。

第三是面向学术的建模。传述者身份消歧还需要显式的传记基础设施,包括紧密链接的传记资源、实体链接数据集、时间和地理约束条件。同时,注释感知的圣训计算应该成为一个实质性的研究方向,而不是边缘性的理想。

第四是整合的伊斯兰知识系统和面向教法的支持。未来的系统应该把圣训、古兰经、先知传记、经注、法学章节、传述者传记连接进可检视的证据网络,而不是各自为营的信息孤岛。

第五是以专家为中心的治理和评估。在这个领域,溯源、忠实的引用、不确定性报告、合格学者的角色,本身就是系统质量的一部分,而不是外围的附加考量。

论文的最终判断是策略性的,也是保守的:圣训计算不是被LLM一举颠覆的领域,而是进入了一个混合阶段,结构化资源、神经网络模型、检索技术、知识图谱和专家监督需要共同发挥作用。很多眼下的头条式进展,依然处于"有希望但尚未确证"的阶段,尤其是当它们依赖的是狭窄语料库、合成数据、薄弱基线或者无法互相比较的评估设置时。

写在后面

读完这篇论文,最让我在意的一个细节,是Mahmoud等人2022年那个传述者消歧数据集的对比结果:合成数据上表现优秀,真实数据上明显下滑。这不是个例,而是一种提醒,任何声称"用大规模合成数据解决了某个古老学术难题"的论文,都值得多问一句,它有没有在真实、混乱、不完美的数据上验证过。

另一个触动我的地方,是论文反复强调的"证据支持"而非"自动裁决"这个定位。这其实是一种很克制的技术伦理立场,在一个宗教权威高度依赖人的学问传承的领域里,AI最合适的位置不是替代裁判,而是给裁判递上更完整的卷宗。这个思路其实可以推广到很多其他专业领域,医疗诊断、法律咨询,判断的权力和责任该留给谁,值得每个做AI系统设计的人认真想一想。

还没解决的问题是,当圣训计算真的把古兰经、圣训、先知传记、注释、教法这些资源全部打通成一张证据网络的那一天,普通的穆斯林学生和研究者会怎么使用它?这会不会催生一种新的学习方式,让原本需要多年师承才能掌握的跨文献比对能力,变成一种可以借助工具快速上手的技能?这既是机会,也是一个需要谨慎对待的问题。

Q&A

Q1:圣训计算研究里最核心的三层任务框架是什么?

A:第一层是isnad-matn分离,把传述链和圣训内容切分开来。第二层涉及传述者消歧、来源验证、问答系统等更复杂任务。第三层是知识图谱构建和大规模语料库处理的基础设施工程。第一层进展最快,第二三层依赖更多结构化知识整合和专家介入。

Q2:为什么这篇综述认为发表论文数量多不等于技术真正成熟?

A:因为文献计量学统计的是发表数量和主题聚类,不能判断某项成果是否只在特定基准测试集上有效,数据集能否被复用,任务是否触及真正的学术痛点。作者主张必须做论文级的批判性评估,而不只是数数量。

Q3:为什么圣训计算领域至今很少涉及注释和教法层面的内容?

A:因为大多数研究止步于文本切分、传述者处理、分类和检索这些基础层面,很少触及注释、变体调和、法律诠释这些更深的解释性工作。这需要构建能把基础圣训与注释、真伪等级论证、法学推论对齐的新数据集和模型。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询