大模型当红,国家数据局为什么反而把“本体、知识图谱”专门拎出来说

摘要:国家数据局《行业高质量数据集建设实施方案》头一回把知识库、知识图谱、本体并列写进国家级行动清单。这不止多三个名词,而是给"语义地基"发了张国家级入场券。
从"信息化"到"图谱化":中医药十五五规划,给知识图谱赛道发了一张国家级船票
▍ 一、一个被忽略的信号:知识图谱和本体,进了国家清单
大模型火了快三年,圈里一直有个心照不宣的担心:知识图谱这种"老技术",是不是要被大语言模型吞掉了?前两年融资会上,但凡讲知识图谱,投资人总爱问一句"这玩意和大模型什么关系"。
一份刚落地的国家级文件,给这个问题泼了盆冷水,也递了把椅子。
六月三日,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(国数科基〔2026〕25号)。文件里有一句话,值得每个做知识图谱、做本体工程的人划重点——"加强知识库、知识图谱、本体等数据集建设"。
注意,这不是某个专家的个人观点,也不是某家厂商的白皮书,而是写进国家数据局正式行动方案、要"认真组织实施"的条款。知识库、知识图谱、本体,三个词并列排在一起,和文本、代码、图像、音频、视频这些"常规数据形态"放在同一段里被点名。
这等于是国家层面头一回把"语义地基"这几样东西,从"技术选配项"提到了"人工智能基建的必选项"。这个信号,比任何行业大会的主题演讲都实在。
▍ 二、先说清楚:什么是"行业高质量数据集"
要把这件事讲透,得先弄明白文件到底在推什么。
文件给了一个明确定义:行业高质量数据集,是"经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据的集合"。它分两类——行业通识数据集和行业专识数据集。前者是各行各业都通用的基础数据,后者是某个垂直领域(比如金融风控、工业质检、医疗诊断)的专门知识。
为什么国家现在下力气推这个?文件开篇讲得很直白:这是推动"人工智能+"落地千行百业的"基础性、关键性资源"。大模型再聪明,也得吃数据。没有高质量、经过加工、能直接喂给模型的数据,再好的算法也就是个空壳。
文件还画了一个叫"数据飞轮"的循环:靠场景拉来数据,靠数据喂出模型,靠模型反哺应用,再靠应用创造新价值。这是个挺实在的逻辑——不是为建数据而建数据,而是让数据在"用"的过程中越滚越大、越用越准。
到2028年底,文件定了个硬目标:建成一批覆盖重点领域、经过应用验证的行业高质量数据集,打造一批典型应用场景,培育一批创新型数据企业和专业人才,形成一批建设工具和标准。四年时间,从"有"到"好用",这个节奏不慢。
这里插一句"通识"和"专识"的区别,因为它决定了知识图谱的机会在哪。通识数据集,是各行各业都能用的通用语料,比如通用中文网页、开源代码库;专识数据集,是某个垂直领域才有的硬核知识,比如某类疾病的诊疗路径、某条产线的设备参数。大模型靠通识起家,但一到专业场景,缺的恰恰是专识。而专识,往往就藏在行业图谱和领域本体里——这正好是知识图谱的主场。
▍ 三、六个专项行动,知识图谱卡在哪个位置
文件的主线,是六个专项行动:强基扩容、标注攻坚、提质增效、应用落地、管理服务、价值释放。我们顺着这条线,看知识图谱和本体到底被安排在哪一环。
强基扩容,是拓宽数据供给、丰富数据形态。文件在这部分明确写了要"加强知识库、知识图谱、本体等数据集建设",还要加快复杂任务规划、长程推理、人机交互、决策执行这类数据集的建设,专门点名要支撑智能体这类新型应用形态。这一条,基本把知识图谱的正当性钉死了——它服务的不是旧时代的检索问答,而是当下最火的智能体。
标注攻坚,是把专家知识和经验注进训练数据。文件说要发展"专家型数据标注",让领域专家深度参与指令微调、强化学习阶段的知识标注,生产"领域知识、逻辑推理等高质量数据集"。做本体的朋友一看就懂:本体工程本质就是在干"给数据标一套可复用的语义结构"这件事,它天然就是高质量标注的上游。
提质增效,提出了一个关键概念——人工智能就绪(AI-Ready)。文件要求数据集符合"结构完整性、内容多样性、标注准确性、模型适配性"四方面质量标准。这四点,恰恰是知识图谱最擅长补足的地方:图结构保证完整性,多源关联保证多样性,本体约束保证标注准确,语义对齐保证模型好用。
把这几条连起来看,文件对知识图谱的定位不是"锦上添花",而是"打底"。强基扩容负责把它建出来,标注攻坚负责把它标标准,提质增效负责让它达标——三步下来,图谱从一门手艺,变成了可被国家认证的基础设施。
后面三个行动更多是流通、治理、商业化层面,知识图谱在其中是"被用"和"被管"的角色,但地基已经打好。
▍ 四、条款三逐字拆:为什么是"知识库、知识图谱、本体"三件套
回到那句最关键的话——"加强知识库、知识图谱、本体等数据集建设"。这三个词不是随便并列的,它们对应着人工智能从"能聊"到"靠谱"的三层递进。
知识库,是最外层。它把零散的事实、规则、文档攒成一个可被检索和调用的知识池。大语言模型接上知识库,就能少胡说、多引证,这是现在最常见的检索增强生成做法。
知识图谱,是中间层。它不满足于"存事实",而是把事实之间的"关系"也显式建出来——谁是谁的上游、哪个症状和哪种疾病相关、这笔交易和那笔交易是不是同一个实控人。关系一显式,机器就能做推理:从已知的A和B,推出不知道的C。这对金融反欺诈、医疗鉴别诊断、工业故障溯源这类强推理场景,是刚需。
本体,是最底层。它是知识图谱的"施工图"和"字典"——规定这个领域里有哪些核心概念、概念之间允许什么关系、每个字段该用什么类型。没有本体,知识图谱就是一堆没有约束的节点和边,越多越乱。本体决定了图谱能不能跨系统对齐、能不能被机器稳定理解。
文件把这三样放在一句话里,等于承认了一件事:要让人工智能真正"懂事",光有文本和向量不够,还得有人把世界的"结构"和"语义"教给机器。这不是新发现,但由国家级行动方案说出来,分量完全不同。
▍ 五、我的判断:这不是多三个名词,是"语义地基"转正
我更愿意把这次点名,理解成"语义地基"这个词,从行业黑话变成了国家基建用语。
过去十几年,知识图谱和本体在国内一直有点尴尬:技术圈叫好,落地却总差一口气。做图谱的公司不少,但真正做到"全行业复用、跨企业对齐"的屈指可数。原因很简单——建图谱贵、养图谱难、图谱和标准绑定弱,企业自己建自己的,谁也不认谁的。
文件这次的思路,恰好对准了这个痛点。它不只说"要加强建设",还配套说了标准和测评:要研制高质量数据集的"格式、类型、标注、质量测评"国家标准,要实现"一次测评、全国互认"。本体和知识图谱一旦有了国家标准托底,跨系统的语义对齐就不再是每家各自为政,而是可以像电力接口一样互通。
举个实在的例子:两家银行各自建客户图谱,一家把企业实控人叫"最终受益人",另一家叫"实际控制方",字段名不同、含义却一样,真要合并排查关联交易,得靠人一点点对齐。有了统一本体作底,这种对齐可以事先约定好,省下大量人工。国家把本体写进方案,就是在给这类"接口标准"铺路。
更要紧的是,文件把"语义地基"和当下最热的两个方向绑在了一起——智能体和具身智能。条款三明说,加强知识库、知识图谱、本体建设,是为了支撑智能体这类新型应用形态。智能体要能规划、能推理、能决策,光靠大模型现编是不够的,背后得有一张可查、可推、可信的知识网。国家把这张网写进方案,等于给做语义技术的公司发了张长期饭票。
▍ 六、行业观察:知识图谱过去为什么"叫好不叫座"
讲完利好,也得说点实话。知识图谱不是今天才被看好的,它"叫好不叫座"的毛病,业内自己心里有数。
第一道坎是成本。建一张像样的行业图谱,要领域专家、数据工程师、图算法工程师一起上,周期以年计。很多企业试了半年,发现图谱还没建完,业务方向已经变了。
第二道坎是维护。图谱不是建好就完事,它是活的,业务数据天天变,图谱得跟着变。不少项目的图谱建成后三个月就和实际数据脱节,慢慢成了摆设。
第三道坎是大模型带来的身份焦虑。大模型靠海量文本预训练,就能答对不少以前要靠图谱才能答的问题,于是有人喊"图谱已死"。这话当然夸张,但它戳中了一个真问题:图谱必须找到和大模型协作的位子,而不是和它抢饭碗。
国家这次的方案,其实暗含了对这三道坎的回应:用"专家型标注"和"人机协同"压建设成本,用"全生命周期管理"和"国家数据集管理服务系统"解决维护难题,用"让图谱撑起智能体"重新定义图谱的价值——它不是被替代,而是被重新定位成智能体的"长期记忆和推理骨架"。
▍ 七、谁先受益:一张政策红利地图
文件点名了二十个重点领域,我挑几个和语义技术最对味的说说。
金融服务排在前列。银行的风控、反欺诈、反洗钱,核心是一道关系推理题——一笔可疑交易背后有没有隐藏的关联账户,图谱比规则引擎看得清。文件鼓励"链主单位面向行业开放数据集",金融机构如果带头把风控知识图谱开放成高质量数据集,上下游的中小机构都能借力。
医疗卫生是知识图谱的老根据地。临床指南、药品相互作用、疾病谱系,这些高度结构化的医学知识,天生适合用本体和图谱组织。文件把医疗卫生列为重点领域,对做医疗知识图谱的团队是实打实的好消息。
工业制造、城市治理、应急管理这几个领域,设备拓扑、城市部件关系、灾情传导链,全是可以显式建模的"关系网"。文件鼓励"公共数据与行业数据融合利用",这类数据一旦开放,图谱的用武之地一下就宽了。
还有个容易被忽略的受益方——数据标注和本体工程服务商。文件要大搞"专家型数据标注",而本体设计本来就是最专业的"语义标注"。会画本体、会建标准的人,接下来几年会很抢手。
还有个容易被忽略的出口——数据交易所。文件鼓励数据集在交易所挂牌,发展订阅、定制、接口调用多种形态,还提到探索以词元(Token)为基础的可定价价值体系。图谱一旦做成标准、高质量、可复用的数据集,就能像数据产品一样流通变现,不再只是企业内的一笔研发费用。这对做语义服务的团队,是个从"项目制"走向"产品制"的机会。
▍ 八、把丑话说前头:知识图谱落地的三道坎还在
政策是风向,不是魔法。文件自己也在保障措施里提醒:"避免一哄而上,防止同质化、低水平重复建设。"这句话值得每个想蹭这波红利的人读三遍。
同质化风险是真实的。当年知识图谱热的时候,十家公司九个做"通用图谱平台",能跑出来的没几家。这次如果又是大家一窝蜂建"行业知识图谱",没有真场景、真数据、真标准,结果大概率还是一地鸡毛。
标准落地的节奏也得看。文件说要研制国家标准、实现"一次测评、全国互认",但标准从立项到贯标往往要两三年。想靠政策立刻变现的,可能要失望。
还有数据权属这道老题。文件提到要落实数据"三权分置"、完善训练阶段数据使用规则,方向对,但具体怎么分、怎么授权,还在探索。知识图谱要跨企业对齐,得先解决"我的数据凭什么进你的图谱"这个问题。政策给了方向,落地还得靠具体的授权和收益分配机制。
▍ 九、往前看:知识图谱和大模型怎么相处
我最看好的一个趋势,是知识图谱和大模型从"谁取代谁"变成"谁托住谁"。
方向已经很清楚了:大模型负责理解和生成,知识图谱负责约束和推理,两者叠在一起,就是现在很火的检索增强生成、图谱增强生成的路子。大模型从图谱里取结构化的事实和关系,图谱借大模型把非结构化文本自动变成节点和边——各取所长。
举个医疗场景:医生问"这两种药能不能同服",纯大模型可能凭语感瞎编,接了药典知识图谱后,它能顺着"药物—代谢酶—相互作用"这条边,给出有据可查的推理链,甚至标出证据出处。这种"能查、能推、能溯源"的能力,正是高质量专识数据集(也就是图谱和本体)的不可替代之处。
文件里那句"加强知识库、知识图谱、本体等数据集建设,加快复杂任务规划、长程推理……数据集建设",说的就是这套组合。长程推理、复杂规划,恰恰是大模型单干容易翻车的地方,而图谱能给它们一条可追、可查、可纠的推理链。
本号判断:未来三年,最值钱的可能不是"又会建图谱又会训模型"的某一项功夫,而是能把两者缝在一起的系统工程能力。谁先把"图谱增强的智能体"在金融、医疗、工业里跑出可复制的样板,谁就吃下了这波政策的头啖汤。
▍ 十、横向坐标:这次和以往政策有什么不同
把这份方案和之前的数据政策放一起看,知识图谱的地位变化很明显。
"数据二十条"解决的是数据"归谁、怎么流通"的产权问题,那时候讲的是要素化,还没细到"数据集长什么样"。
"数据要素×"行动开始讲行业落地,但重心在场景和乘数效应,对数据内部的"语义结构"着墨不多。
"可信数据空间"强调的是跨主体可信流通的技术与机制,解决的是"敢不敢共享"。
到了这份《实施方案》,国家第一次把"数据集怎么才算高质量"讲到了语义层——明确要建知识库、知识图谱、本体,明确要人工智能就绪、要标准、要测评互认。从"产权"到"流通"再到"语义质量",政策视线一层层沉到了数据的内部构造。知识图谱和本体,正是这一层的承重墙。
▍ 十一、写在尾声
一份二十五号文,把知识库、知识图谱、本体这三个词,安静地写进了国家行动清单。没敲锣,没打鼓,但做语义技术的人应该读出里面的分量——它意味着"让机器真正理解世界的结构"这件事,已经从学术理想变成了国家基建的一部分。
对从业者来说,接下来的关键不是再争论图谱有没有用,而是能不能借这波政策的东风,把过去"建得起、养不住"的老问题,用标准、用工具、用和大模型的协作真正解决掉。风来了,但只有把地基打实的人,才站得稳。政策能指明方向,却替不了真功夫——图谱建得准不准、本体画得对不对、和大模型缝得顺不顺,终究要回到一行行数据和一次次业务里去检验。机会从来不缺,缺的是把口号落成系统的人。

往期推荐


三层本体&图谱驱动的医药企业级新一代AI知识平台

Palantir的真正秘密武器——本体论(Ontology)

本体论、知识图谱与大模型融合技术研讨会圆满落幕:产学研共探AI融合新路径

本体论Ontology:让企业级AI大模型真正有效运作的隐藏层

大语言模型时代,本体论还有用吗?

本体论神经符号架构如何破解企业AI幻觉难题?——构建可信赖的智能体Agent系统

超越通用大模型,动态本体重新定义企业知识工程 - Stardog

本体论:让AI真正听懂你的业务语言

ONTOKG- 知识图谱构建新范式:本体导向与内在-关系路由机制

Elsevier旗下SciBite的本体论赋能制药研发:AI与科学专业知识Ontology的完美协同

用LLM打造会自我进化的下一代个人AI知识库及本体价值 - OpenAI联创Karpathy

本体论与3DI:从解释现实到证明真实

AI时代的医药研发专家的一天:本体论驱动的知识引擎如何重塑医药行业超级个体和前沿组织形态

大模型时代本体论Ontology驱动的AI知识引擎助力企业智能决策系统的未来进化-一篇献给企业董事会和CIO的深度思考(第一篇)

智能体AI究竟是什么?本体论能否为其赋能?以生物医药研发为例详细解析

诺华Data42平台:利用Palantir本体论驱动的AIP重塑药物发现的未来

诺和诺德数字化转型之路:本体论Ontology驱动的数据管理革新

AI Agent的认知架构:为什么AI智能体需要本体论和知识图谱

Palantir 会是下一个 Oracle 吗?Ontology本体论重塑制药行业的AI催化剂

我的AI智能体需要本体论Ontology吗?

Palantir “本体论”:是跨时代的AI架构,还是精心包装的“建表”骗局?

Palantir 本体论与知识图谱深度分析及实现路径

微软企业级本体大模型Fabric IQ平台深度解析:从企业数据平台到智能平台的范式转变

将复杂性转化为意识:探索本体论与Palantir的操作性本体模型

AI智能体为何需要本体与图谱存储:构建可靠的长时记忆架构

解锁企业知识图谱的“黑匣子”:OntoEKG重塑本体构建范式,AI赋能数据价值释放

Palantir本体构建指南:Ontology Building – 打造组织的运营层与数字孪生

人工智能本体论:大模型辅助构建AI概念层级体系

知识图谱与大模型的结合:Stardog的本体论和符号化知识蒸馏技术解析

Palantir官方深度解析本体 Ontology系统及知识图谱、大模型:企业自主决策的核心AI引擎

11份深度报告拆解 Palantir:从“本体政治”到 AI 操作系统,揭秘全球最神秘巨头的真相

统治数据的“先知”:Palantir 16 份官方白皮书首度解密,从本体论到战场决策的进化路径

大模型环境下的企业级语境图谱Context Graphs:Palantir 本体论之争的误区,一场价值万亿美元的对话

知识图谱和Prolog在大模型时代的角色对比:逻辑与本体的完美融合

大模型重塑本体工程和知识图谱构建综述:从静态规则驱动到动态生成范式的革命性演进

本体论与知识图谱:揭示语义技术的核心差异

企业级实用本体论及构建指南(4/4):通过Foundry Actions激活数据生态系统

企业级实用本体论与构建指南(3/4):Palantir Foundry中的对象、事件与时间序列

企业级实用本体论的实践指南(2/4):Palantir Foundry如何将组织数据映射到本体概念及关键设计考量

企业级实用本体论及构建指南系列(1/4):Palantir 数据建模的哲学与实践

OntoMetric:破解ESG报告难题的“大模型+本体知识图谱”新范式,准确率提升10倍

零噪声知识图谱提取革命:构建自适应本体驱动GraphRAG系统

Palantir的"本体论"(Ontology)究竟是什么?这个晦涩的哲学术语是其AI业务的核心秘密

工业标准文档的本体知识图谱框架:通过层次化和命题结构实现智能解析

从人类专家到机器:大模型支持的人机协同本体与知识图谱自动构建

本体论:大模型时代企业数据治理的关键基础设施及企业级大模型规模化落地的真正瓶颈

Palantir本体论及AI数字孪生深度解析:构建组织智能的语义操作系统

颠覆认知的知识引擎:Palantir 公司的本体论及其对未来的启示

本体论的力量:为大模型智能体提供可靠的框架,减少不确定性并提高输出质量 - 海外知识图谱公司Stardog的大模型演进

从RAG到GraphRAG:知识图谱、本体论与更智能的AI

70+美国巨头齐聚Palantir AIPCon 8,核能竞赛、制药革命与灾难响应的智能升级。如何用AIP&本体重塑行业未来?

Palantir AIP 深度解析(一):超越 RAG,用本体增强生成(OAG)重塑企业决策

"本体+数据"的魔法力量:Palantir如何从反恐前线到企业级AI的领军者的高速增长故事

Palantir本体论是否在中国可行?颠覆数据建模范式兼论Kimball星型模型。

Palantir CTO重磅解读:将你的业务编译成代码,“本体论”才是数字时代的终极武器

Palantir的“数据操作系统”革命 - 本体Ontology系统

Palantir发布的“本体驱动的智能体”,是AI迈向自主决策的终极形态?

Palantir官方揭秘:如何在商业、国防领域运用本体论和AI基础设施

Palantir揭秘:为什么说“本体”是AI时代的真正护城河?

突破企业级GenAI落地的关键:知识图谱与大模型驱动的本体

解锁知识的力量:深入探究Palantir的本体论与知识图谱

从知识图谱到企业数字孪生:Palantir本体驱动企业级AI应用创新路径

精准人工智能:Timbr的语义本体如何让大模型更智能

什么是“本体论”?——LLM驱动的自动本体生成、数据建模新范式与AI语义层全解

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询