01The Return of Ontologies
摘要:本文追溯"本体论"一词从古希腊哲学到符号人工智能,再到语义网与Palantir式知识建模的完整迁徙路径,揭示软件业对这一概念的两次误读,并探讨其与JSON原生数据库结合后对企业级应用架构的潜在影响。
02一个词的漂流史
如果你在企业内部的技术评审会上突然抛出"本体论"这个词,大概率会收获一片沉默,或者更糟,收获一堆自信满满却互相矛盾的解释。这恰恰是这个概念最吊诡之处:它被使用得越广泛,含义就越模糊。METASPEX创始人Vincent Lextrait在2026年7月发表的一篇文章,试图把这团乱麻重新梳理一遍,从词源、哲学、符号AI的黄金时代,一路谈到语义网的兴衰,最终落脚到他自己正在做的事情:用本体论重构在线应用的后端架构。
本体论这个词,来自古希腊语的ὄντως(ontos,"存在")与λογία(logia,"研究"),字面意思就是"关于存在的研究"。它最早是哲学的专属领域,在符号人工智能的黄金时期,这个概念被借用到软件工程里,用来捕捉某个领域的知识结构。第二次AI寒冬之后,本体论一度被打入冷宫,无人问津,直到最近才重新翻红,成为组织企业数据、行业数据的一种"更优雅"的方式。
Wikipedia对哲学意义上"本体论"的界定是这样的:本体论是关于存在的哲学研究,传统上被理解为形而上学的一个分支,专注于现实最普遍的特征。存在是最基础的概念之一,它涵盖了全部现实以及其中的每一个实体。为了描述存在的基本结构,本体论考察所有事物之间的共同特征,并研究它们如何被归入基本类型,比如"特殊者"与"普遍者"这样的范畴。如果你顺着"being"这个词继续往下追,会看到这样的表述:存在(existence)指的是拥有"being"或"reality"的状态,与不存在、非存在相对。存在常常与本质(essence)相对照:一个实体的本质是它的本质特征或性质,即便我们不知道这个实体是否真实存在,也可以理解这些特征。
这个区分——本质与其表现形式之间的区分——至少可以追溯到柏拉图。柏拉图把"现象"(phenomenon,复数phenomena)这个词分配给感官所经验到的东西。到了康德那里,本质的概念被进一步丰富,他提出了"物自体"(noumenon,复数noumena)的概念,指的是独立于人类感官而存在的对象。
这一组概念——本质与现象,物自体与感官经验——构成了整篇文章论证的哲学骨架。作者反复强调:本体论捕捉的应该是"存在的本质",而不是它形形色色的"表现形式"。这句话看起来像是哲学系课堂上的老生常谈,但作者接下来要指出的是,软件工程界恰恰在这个关键点上,犯下了一次影响深远的误读。
03符号AI时代:本体论第一次进入软件世界
大约在1970年之前,知识型人工智能与专家系统的兴起,为把哲学中的本体论概念移植到软件领域提供了一个恰当的、名正言顺的环境。作者坦言自己并非哲学专家,因此在简单交代完哲学背景后,便把重心转向本体论如何被符号AI重新利用,这段历史从1970年代持续到1980年代,直至1990年代末期。
在信息科学的语境下,Wikipedia的"本体论(信息科学)"词条这样写道:在信息科学中,本体论包含了对某一个、多个或所有话语领域中所涉及的概念、数据或实体之间的类别、属性和关系的表示、正式命名与定义。更通俗地说,本体论是一种展示某个主题领域内各种属性及其相互关系的方式,做法是定义一套术语和关系表达式,用以代表该主题领域中的各种实体。作者敏锐地注意到,这段定义与C++之父Bjarne Stroustrup在1995年OOPSLA大会关于C++语言的那篇奠基性论文中的表述惊人地相似。Stroustrup当时写道:我想要的——而C++恰恰提供了——是那些超越现有语言、能够直接表达概念与关系的特性。
这个类比看似不经意,实则暗藏机锋:信息科学对"本体论"的定义,与一位编程语言设计者对自己语言雄心的表述,几乎可以互相替换。这说明什么?说明"本体论"这个词从被引入软件领域的第一天起,就从未获得过真正严谨的、排他性的定义,它更像是一种笼统的、指向"高度抽象"和"概念直接表达"的愿景性说法,任何试图让工具逼近某种终极抽象层次的努力,都可以套用这套语汇。
作者特别提醒读者注意"话语领域"(domain of discourse)这个表述,认为这里已经能看出信息科学本体论与哲学本体论之间的"明显偏离"。
顺着"话语领域"继续往下查,会发现:在形式科学中,话语域或话语宇宙(借用数学上"宇宙"的概念),是指某个正式论述中感兴趣的变量可能取值的实体集合。它也被定义为某个特定话语中所讨论的对象的集合。在模型论语义学中,话语宇宙是某个模型所基于的实体集合。
这段定义读起来平淡无奇,但作者认为其中埋藏着一个危险的陷阱:"话语"(discourse)这个词,既可以在极度抽象的意义上使用,也可以按字面意思理解为"对话概念向任何形式的交流的推广"。这就开始把"本质"(即物自体、noumenon)与柏拉图所说的"现象"(phenomenon)混为一谈了——而这两者是截然不同的两个东西。作者提醒读者:接下来要谈的东西,恰恰是这个混淆造成的后果。
在整个1970年代及以后,AI知识获取与知识建模的实践者们,并没有混淆物自体与现象。本体论的目标是捕捉某个领域的"本质"。所以到这个阶段为止,我们其实有了两种本体论:一种是哲学本体论,一种是信息科学本体论,后者可以说是"苹果落在离原树不远的地方"——虽然有所偏移,但大体上还算是同源的延伸。
04语义网:一次"善意但误入歧途"的重新诠释
真正的转折点,出现在Web 3(也就是"语义网")兴起之后。作者特别澄清,他所说的Web 3,绝非后来被元宇宙和区块链活动家们劫持并已经"死掉"的那个Web3概念,而是同样"已经死掉"的、蒂姆·伯纳斯-李(Tim Berners-Lee)所提出的语义网Web 3。
作者指出,本体论的定义从来就不曾严谨过。信息科学对本体论的定义与Stroustrup对C++语言的设想之间的巧合式呼应,恰恰完美证明了这一点。我们所讨论的,其实是一场极其宏大目标的汇流:把工具提升到尽可能高的抽象层次。
语义网的野心,正是要修补这种缺乏标准化的局面,这本身是一个非常值得尊敬的项目。但不幸的是,它选择了作者所认为的"错误诠释"——也就是"话语/现象"这一路径的本体论。作者并不否认,这恰恰是Web 3当时所真正需要的东西;他也承认,持这种诠释的不只是W3C一家。但问题在于,这恰恰是软件界从哲学那里"学歪了"的那个诠释。W3C官方的表述是这样的:语义网提供了一个通用框架,使数据能够跨应用、跨企业、跨社区边界被共享和重复使用。
作者给出了一个相当犀利的判断:按照柏拉图的划分,Web 3本体论其实是"现象",不是事物的"本质"。语义网试图去结构化的,是信息交换本身,是事物"如何呈现",而不是事物在交流背后"究竟是什么"。物自体(noumenon)的概念在这次转译中彻底丢失了。用作者的比喻来说:这一次,苹果落到了离原树好几英里远的地方。
这个判断是全文最重要的论断之一。它意味着,过去二十多年围绕语义网、RDF、OWL所构建的整套本体论工程实践,虽然打着"本体论"的旗号,但从哲学血统上讲,其实走上了另一条岔路——它关心的是数据如何在系统间被表达和交换(现象层面),而不是数据背后所对应的业务实体究竟"是什么"(本质层面)。这也解释了为什么评论区里Stephen Channell会提到"OWL陷阱"——把本体论收窄为某种特定的技术实现(比如W3C的OWL语言),恰恰是作者所批评的那种误读的延续。
05Palantir与知识建模的回归
而本体论真正意义上的回归——作者特别举了Palantir的例子——恰恰是在与最初的哲学本体论理念重新和解。它回归了符号AI时代那种知识建模的思路。为什么这一点重要?因为Palantir所处理的是离线场景,而这只占全球软件开发工作的很小一部分。
这句话看似平淡,实则给全文后半部分埋下了一个巨大的问题:如果Palantir式的本体论建模只适用于离线场景,那么占据软件开发绝大多数份额的在线应用,该怎么办?
作者接着分析了当前在线应用数据结构的现状:如果你观察大多数在线应用围绕持久化所构建的数据结构,会立刻注意到一个事实——它仍然被诞生于1960年代末的关系模型所主导。这个模型甚至比符号AI的知识获取型本体论还要古老。
数据科学的演进,是一段混乱、必要且缓慢的历史,最初曾试图通过反规范化(denormalization)来对抗关系模型。它提出了所谓的"星型模式"(Star Schema),意图克服关系型数据库所提供的那种"数据形状不合适"的问题。但这条路径如今基本上已经宣告死亡,而Palantir凭借拥抱本体论,反而占据了一个相当广阔的市场。
在数据科学领域之外,面向在线应用,我们见证了JSON原生文档数据库(也就是所谓的NoSQL,即"不仅仅是SQL")相对温和的增长。这类数据库的态度是:"我不在乎数据的形状,你想怎么用就怎么用"。但由于工程成本的增加,这类产品至今仍被局限在市场的一个较小角落。所有相关厂商仍在大幅亏损,而在线软件行业,依旧高度依赖1969年诞生的关系型数据库技术,以及一门与它的"兄弟"COBOL有着大量DNA共通之处的查询语言——SQL。
这段描述值得企事业单位的技术决策者格外留意:半个多世纪过去,支撑绝大多数在线业务系统运转的核心技术底座,其设计理念本质上并未发生根本性迁移。这不是一句情绪化的吐槽,而是对当下企业IT架构现状的一种冷静陈述。
06METASPEX的方案:让本体论真正"落地"于在线应用
作者接下来提出了一个关键论断:文档数据库能够构成极其高效的JSON文件服务器——既快速又可扩展,能够让你"想怎么用就怎么用"。这恰恰为把真正的本体论与在线应用(而不仅仅是Palantir式的离线应用)重新连接起来,提供了一条路径。本体论与JSON原生数据库的搭配堪称完美,二者结合能够真正发挥彼此的优势。
这正是METASPEX团队所做的事情。他们使用零开销的、经过精心设计的分层C++抽象机制,把代码转化为对业务思想的直接表达,从而构建完整的后端应用——直至JSON输入、JSON输出的Web服务端点及其配套的安全机制。METASPEX提供了一套工具,用来搭建静态本体论,把关系型数据库模式(schema)、图数据库以及生成式语法设计中的各种概念统一起来。而作为附带效果,Web服务的负载数据——也就是那些"现象"——也用"Web 3"的方式,借助同一套本体论工具进行描述。
【图表:一个联系人管理本体论中的示例类型,展示了如何通过属性(attributes)和关系(relationship)来定义业务实体结构】
作者随后列出了METASPEX方案带来的一系列具体收益,这部分内容对技术管理者和投资人而言,是判断该技术方案是否具备商业化潜力的核心依据:
- 生产效率远远超过那些"飘忽不定的AI辅助编程"所做出的最狂野承诺,因为本体论本身是可依赖的、无损的、可读的。增强型的自动引用完整性机制,保证了数据内部的一致性。团队典型的产出效率是每人每周30个Web服务。
- 当下触手可及的通用大语言模型(比如Gemini),由于已经具备了全世界的业务领域专业知识,可以直接被用来构建METASPEX本体论——因为这些模型已经爬取过METASPEX的在线文档和GitHub仓库,本身已经完成了相关训练。
- 得益于编译器技术的进步,200个Web服务通常可以打包进一个仅需在操作系统中加载一次的二进制文件,大小约为20MB。这大幅压低了生产成本。
- 包括数据库访问在内的实时响应时间,典型水平处于毫秒级别。而用户的参与度,首先是由软件的响应速度所驱动的,这一点因此得到了显著提升。
- 即便算上网络延迟,一个集中式后端也能够为地球另一端的客户提供近乎即时的响应速度。
- 用于搭建后端的业务组件,连同其全部行为逻辑,都可以被复用。面向对象编程(包括继承机制)与泛型编程能力被完全释放。整套整套的、可复用的领域专属组件库可以被积累和沉淀下来——作者举的一个例子是,METASPEX自带了围绕安全性的一整套解决方案。
在文章末尾,作者给出了METASPEX的实际部署路径,这部分内容更偏工程实践,但同样值得记录,以便读者判断这套方案的落地成熟度:
- 获取框架,只需在本地Linux机器上下载并解压一个轻量级tar文件,或者在macOS上运行自动化安装脚本,几秒钟内METASPEX环境就能在本地跑起来;
- 安装其支持的数据库之一,Couchbase、MongoDB或CouchDB三选一;
- 定义业务逻辑,不再需要编写大量样板代码,而是把数据模型写入一个用户友好的本体论文件,用你熟悉的IDE添加业务规则和访问权限;
- 编译并运行,本地现成的C++编译器读取这些文件后,会迅速实例化出一个生产就绪、超高性能的后端,不需要复杂的中间件,不依赖沉重的第三方组件,随后你可以把这个高度可扩展的二进制文件,部署到私有云或公有云上的任何生产环境。
07评论区的交锋:一场关于"本体论到底是什么"的公开辩论
这篇文章发布后,在评论区引发了相当激烈且有质量的讨论,这些讨论本身构成了对文章核心论点的一次绝佳压力测试,值得单独梳理。
Jeroen van Bemmel的批评
来自Jeroen van Bemmel(网络系统架构师)的批评颇具锋芒。他指出这篇文章有一种讽刺意味:文章一方面歌颂对"本质"的深刻哲学追问,另一方面却把软件工程这个复杂的现实,简化成了"现象"层面的东西——具体表现是,用每周构建的Web服务数量来衡量一个开发者的价值。他进一步指出,把代码生产当成流水线作业,本身就是一种根本上有缺陷的本体论。软件工程师创造价值的方式,是解决业务问题、减少技术债务、管理系统复杂度——而这往往意味着"选择不去构建不必要的服务"。单纯统计每周搭建了多少端点,忽视了代码质量、维护负担和架构设计,最终反而会制造出一种扭曲的激励机制,诱使团队为了完成配额而人为拆分系统。他总结道:如果我们真的想推动更好的领域建模,就不应该从一个混淆了"原始产出"与"真实业务价值"的评价体系开始——当然,也绝不应该从C++(或任何某一门特定语言)开始。
这条评论精准地击中了原文中"每人每周30个Web服务"这一效率指标的软肋,也让整篇文章关于"本质与现象"的哲学讨论,与文末那个颇具营销色彩的效率数字之间,产生了某种耐人寻味的张力。
Jean-Jacques Urban-Galindo的术语视角
法国顾问Jean-Jacques Urban-Galindo则从术语标准化的角度切入。他提到自己曾亲身经历过标致(Peugeot)与雪铁龙(Citroën)两家公司之间,同一个工业现实却被不同词汇指代的情形,并强调"数据模型"远未过时——在大多数合同中,最早的章节之一往往就是专门用来界定文档中将要使用的关键词的含义。他认为,在词语、句子、"概念"和断言之间建立对应关系,仍然是AI工具面临的一大难题,并推荐了Nicolas Figay关于"本体论幻觉:当表征被误认为意义"这一主题的相关文章。
Benjamin Brast-McKie的哲学补充
来自麻省理工学院的形式与哲学逻辑博士后Benjamin Brast-McKie,则从更专业的分析哲学角度提出了补充。他指出,追随奎因(Quine)以及20世纪模型论的相关发展,如今标准的做法是把本体论理解为某个理论所对应的量化域(通常是一阶量化)。即便我们放宽奎因式的"一阶语言"限制,本体论依然是有局限的:它只能告诉你,在语言的某个给定解释下,"存在什么",除此之外告诉你的信息很少。而形而上学在他看来是一个更丰富的范畴,它能告诉你事物是什么、事物如何存在、什么是可能或必然的、什么在构成意义上对什么是充分或必要的、在哪些语境下反事实条件句为真、以及哪些因果关系成立等等。他略带调侃地总结:形而上学听起来很玄,本体论听起来很严肃,但后者只是前者一个微不足道的子集,而且如果缺乏逻辑学的约束,二者都会变得相当"玄乎"。
Stephen Channell的技术实践观察
C#/F#/C++/UML/数据库架构师Stephen Channell则从AI时代的技术实践角度提出了一个颇具启发性的观察。他称赞这篇文章"没有落入把本体论窄化为某种特定诠释的OWL陷阱",并指出AI浪潮带来的一场革命是:如今一个开发者只要用自然语言描述业务意图,AI就能反过来帮助生成或校验本体论结构本身——这意味着本体论不再只是人类专家手工雕琢的产物,而是可以借助AI进行迭代、验证甚至自动补全的活文档。他认为这才是本体论重新翻红背后更深层的驱动力:AI需要结构化的"意义锚点"才能可靠地推理,而本体论恰好提供了这样的锚点。换句话说,本体论与AI是彼此成就的关系,而非简单的工具叠加。
08结语:一场尚未终结的漂流
评论区的这几场交锋,与其说是对文章的反驳,不如说是对"本体论"这个词命运的又一次共同书写——它从未真正安定下来过。
从亚里士多德的范畴论,到人工智能实验室里的知识表示,再到语义网理想主义者手中的RDF三元组,最后落到JSON文档数据库和METASPEX这样的工程实践中——每一次迁移,词语都被剥去一层原有的含义,又被缝上一层新的外衣。这种漂流本身或许才是"本体论"最真实的存在方式:它不属于任何一个学科,也不忠于任何一种范式,而是持续地被借用、误用、重新定义。也许我们不该问本体论"到底是什么",而应该问它此刻正在被谁需要,又将被谁重新讲述。
这一次,讲述者似乎正在从哲学家、计算机科学家手中,悄然转移到普通开发者与AI本身。当自然语言可以直接生成本体结构,当AI能够反过来校验人类构建的知识框架,"本体论是什么"这个问题就变得不再重要——重要的是它此刻正在被哪种需求驱动、被哪种工具重塑。评论区那些看似互不相让的争论,恰恰证明了这个词仍然活着:它还在被使用、被误解、被赋予新的期待。而一个词只要还在被争论,就说明它还没有漂到终点。
往期推荐
三层本体&图谱驱动的医药企业级新一代AI知识平台
Palantir的真正秘密武器——本体论(Ontology)
本体论、知识图谱与大模型融合技术研讨会圆满落幕:产学研共探AI融合新路径
本体论Ontology:让企业级AI大模型真正有效运作的隐藏层
大语言模型时代,本体论还有用吗?
本体论神经符号架构如何破解企业AI幻觉难题?——构建可信赖的智能体Agent系统
超越通用大模型,动态本体重新定义企业知识工程 - Stardog
本体论:让AI真正听懂你的业务语言
ONTOKG- 知识图谱构建新范式:本体导向与内在-关系路由机制
Elsevier旗下SciBite的本体论赋能制药研发:AI与科学专业知识Ontology的完美协同
用LLM打造会自我进化的下一代个人AI知识库及本体价值 - OpenAI联创Karpathy
本体论与3DI:从解释现实到证明真实
AI时代的医药研发专家的一天:本体论驱动的知识引擎如何重塑医药行业超级个体和前沿组织形态
大模型时代本体论Ontology驱动的AI知识引擎助力企业智能决策系统的未来进化-一篇献给企业董事会和CIO的深度思考(第一篇)
智能体AI究竟是什么?本体论能否为其赋能?以生物医药研发为例详细解析
诺华Data42平台:利用Palantir本体论驱动的AIP重塑药物发现的未来
诺和诺德数字化转型之路:本体论Ontology驱动的数据管理革新
AI Agent的认知架构:为什么AI智能体需要本体论和知识图谱
Palantir 会是下一个 Oracle 吗?Ontology本体论重塑制药行业的AI催化剂
我的AI智能体需要本体论Ontology吗?
Palantir “本体论”:是跨时代的AI架构,还是精心包装的“建表”骗局?
Palantir 本体论与知识图谱深度分析及实现路径
微软企业级本体大模型Fabric IQ平台深度解析:从企业数据平台到智能平台的范式转变
将复杂性转化为意识:探索本体论与Palantir的操作性本体模型
AI智能体为何需要本体与图谱存储:构建可靠的长时记忆架构
解锁企业知识图谱的“黑匣子”:OntoEKG重塑本体构建范式,AI赋能数据价值释放
Palantir本体构建指南:Ontology Building – 打造组织的运营层与数字孪生
人工智能本体论:大模型辅助构建AI概念层级体系
知识图谱与大模型的结合:Stardog的本体论和符号化知识蒸馏技术解析
Palantir官方深度解析本体 Ontology系统及知识图谱、大模型:企业自主决策的核心AI引擎
11份深度报告拆解 Palantir:从“本体政治”到 AI 操作系统,揭秘全球最神秘巨头的真相
统治数据的“先知”:Palantir 16 份官方白皮书首度解密,从本体论到战场决策的进化路径
大模型环境下的企业级语境图谱Context Graphs:Palantir 本体论之争的误区,一场价值万亿美元的对话
知识图谱和Prolog在大模型时代的角色对比:逻辑与本体的完美融合
大模型重塑本体工程和知识图谱构建综述:从静态规则驱动到动态生成范式的革命性演进
本体论与知识图谱:揭示语义技术的核心差异
企业级实用本体论及构建指南(4/4):通过Foundry Actions激活数据生态系统
企业级实用本体论与构建指南(3/4):Palantir Foundry中的对象、事件与时间序列
企业级实用本体论的实践指南(2/4):Palantir Foundry如何将组织数据映射到本体概念及关键设计考量
企业级实用本体论及构建指南系列(1/4):Palantir 数据建模的哲学与实践
OntoMetric:破解ESG报告难题的“大模型+本体知识图谱”新范式,准确率提升10倍
零噪声知识图谱提取革命:构建自适应本体驱动GraphRAG系统
Palantir的"本体论"(Ontology)究竟是什么?这个晦涩的哲学术语是其AI业务的核心秘密
工业标准文档的本体知识图谱框架:通过层次化和命题结构实现智能解析
从人类专家到机器:大模型支持的人机协同本体与知识图谱自动构建
本体论:大模型时代企业数据治理的关键基础设施及企业级大模型规模化落地的真正瓶颈
Palantir本体论及AI数字孪生深度解析:构建组织智能的语义操作系统
颠覆认知的知识引擎:Palantir 公司的本体论及其对未来的启示
本体论的力量:为大模型智能体提供可靠的框架,减少不确定性并提高输出质量 - 海外知识图谱公司Stardog的大模型演进
从RAG到GraphRAG:知识图谱、本体论与更智能的AI
70+美国巨头齐聚Palantir AIPCon 8,核能竞赛、制药革命与灾难响应的智能升级。如何用AIP&本体重塑行业未来?
Palantir AIP 深度解析(一):超越 RAG,用本体增强生成(OAG)重塑企业决策
"本体+数据"的魔法力量:Palantir如何从反恐前线到企业级AI的领军者的高速增长故事
Palantir本体论是否在中国可行?颠覆数据建模范式兼论Kimball星型模型。
Palantir CTO重磅解读:将你的业务编译成代码,“本体论”才是数字时代的终极武器
Palantir的“数据操作系统”革命 - 本体Ontology系统
Palantir发布的“本体驱动的智能体”,是AI迈向自主决策的终极形态?
Palantir官方揭秘:如何在商业、国防领域运用本体论和AI基础设施
Palantir揭秘:为什么说“本体”是AI时代的真正护城河?
突破企业级GenAI落地的关键:知识图谱与大模型驱动的本体
解锁知识的力量:深入探究Palantir的本体论与知识图谱
从知识图谱到企业数字孪生:Palantir本体驱动企业级AI应用创新路径
精准人工智能:Timbr的语义本体如何让大模型更智能
什么是“本体论”?——LLM驱动的自动本体生成、数据建模新范式与AI语义层全解