语义网二十年复盘:哪些押对了,哪些跑偏了

语义网二十年复盘:哪些押对了,哪些跑偏了

八月 03, 2026 semantic-web ai-history knowledge-representation deductive-reasoning tech-critique

二十年前的预言,今天依然扎心

2003 年,有个叫 Clay Shirky 的人写了篇短文,把 W3C 描绘的 Semantic Web 蓝图狠狠批了一顿。

他的核心论点其实很简单:Semantic Web 本质上就是一台"三段论制造机"。三段论听起来很美——

人终有一死 苏格拉底是人 所以苏格拉底会死

逻辑清晰,无懈可击。但问题是,现实世界哪有这么干净。

Shirky 举了个更接地气的例子:

你知道"Clay Shirky 是 shirky.com 的创建者",也知道"shirky.com 的创建者住在布鲁克林"。按理说能推出他住在布鲁克林对吧?但如果你再加一条"住在布鲁克林的人说话都有口音",那完了——你会得出结论说 Shirky 把"shirky.com"念成"shoiky.com"。

问题不在推理过程,而在于现实世界根本不会自动把自己组织成"放之四海而皆准"的真理等你来组合。

那个宏大愿景后来怎么样了

Semantic Web 的完整设想压根没有实现。RDF、OWL 这些技术最后变成了学术圈的自嗨工具和大企业的内部系统集成方案,离 Tim Berners-Lee 最初描绘的"无处不在、威力无穷的机器推理"差了十万八千里。

但为什么这篇快二十年前的老文章放到 2025 年读依然值得?

因为 Shirky 戳穿的那个根本矛盾,换了个战场又回来了。

现在这波 AI 热潮,是不是似曾相识?

今天我们又在经历一场机器推理的乐观派对,这次靠的是大语言模型和神经网络,不是符号逻辑。听到的承诺都差不多:AI 能分析海量数据、发现规律、找到人看不到的关联。

有些东西确实变了。现在的 LLM 不靠形式化的三段论推理,而是靠海量数据里统计出来的模式。效果确实惊艳,有时候感觉就像真的"理解"了一样。

但 Shirky 当年挖出的那个坑还在:怎么处理那些残缺的、片面的、甚至本身就是错误的信息?

当一个 LLM 信誓旦旦地说出一段听起来很对但其实不对的话时,它并不是在犯逻辑错误——而是如实反映了人类文本的本质:矛盾、文化偏见、过时信息、胡编乱造,全搅在一起。"知识"从来没有被整齐地整理过,从来没有。

真正的继承者,居然不是"语义"的

有意思的是,真正继承了 Semantic Web 遗志的东西,反而一点都不"语义"。

Google 的 Knowledge Graph 是个典型。它支撑着搜索的很多功能,但靠的不是形式化推理,而是一个庞大的实体和关系数据库。建它靠的是机器学习、人工整理、持续更新。它好用恰恰因为它不追求逻辑上的纯粹。

这种实用主义的、混乱的、不断用现实校验的路线,比当年那个理论上很美的 Semantic Web 实用太多了。

Shirky 说对了什么

核心洞察依然成立:无论是形式逻辑还是模仿逻辑的神经网络,演绎推理在"知识怎么被表达"和"知识怎么才算真"之间的鸿沟面前都很吃力。

福尔摩斯告诉我们,天才的头脑排除一切不可能,剩下的就是真相。但现实世界的大部分"知识"根本不是这么组织的——它是残缺的、是带语境的、是充满隐含假设的,而这些假设换了领域就不成立了。

真正改变了行业的 AI 系统——推荐算法、翻译工具、代码补全——靠的都不是精熟三段论。它们靠的是在混乱数据里找到有用的模式,接受不确定性,允许自己偶尔出错而不崩溃。

给现在做 AI 的人一句话

如果你现在在做 AI 相关的东西,Shirky 那篇文章还是值得一读。不是因为它预测了未来,而是因为它诊断出的是一个底层挑战,不管用什么新技术都绕不开。

真正的问题不是"机器能不能推理",而是你手里的"知识"能不能支持你想要的那种推理。

大多数时候,不能。但这不叫 bug——这就是知识本来的样子。

Semantic Web 的失败不是野心太大,而是没搞清楚人类知识的本质和形式逻辑需要的"知识"根本是两码事。真正做起来的工具,都是接受了这一点然后顺势而为的。


Shirky 那篇文章的真正遗产,不是关于 RDF 或 OWL 的预言,而是一个提醒:智能这东西——不管是人脑的还是机器的——跟我们直觉想象的根本不一样。

Read in other languages:

RU EL BG CS UZ TR FI RO SV PT NL NB PL IT HU FR DE ES DA EN