第一道关不是画图,而是认人认物

当馆藏目录、发掘简报和论文进入系统,首先要做的是实体对齐:判断不同记录究竟指向同一个现实对象,还是只碰巧名字相似。这个动作听上去像查重,实质上却是在建立整个网络的身份基础。

“北郊鼎”可能同时出现在旧图录和新数据库中。系统会比较馆藏编号、尺寸、照片、出土位置、入藏时间等线索。名称完全相同并不能直接合并,因为历史器物可能沿用同一类名。名称不同也不能直接拆开,因为编号、别名和译名会随机构与年代变化。

自动规则可以先缩小候选范围。例如,尺寸差异过大时降低合并可能,馆藏编号完全一致时提高可能。机器学习也能综合文字和图像给出候选,但最后仍需把判断依据保存下来。博物馆若只保留“已合并”的结果,日后发现错误时就难以知道是谁依据什么做了决定。

稳定身份通常通过内部标识符或可共享的 IRI 表达。标识符不是给人看的漂亮名字,而是让系统在名称变化后仍能认出对象的锚点。中文名、英文名、旧编号都可以作为这个锚点的描述,而不必互相争夺“唯一真名”的位置。

进入对齐之前,资料还要经过解析和规范化。日期要区分公历年份、年代区间与不确定表述,地点要保留原文和现代坐标,编号要去掉无意义的空格却不能丢失前导字符。规范化是为了比较,不是为了删掉原始样貌。

候选合并最好采用“机器缩小范围,人处理关键歧义”的节奏。明显相同的编号可以自动处理,高风险或证据冲突的对象则进入审阅队列。人工决定也应反过来改进规则,让系统逐渐少问重复问题,而不是把同一种歧义永远留给馆员。

身份问题一旦处理不好,后续每一步都会放大错误。若两个同名考古学者被合并,他们参与的发掘、发表的论文和所属机构都会被串成一段不存在的履历。图式系统擅长传播连接,因此也格外擅长传播身份错误。

把一句话拆成可连接的陈述

对象有了身份,下一步是把资料里的说法写成结构。一种常见形式是三元组,也就是用主语、谓语、宾语表达一条有方向的事实。“北郊鼎—出土于—城北遗址”就是一条;“城北遗址—位于—临川市”又是一条。

藏品:北郊鼎 出土于 地点:城北遗址 地点:城北遗址 位于 城市:临川市 藏品:北郊鼎 记载于 文献:1986 年发掘简报 每一行都能独立检查,也能与其他行首尾相接。

三段式表达的力量来自组合。第一条和第二条接起来,可以回答器物在哪座城市出土。第三条又为第一条提供材料入口。查询者不必事先把所有可能问题做成固定字段,只要所需路径已经存在,就能用不同方式重新组合。

现实中的陈述往往比一句话复杂。一次测年结果需要记录测量方法、误差范围、样本与实验室;一次任职需要开始和结束时间。此时不能把所有信息硬塞进一条线。常见做法是把“测量”或“任职”本身建成一个对象,再连接参与者、时间与依据。

数据格式也不等于数据模型。RDF 可以把陈述表示成图,并用 Turtle、JSON-LD 等不同语法交换。同一组事实换一种写法,含义可以保持不变。也有许多知识图谱采用属性图等其他模型。入门时不必把某种存储产品或文件格式误当成唯一道路。

模型先规定哪些话说得通

在添加大量事实之前,团队要决定领域中有哪些概念、联系与约束。本体是对这些内容的形式化说明。它可以表达“青铜器是一类藏品”“馆藏机构是一类组织”,也可以声明某种联系的适用范围。

本体不是越庞大越好。博物馆若当前只需要回答藏品来历与研究出处,就不必先建完整的人类文明分类体系。一个小而清楚的模型更容易让馆员、研究者和开发者达成一致,也更容易随着新问题逐步扩展。

团队可以用真实问题测试模型,而不是只审查术语表。若模型无法自然表达“某论文修订了旧年代判断”,说明事件、时间或证据位置仍不够清楚。把查询样例当成设计测试,能更早暴露抽象分类与实际工作之间的距离。

模型设计会影响答案。若把“制作年代”规定为单个年份,面对跨越数十年的年代区间就会丢失信息。若把“作者”只允许连接个人,工作室共同创作便无处安放。建模不是把现实照搬进电脑,而是为任务选择一种可操作的观察方式。

不同机构的模型还需要映射。甲馆使用“出土地”,乙馆区分“发现地”和“发掘地”,两者不能机械等同。映射可以注明更宽、更窄或仅在某些条件下相同。把条件写出来,比为了追求统一而强行改名更诚实。

这一步也决定将来能否解释答案。如果查询结果来自一条含义模糊的“相关”连接,用户无法知道相关在何处。若连接被拆成“出土于”“引用”“同一时期”等具体类型,路径本身就能成为解释的一部分。

查询是在图中匹配路径

数据进入网络后,查询不再只是搜索某个词。SPARQL是 W3C 为 RDF 图定义的标准查询语言。它允许用户写出一个由若干模式组成的小图,再寻找数据中能够匹配这个小图的部分。

例如,研究者想找“在临川市出土、由其他机构收藏、且有公开发掘记录的同类器物”。查询会同时匹配器物类型、出土地到城市的路径、收藏机构以及文献连接。每个位置都可以设成变量,最终返回满足整组条件的对象,而不是包含若干关键词的页面。

这种查询很像在透明纸上画出想找的形状,再把它覆盖到事实网络上。形状能对齐的地方就是候选答案。过滤、可选条件、聚合和跨服务查询可以进一步收窄结果,但核心直觉仍是匹配结构,而非猜测句子。

查询设计也需要边界。路径过长会返回大量组合,含义过宽的连接会让结果失去解释力,跨远程服务还会受网络和权限影响。实际系统常把高频路径预先优化,并限制公开查询的资源消耗。表达能力强,不代表每个问题都应无限展开。

对普通使用者,查询语言通常藏在界面背后。用户选择地点、年代与藏品类型,界面把条件翻译成图模式。保留可查看的查询或路径摘要仍然有价值,因为研究者需要复现结果,维护者也需要判断遗漏来自数据还是查询写法。

查询结果还可以带回证据路径。公众看到“北郊鼎与某器物同属一个时期”时,界面可以展开两件器物各自的年代依据。研究者看到冲突时,也能继续回到原始报告。结构化查询因此不仅追求找到结果,还能帮助说明结果从哪里来。

规则能补出没有直接写下的内容

在明确语义和规则的条件下,系统可以进行推理,也就是从已有事实推出未直接写出的结论。若模型声明“青铜鼎属于青铜器,青铜器属于藏品”,那么记录某物是青铜鼎后,系统可以得出它也是藏品。

推理的价值在于减少重复表达,并让分类保持一致。它不等于语言模型自由生成答案,也不是凭空发现真理。所有结论都受规则和前提限制。前提错误,推得越完整,错误传播得越远。

还要区分规则推出的结论与统计模型预测的候选。规则可以在给定语义下提供可复查的演绎路径;预测通常给出可能性。两者都能帮助补全网络,但信任方式不同。系统应标明一条陈述是原始材料、规则推导还是模型建议。

完整流程因此不是“一次导入,永久正确”。新资料进入后要重新对齐,模型变化后要检查受影响的陈述,查询与规则也要有测试。对于博物馆,年代判断可能随新研究更新,馆藏位置会变化,旧名称会继续作为检索入口。维护是系统的一部分,不是上线后的附加工作。

测试可以从少量已知答案开始。团队准备若干典型问题、边界问题和故意矛盾的样本,每次更新后检查返回路径是否仍符合预期。这样既能发现查询退化,也能发现模型修改意外改变了旧数据的解释。

把整条链放在一起看,答案的可信度来自多个环节共同工作:对象身份没有混淆,陈述表达保留细节,模型含义清楚,查询路径可见,推导范围受控,来源和时间能够追溯。下一步需要反过来审视这些环节:什么问题值得付出这套成本,哪些失败会让一张漂亮的图变得不可信。