同一个人可能在两套系统里写成不同姓名和地址。实体匹配要把这些记录归到一起,但也怕认错人。传统的概率记录链接会给每对记录计算“属于同一人的可能性”,再按固定门槛连边:A像B、B像C,就可能把三者并成一簇。问题在于,一条错误的桥接边,也可能把两个真实人物整簇合并。
Lauren 等人把每条记录看作节点、疑似匹配看作边,让算法结合整张关系图的簇结构再做判断。他们在三个模拟数据集和一个真实数据集上比较了11种聚类算法。其中,从相邻领域引入的 Leiden、Louvain 和 label propagation 表现靠前。作者报告,这些方法相较传统的传递闭包最多减少66%的链接错误;运行速度也最多达到实体解析领域常用 Markov clustering 的40倍,并可直接接入现有大规模流程。结果仍来自论文作者的实验,但它指出了一条清楚的路线:别只问每条边够不够可信,还要看它放进整张图后是否合理。