Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
NEWS 约 5 分钟

Pinterest如何检索十亿级向量

Pinterest 用 Manas 服务十亿级向量检索,但迈向数百亿规模,内存成本与模型表达力都成了难题。

IMAGE — Pinterest Engineering

你刚保存了一张客厅照片,Pinterest 随即推荐风格相近的地毯和灯具。看起来只是一次“猜你喜欢”,背后却要从十亿级内容库里迅速挑出一小批候选。逐个比较显然太慢;但搜索一旦漏掉好内容,后面的排序模型再聪明,也没有机会把它找回来。

Pinterest Engineering 最近介绍了内部平台 Manas 的演进。它已经服务 billions of embeddings,并部署在超过 80 个集群上。接下来的目标,是支撑向 tens of billions of embeddings 扩展。值得注意的是,前者是当前规模,后者只是扩展方向,不能混为“已经检索数百亿向量”。本文所有系统规模和能力描述均来自 Pinterest Engineering,尚无独立测试交叉验证。

先把图片变成可以搜索的数字

Embedding——通常译作“嵌入”或“向量表示”——会把图片、文本或用户兴趣转换成一串数字。语义越接近的对象,在这个数字空间里通常也越靠近。于是,找相似地毯就变成了找“距离最近的数字串”。

这一步叫向量检索。推荐系统先用它完成“召回”:从十亿级内容中快速捞出一批可能相关的候选;随后,排序模型再仔细判断谁应该排在前面。可以把它理解成海选和决赛。海选没有选进来的内容,决赛阶段无法挽救。

问题在于,查询向量若与库中每个向量逐一比较,计算量会随内容数量迅速增大。生产系统通常采用近似最近邻搜索(ANN):它借助索引跳过大量不可能的候选,以少量漏检风险换取速度。

Manas 不只是一台“相似图片机器”

据 Pinterest Engineering 介绍,Manas 是公司自研的分布式搜索平台,embedding retrieval 是其核心能力之一。所谓分布式,就是把检索任务和数据分散到多台机器及多个集群,而不是押在单机上。

Manas 支持多种 ANN 算法,也支持 hybrid queries——在同一次查询里,同时使用 token 条件和 embedding 条件。Token 可以理解为可明确匹配的词或标记;embedding 则负责捕捉不容易写成关键词的语义相似性。两者结合,系统既能表达“必须满足什么”,也能寻找“整体感觉像什么”。

它还支持 real-time updates,让新内容在数秒内变得可检索。这个能力很重要:如果索引更新很慢,新发布的 Pin 即使很合适,也暂时进不了召回池。

Pinterest 称,Manas 的向量检索已经覆盖 Home Feed、Search、Related Pins、Ads 和 Notifications 等主要产品界面。换句话说,这不是一项孤立实验,而是一层被多个产品共同依赖的基础设施。

十亿到数百亿,难点不只是“多买机器”

第一道压力来自内存。Pinterest 将 HNSW 等传统 ANN 方法概括为“内存消耗大”:为了维持较低的查询延迟,索引需要驻留 RAM,成本会随语料规模近似线性增加。RAM 是机器用于快速读写的工作内存,速度高,但拿它长期承载不断膨胀的完整索引,代价也高。

不过,这更适合看作 Pinterest 对现有方案的工程判断,而不是适用于所有实现的定律。索引是否必须全部放进 RAM,还会受压缩、分片和存储层级等设计影响。原文也没有公开集群配置、内存用量或成本曲线,因此无法判断压力究竟有多大。

第二道压力来自模型。经典 two-tower retrieval——双塔召回——分别把查询和候选压缩成单个 embedding,再用简单的 dot product(点积,一种衡量两个向量匹配程度的计算)打分。它的优点是候选向量可以提前算好,检索很快;代价是表达方式受限。Pinterest 认为,单个向量加一次点积难以容纳更丰富、依赖上下文的相似关系。

说白了,系统现在同时面对两件事:内容库越来越大,索引不能无限昂贵;模型越来越复杂,检索平台又不能只会比较两个固定向量。

真正值得看的,是平台与模型一起变

这项工作的价值,不在于某个孤立算法,而在于它揭示了推荐系统扩展时的双重约束。基础设施需要控制内存和机器成本,模型团队则希望表达更细致的相关性。只优化其中一边,另一边仍可能成为瓶颈。

Pinterest 表示,团队正从三个方向改造 Manas 的 embedding retrieval 技术栈,以改善成本效率、扩展性和灵活性。现有供稿只露出了第一个方向的标题 Quantization——量化,即用精度更低、占用更小的数字表示向量——随后便被截断。因此,我们只能确认量化被列入演进方向,不能补写具体方案,更不能推断节省了多少内存或对检索质量有何影响。

局限与未知

  • 官方文章没有披露 QPS(每秒查询数)、查询延迟、召回率、成本降幅或对照基准,无法据此评价 Manas 的实际性能优势。
  • 文章提到三条改造路线,但供稿在 Quantization 开头截断,其余方向及具体实现未知。
  • 当前规模是 billions of embeddings;tens of billions 是未来扩展目标,而非已经达到的成绩。

供稿材料 SOURCES — 1

← 返回 2026-09-14 · 数据板块