Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.031 — 2026-08-04
NEWS 约 1 分钟

Xberg v1接棒Kreuzberg

内容抽取框架 Kreuzberg 更名为 Xberg,并以 v1 扩展格式支持与 PDF 处理能力。

把 PDF、网页和扫描件交给搜索或 AI 之前,往往要先把其中的文字与结构“拆”出来。Xberg 正是做这一步的内容抽取框架:它把不同格式统一成下游程序较容易处理的内容。作者称,Xberg v1 是 Kreuzberg 的继任者,相当于原计划中的 Kreuzberg v5;目前可处理 101 种文档格式、367 种代码和数据格式,也覆盖音视频转写及静态或由 JavaScript 渲染的网页。

这次更新里,值得文档管线团队留意的是 PDF 路径。Xberg 会逐页判断页面是否像扫描件,只对需要的页面启用 OCR——即把图片里的字识别成文本;原生 PDF 则直接读取文字,避免把整份文件一律当图片处理。它还换用纯 Rust 的 PDF 后端,并加入版面识别和阅读顺序重建。作者称新版在性能、准确率和稳定性上有所提升,但供稿未附基准数据,暂时无法独立比较。


供稿材料 SOURCES — 1
01
Xberg v1 is out r/dataengineering 日榜 · NEWS
原文 ↗

← 返回 2026-08-04 · 数据板块