给AI准备资料,麻烦往往不在“读懂”,而在“拆箱”:PDF、代码、网页和视频各有格式,得先提取正文与结构,才能放进检索库。Xberg v1就是做这道前处理的工具。它是Kreuzberg的后继项目,相当于原计划中的Kreuzberg v5,目标是把杂乱输入统一整理成可供下游程序使用的内容。
据作者Goldziher在Reddit发布的信息,Xberg目前支持101种文档格式、367种代码与数据类型,也能处理音视频转录——把语音变成可检索文字——以及普通网页和需要浏览器执行脚本后才显示正文的网页。它尤其重做了PDF流程:用纯Rust后端替代pdfium,识别页面布局并重建阅读顺序,还会逐页判断是否为扫描件,只在需要时启动OCR(光学字符识别,即从图片里读出文字)。
这值得关注,因为RAG——先检索外部资料、再让大模型据此回答——效果好不好,很大程度取决于资料入库前是否整理干净。不过,性能、准确率和稳定性优势目前主要来自作者自述,供稿未提供可独立比较的完整测试数据。