你给 AI 一份混合资料:几页扫描文档、一张流程图、一段会议录音,再加一段产品演示视频。现在的常见做法,是分别调用文字识别、语音转写和视频分析工具,最后还要把各自的结果重新整理。Youtu-Parsing-Omni 想把这些步骤收进同一个入口:输入不同媒介,输出一套程序容易接手的数据。它尤其值得关注,是因为这可能缩短多模态 RAG 的前处理链条——多模态 RAG,就是先从文字、图片或音视频中找出相关内容,再交给模型回答问题。
不过,目前关于模型能力与成绩的材料只有腾讯发布的 Hugging Face 模型卡转述,缺少独立信源交叉验证。下面的功能和数字均应按发布方自述理解。
“统一”到底统一了什么?
据模型卡,Youtu-Parsing-Omni 是一个参数规模为 5B 的 omni-modal parsing model,也就是能处理多种媒介的解析模型。5B 表示约 50 亿参数;所谓“解析”,不是只给素材写一段摘要,而是把里面的内容、位置和结构拆出来,整理成机器可继续使用的结果。
它覆盖七类任务:文档页面、自然图像、图表、流程图、几何图形、音频,以及自然视频和文字密集型视频。用户通过 task prompt——告诉模型要执行哪类任务的指令——选择输出内容。
面对文档,它可以给出页面区域、阅读顺序、文字、公式和表格;面对自然图像,可以标出物体与文字,并生成标签和描述;流程图可转成 Mermaid,方便程序重新绘制;几何图形则可提取点、线、弧、形状、关系和测量值。音频结果可以包含说话人、时间戳、语音转写及声音事件。视频还能按时间切段,描述动作、互动、镜头运动和音轨;文字密集型视频则结合画面文字与语音,生成 Markdown 报告。
这里的 OCR 是从图像中识别文字,ASR 是把语音转成文字。bounding box 则是标出内容位于画面哪个矩形区域。它们过去往往来自不同工具。
像给不同材料套上同一种文件袋
模型卡称,Youtu-Parsing-Omni 使用统一的 omni encoder,同时处理图像、音频,以及由视频帧和音轨交错组成的音视频输入。可以把 encoder 理解为模型的“接收与理解入口”:它先把不同形式的素材转成模型能够处理的内部表示。
结果统一装进 structured JSON envelope。JSON 是一种便于程序读取的结构化数据格式。它像一只有固定栏目、但可按任务装入不同内容的文件袋:文档可以填写文字、坐标和阅读顺序,音频可以填写说话人和时间戳,视频可以填写动作与镜头变化。统一字段之后,下游的搜索、索引和业务系统不必为每种工具重新适配一套格式。
这也是它对多模态 RAG 最直接的意义。它没有取代后面的检索和回答模型,而是试图把入口处原本分散的 OCR、ASR、版面分析与视频解析收拢起来。
从文档“专科”走向多媒介入口
据 Youtu-Parsing 技术论文及腾讯的模型卡,这条路线在 2026 年初还主要处理文档:模型先定位页面区域,再让最多五个区域并行识别。论文报告称,这比传统逐字生成快 5—11 倍,并行查询还可再加速约两倍。八个月后,团队把它扩展为一个覆盖文档、自然图片、声音和视频的 5B 模型。
发布方还报告,Youtu-Parsing-Omni 在 OmniDocBench v1.6 获得 96.96 Overall,并称其达到 state-of-the-art;在 OmniParsingBench 上取得 75.08 Avg.,被称为最佳开放权重模型,总体仅次于 Gemini-3-Pro。这些数字说明发布方把重点同时放在覆盖面和较小规模上,但现有材料没有提供足够信息来判断成绩的完整适用范围。
局限与未知
- 标题里的“通吃”应理解为覆盖一组预设的输入类型和任务族,不代表它能在任意文档、图表及音视频场景中稳定工作。
- 现有材料没有交代两项基准的详细设置、数据划分、参评模型范围,也没有说明是否经过第三方复现。
- 模型权重和插件已经上线,但评测代码仍标为“TBD”。加上供稿末尾被截断,外界目前还无法据此完整复核其能力边界。