Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.094 — 2026-10-06
NEWS 约 1 分钟

小模型接管批量文档抽取

用两个287M小模型抽取法院文书,试探百万级处理的低成本路线。

如果要把约500万份法院判决整理成可查询的数据,逐份调用昂贵的大语言模型,成本很快会失控。一位开发者因此尝试用两个287M参数的编码器——专门把文字转成可分类、抽取的表示,而非生成长答案——分别完成实体抽取与多项选择分类。目标是找出人物、机构、法律、动作、金额和日期等信息,再汇入知识图谱,也就是用“实体—关系—实体”组织资料。

这套流程最具体的一点,是先让 Claude Sonnet 给约700份判决制作训练标签:每四句切成一个窗口,每个窗口调用四次,并要求按严格 JSON 格式返回词语位置;程序随后逐项核对这些位置是否真的对应原文。作者还把前文发现的实体和动作传给后续窗口,以保持同一对象的编号一致。小模型方案“基本可用”,但仍未追上教师 LLM;目前只是作者在 Reddit 公布的实践与求助,关系抽取尚未开始,摘要也未给出准确率或成本数字。


供稿材料 SOURCES — 1

← 返回 2026-10-06 · 开源板块