把扫描件、截图或带版式的文档交给 AI,再变成可搜索、可编辑的文字,这就是 TeleOCR 瞄准的场景。它属于图文到文本模型:同时读取图片和文字指令,再生成回答。目前它以 639 个点赞、近 2.8 万次下载升至 Hugging Face 模型趋势榜第九,热度值得关注。
现有仓库页面主要给出运行方法:开发者可通过 Transformers 的 pipeline——封装模型加载、输入处理和文字生成的高层接口——快速调用,也可用 vLLM、SGLang 或 Docker 部署。示例不只演示文字转录,还让模型识别糖果图片上的动物,说明其接口支持一般图像问答。
它的来历需要说清。XingChen-AGI 在仓库中称,TeleOCR 是 NaviDC-OCR 于 2026 年 9 月 10 日更名后的版本,后续迭代将沿用新名称。当前材料没有披露模型规模、训练数据、文档识别基准或实测准确率,因此热榜成绩不能直接等同于识别能力。示例还启用了 trust_remote_code,即允许仓库自定义代码在本机执行,实际使用前应检查代码来源与权限。