Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
NEWS 约 1 分钟

llama.cpp接入Ling 3.0视觉模型

124B级Ling 3.0视觉模型正接入llama.cpp,本地看图与视频理解再进一步。

IMAGE — r/LocalLLaMA 日榜

想让本地 AI 看一张图片、读一段视频,再回答文字问题,模型和部署工具都得支持视觉输入。llama.cpp 的一项拉取请求正为 Ling-3.0-flash-VL 增加支持,把这款原生理解图像与视频的模型纳入轻量部署工具链。本地多模态——让同一模型处理文字和视觉信息——因此又多了一个选择。

这款模型共有 124B 参数,但采用 MoE(混合专家)架构,每生成一个词只调用其中 5.5B 参数。它还支持最长 256K 上下文。处理视觉时,ViT 视觉编码器先把图片或视频切成小块并提取特征,再由两层 MLP 将这些特征对齐到文字表示;VideoRoPE 则同时记录画面位置和时间顺序,用于理解视频中的变化。值得留意的是,少量激活参数能降低单次计算量,却不等于完整的 124B 权重不占内存和存储;目前材料也只是该支持请求的模型说明,未披露本地运行所需硬件或实测速度。


供稿材料 SOURCES — 1

← 返回 2026-09-26 · 开源板块