Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
PAPER H 25 约 1 分钟

视频模型搭起开放式数字生命

DiVA让视频模型不只生成短片,还能持续回应用户,维持一个连贯的角色世界。

和 AI 角色聊久了,画面常会像接坏的电影:人物刚做完动作,下一段就变脸、跳位置,镜头也突然一抖。DiVA 想解决的正是这个问题。它把视频生成模型——根据已有画面不断续写后续影像的系统——接入长期、开放式互动,让用户用语言或点击影响角色,而不是只观看一段预先确定的短片。

它最关键的设计,是不让一个模型从头硬撑到底。多模态大语言模型(MLLM,能同时理解文字和画面)先充当“调度员”,再把画面拆成等待、行动和过渡三段。角色说话和做动作后,Anchored Video Continuation(AVC,锚定式视频续写)会读取上一段动作,并把角色带回预设的高质量“锚点”状态,像每轮互动后重新站稳,避免小误差越积越多。这也让坐下再起身等大幅姿态变化,不必受语音同步的严格限制。作者称该方案能减少镜头抖动和身份漂移;不过现有材料未给出可独立判断实际优势的完整量化结果。


供稿材料 SOURCES — 1

← 返回 2026-09-19 · 学术板块