让 AI 一边看图或视频,一边执行多步任务,最影响体验的往往不只是它答得对不对,还有文字能不能及时生成。Z.ai 推出的 GLM-5.3-FlashX,正是 GLM-5.3-Flash 的高速版本。OpenRouter 页面称其推理速度最高可达 200 token/s——也就是每秒生成约 200 个文本片段,等待感通常会更弱。
它是一款原生多模态模型,可在同一套模型中接收文字、图像和视频,再输出文字。模型共有 3200 亿参数,但每次生成只激活 180 亿;这种“稀疏”设计意在减少单个 token 的计算量。它还提供约 100 万 token 的上下文窗口,面向编程、视觉理解和长流程 Agent 等任务。
不过,200 token/s 是页面给出的“最高”速度,并非所有请求都能达到。该页同时显示,最佳服务商的吞吐量中位数为 74 token/s;输入长度和服务条件不同,速度也不能直接横比。