Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
NEWS 约 1 分钟

MLX-serve把Qwen长上下文拉到百万

MLX-serve用8位KV缓存,让128GB M5 Max本地跑到百万上下文。

IMAGE — r/LocalLLaMA 日榜

让本地 AI 一次读完整套代码或大批文档,难点往往不是模型装不下,而是它边读边记的“草稿纸”越来越厚。MLX-serve——把模型包装成可调用服务的工具层——这次为 Qwen3.8-Flash-Next 加入支持。开发者称,在配备 128GB 统一内存的 M5 Max 上,把 KV 缓存(模型保存已读上下文状态的中间结果)压到 8 位后,可把上下文扩展至约 100 万 Token;Token 是模型切分文字后的基本单位。

这条路径的价值很具体:超长代码库或文档更可能一次放进请求,不必频繁拆段。作者展示了约 76 万上下文时的运行画面,并称生成贯穿百万上下文后,散文约为每秒 40 Token,代码约为每秒 75 Token。代价也很明确:峰值内存约 117GB,尝试完整百万上下文前还需把 iogpu.wired_limit_mb 设为 120000。作者同时提醒尚未覆盖所有场景,可能仍有错误;而且“装得下”不等于模型能同样准确地利用百万上下文中的每处信息。


供稿材料 SOURCES — 1

← 返回 2026-09-10 · 开源板块