深度专题 FEATURES — 3
一部iPhone,也能给Mac分担推理
有人让 iPhone 通过 USB-C 给 Mac 分担大模型推理,自测将 Qwen 27B 预填充提速 29%–44%。
UnifoLM:一个模型控制人形机器人全身
一个6B模型尝试包办64项人形机器人任务,通用全身控制又向前一步。
Strata让内存与显卡合跑大模型
Strata让大内存与显卡合跑约80GB模型,两台消费级电脑报出亮眼速度,但基准仍待补齐。
速览 BRIEFS — 9
NEWS
llama.cpp开始原生服务决策模型
llama.cpp新增决策模型接口,让本地模型一次计算就能给选项打分。
NEWS
Qwen Flash Next再省一半索引显存
索引器改成逐头计算,长上下文显存占用约省一半,超大 MoE 本地运行再降门槛。
NEWS
llama.cpp融合共享专家加速MoE
llama.cpp合并共享专家计算,减少消费级GPU上的重复调度开销
NEWS
微软发布面向小显卡的4B Agent模型
微软把软件工程 Agent 压到 4B,并已有 GGUF 版本,低显存设备多了一个本地候选。
REPO
一条命令安装开放Agent技能
Vercel Labs把 Agent 技能装进一条 npx 命令,正把技能分发变成开发者熟悉的包管理体验。
REPO
FalkorDB借GraphBLAS争夺GraphRAG底座
FalkorDB用稀疏矩阵加速关系查询,瞄准GraphRAG的高性能存储层。
REPO
一句“穴居人话”号称省65% Token
让编码 Agent 少说套话、保留关键信息,项目自称可省约 65% Token。
REPO
AI回答太长,专门的技能来踩刹车
用十条规则给编码 Agent“踩刹车”,让结论和下一步不再被长回答淹没。
NEWS
本地模型幻觉检测不再额外吃显存
用 CPU 比较多次回答的一致性,省下幻觉检测所需的额外显存