深度专题 FEATURES — 2
Basalt:双消费卡跑出665 tok/s
Basalt 用 5090+5060 Ti 跑出 665 tok/s,但这是特定负载下的项目方成绩。
一个5B模型,通吃文档、图表与音视频
一个5B模型把文档、图表与音视频统一转成JSON,试图简化多模态RAG的前处理。
速览 BRIEFS — 8
NEWS
Google开源边缘GPU推理引擎ML Drift
Google AI Edge 开源跨平台 GPU 推理引擎 ML Drift,让端侧 AI 更容易适配不同设备。
NEWS
40GB显存也能在GGUF上训练125B MoE
40GB 显存可直接微调 125B MoE,GGUF 开始走出推理场景。
NEWS
12GB显卡跑起Qwen长上下文与MTP
LlamAmpere让12GB显卡装下Qwen 27B、20万级上下文与MTP,进一步压低本地推理门槛。
REPO
Headroom先压缩工具输出,再交给Agent
Headroom先在本地压缩日志、JSON和检索片段,再把精简内容交给Agent。
REPO
阿里开源混合式代码审查工具
阿里开源代码审查 CLI:用硬规则管流程、LLM Agent 查缺陷,减少漏审与误报。
REPO
LingBot-Map冲上榜:实时重建流式3D世界
LingBot-Map边看画面边建3D地图,万帧长序列仍可约20 FPS运行。
NEWS
24KB网页里塞进一个故事模型
把故事生成器塞进24KB网页,浏览器本地运行,展示模型压缩的极限。
NEWS
H2O用4B模型争夺决策模型榜首
H2O以4B开放权重模型登顶JevBench,小型决策模型竞争升温。