让 AI 连续写一本很长的书,难点不只是显卡装不装得下,还要看它写到后面会不会明显变慢。LlamAmpere——面向 RTX 30 系显卡优化的 llama.cpp 分支——发布 v0.4,作者称单张 RTX 3090 运行量化后的 Qwen3.8 27B,在持续生成 10 万 token 后仍能保持 95 TPS 以上。TPS 指每秒处理或生成的 token 数;token 可粗略理解为模型读写文字时使用的基本单位。
这次测试把上下文窗口推到约 26.2 万 token。上下文窗口是模型一次运行能保留的输入、历史和输出总量,越长,显存管理压力越大。作者使用约 4.6 bpw 的量化模型——也就是用更低精度保存权重,以节省显存和提升速度,并称新版较上一版提速约 10%,最大上下文也增加 10% 以上。作者还表示,vLLM 的速度差距不到 10%,但可用的最大上下文更短。以上均为项目作者自测;其未披露独立复现结果,跨框架比较也仍取决于具体测试设置。