Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
NEWS 约 1 分钟

单张3090跑穿26万上下文

LlamAmpere 自测:单张 RTX 3090 跑 27B 模型,生成十万 token 仍超 95 TPS。

IMAGE — r/LocalLLaMA 日榜

让 AI 连续写一本很长的书,难点不只是显卡装不装得下,还要看它写到后面会不会明显变慢。LlamAmpere——面向 RTX 30 系显卡优化的 llama.cpp 分支——发布 v0.4,作者称单张 RTX 3090 运行量化后的 Qwen3.8 27B,在持续生成 10 万 token 后仍能保持 95 TPS 以上。TPS 指每秒处理或生成的 token 数;token 可粗略理解为模型读写文字时使用的基本单位。

这次测试把上下文窗口推到约 26.2 万 token。上下文窗口是模型一次运行能保留的输入、历史和输出总量,越长,显存管理压力越大。作者使用约 4.6 bpw 的量化模型——也就是用更低精度保存权重,以节省显存和提升速度,并称新版较上一版提速约 10%,最大上下文也增加 10% 以上。作者还表示,vLLM 的速度差距不到 10%,但可用的最大上下文更短。以上均为项目作者自测;其未披露独立复现结果,跨框架比较也仍取决于具体测试设置。


供稿材料 SOURCES — 1

← 返回 2026-10-01 · 开源板块