想让电脑找出大文件、批量改名,却总要停下来查命令和参数?这个项目把 Qwen 1.5B——约有十五亿个参数、较容易在本地运行的小模型——训练成了一名“命令行翻译员”:你用英语描述需求,它输出可执行的 Bash 命令。Bash 是 Linux、macOS 常见的命令解释工具,组合灵活,但语法很难全记住。作者声称,这个专用模型的表现可达 GPT-4o 水平。
项目最值得注意的不只是数据量。作者用 401,975 组人工生成的“请求—命令”样本做微调,也就是在现有模型上继续专项训练,并公开了数据集、模型和 CLI 工具。实验还暴露了一个重要边界:0.6B 模型在见过的时间类题目上从 8/72 提升到 64/72,但换成迁移题仍只有 1/18,常规命令成绩还从 70/102 降到 60/102。换句话说,小模型可能只是记住答案,并没有真正学会举一反三。作者最终也放弃了某个多通过 5 道新题、却在内部测试中少通过 63 道题的 1.5B 检查点,选择更均衡的版本。