想让本地 AI 帮你翻代码、找问题、修改文件并运行测试,往往先卡在显卡上。微软的 FrogNano-4B-2609 试图把这套能力塞进约 40 亿参数的模型:它基于 Qwen3.5-4B,面向仓库级软件工程继续做了纯文本后训练,并已有 GGUF——方便接入 llama.cpp 等本地工具链的模型格式——版本。
最值得注意的是训练方式。材料称,团队用 TaskPilot 生成并校准了约 1,500 个合成软件工程任务环境,再让模型通过五种工具完成多轮编码过程,并按测试能否实际通过给予奖励。它没有模仿更强模型的操作步骤、推理记录或补丁答案,而是直接从任务结果学习。运行时,FrogNano 会生成结构化的工具调用请求,由隔离环境中的 Leaf 执行并产出候选补丁;模型不会自行部署改动。
边界也很明确:效果依赖 Leaf 工具环境和测试质量,训练数据偏 Python 与英文;补丁即使通过现有测试,也可能错误或不安全,仍需人工审查、回归测试和安全验证。