Maka Agent跑K3单挑KimiCode,TB2.1通过率领先10%
速览
本项目对比了Kimi K3模型在Maka与官方Kimi Code CLI两种harness下的Terminal-Bench 2.1表现。Maka整体通过率69.7%,高于Kimi Code的59.6%,困难题差距更大(63.3% vs 43.3%)。差异主要源于Maka的context-budget tool-result prune、精简工具面及系统提示词优化,同时通过大量AB测试积累改进。该开源项目展示了harness设计对模型性能的重要影响。
AI 深度解读
背景
在 AI 编程助手的评测中,模型本身的能力固然关键,但外层的“harness”(即模型调用框架、工具链和 prompt 编排)同样显著影响最终表现。Kimi 团队为其最新模型 K3 推出了官方命令行工具 Kimi Code CLI,但第三方开源项目 Maka 声称通过优化 harness 设计,能在同一模型上获得更优的 Terminal-Bench 2.1 分数。LINUX DO 社区用户发布了一篇开源推广帖,详细披露了对比测试结果,并开源了完整报告和 harness 代码,引发对模型评测标准化和工程优化价值的讨论。
核心内容
该帖将 Kimi K3 模型分别搭载两款 harness 运行 Terminal-Bench 2.1 基准测试:
- Kimi Code CLI(官方产品 prompt + 全量工具面)整体通过率 59.6%,困难题目子集通过率 43.3%。
- Maka(精简工具面 + 定制 system prompt + 通用优化机制)整体通过率 69.7%,困难题目子集通过率 63.3%。
两者差距在困难题上尤为明显,达到 20 个百分点。进一步分析发现,约 1/3 的任务失败原因是 Kimi 推理服务超时,与 harness 本身无关。若仅统计按时完成的任务:
- Kimi Code CLI 完成的任务通过率 85.7%,接近官方给 K3 的基准分 88.3%。
- Maka 完成的任务通过率 95.1%,逼近 TB 2.1 当前最高分 89.5%(由 gpt-5.6-sol 取得)。
这表明剔除推理速度变量后,harness 带来的差距更加显著。
Maka 团队归因于三个主要优化点:
- context-budget tool-result prune:一种通用机制,对 89 个任务全部启用,共节省约 187 万 token。通过 6 月底的 121 组任务 A/B 测试验证,该机制在性能不降反升(+2.48 个百分点)的同时,token 消耗降低 41.7%,成本降低 31.6%。
- 精简工具面和 system prompt:Maka 使用较少的工具定义和更简洁的 system prompt,而 Kimi Code 官方配备了约 20KB 的产品级 prompt 和全量工具面。更多的 prompt 和工具意味着模型需要在噪音中筛选信号,增加了推理成本。
- 大量工程实践中的细小优化:通过反复“跑分-查看 trace-针对性改进-重跑”的迭代循环,每次改动都以 Terminal-Bench 分数不下降为合并条件,经过两个多月积累形成显著优势。此外,Maka 还针对 K3 模型特性进行了专项小优化和 bug 修复。
帖子强调,Kimi 团队在国产模型厂中已是对 harness 最用心的之一,差距主要源于 Maka 团队将优化作为日常迭代循环的长期积累。
关键要点
- 同一模型(Kimi K3)在不同 harness 下的 Terminal-Bench 2.1 整体通过率相差 10 个百分点(59.6% vs 69.7%),困难题相差 20 个百分点(43.3% vs 63.3%)。
- 约 1/3 的失败由 Kimi 推理服务超时导致,与 harness 无关;剔除超时任务后,Maka 的按时完成通过率(95.1%)远超 Kimi Code(85.7%)。
- context-budget tool-result prune 机制在节省 41.7% token 的同时,性能反而提升 2.48 个百分点,是通用且有效的优化手段。
- 精简工具面和 system prompt 降低了模型在噪声中寻找信号的难度,官方 20KB prompt 和全量工具面可能带来额外负担。
- 持续迭代的工程习惯(跑分→看 trace→改进→重跑)是差距的核心来源,经过两个多月积累形成显著优势。
- Maka 已开源完整报告和 harness 代码,供社区复现和验证。
意义与影响
该对比测试揭示了模型评测中一个容易被忽视的维度:harness 设计与 prompt 工程对最终表现的巨大影响。即使模型本身不变,通过优化调用框架、工具面的精简程度、系统 prompt 的清晰度以及 token 预算管理,可以显著提升推理准确率和效率。这提醒业界,在追求模型能力提升的同时,不应忽视工程化环节的打磨。
context-budget tool-result prune 等机制的成本效益数据(token 降低 41.7%,成本降低 31.6%,性能反而提升)为大型语言模型的实际部署提供了可复用的优化思路。对于追求低成本高性能的团队,这类通用优化比单纯依赖模型升级更具性价比。
此外,该测试也引发对基准测试公平性的思考:若 harness 不同,同一模型分数差异如此之大,那么标准化的 harness 评测是否应该成为模型能力对比的必备条件?Kimi 官方 prompt 长达 20KB 的设计是否本身可作为产品功能(如提供更多上下文),但在评测中反而成为负担?这些讨论将推动社区更审慎地看待模型排行榜,并促进开源 harness 方案的交流与改进。
