little-coder官方榜单成绩单:Terminal-Bench 2.0达24.6%、GAIA达40%,全靠一块8GB笔记本显卡
【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder
little-coder 是一款专为本地小模型优化的 AI 编码智能体(coding agent)脚手架。它的官方成绩单相当硬核:在 Terminal-Bench 2.0 官方榜单拿到24.6%(第120名)、GAIA 验证集40.0%——而全部测试只跑在一块8GB 显存的笔记本显卡上,零云端推理。下面带你拆解这份成绩单背后的硬件配置、榜单数据与核心机制。
一张表看懂 little-coder 的基准测试成绩
📊 little-coder 的四基准基线成绩(同一台消费级笔记本:i9-14900HX + 32GB 内存 + RTX 5070 Laptop 8GB 显存):
| 版本 | 模型 | 基准测试 | 成绩 |
|---|---|---|---|
| v0.0.2 | Qwen3.5-9B | Aider Polyglot(225 题) | 45.56% |
| v0.0.5 | Qwen3.6-35B-A3B | Aider Polyglot | 78.67% |
| v0.1.4 | Qwen3.6-35B-A3B | Terminal-Bench-Core v0.1.1(80 任务) | 40.0%(6小时50分跑完) |
| v0.1.13 | Qwen3.6-35B-A3B | Terminal-Bench 2.0(89 任务 × 5 次 = 445 试) | 24.6% ± 3.2,官方榜单位120 |
| v0.1.24 | Qwen3.5-9B | Terminal-Bench 2.0 | 9.2% ± 2.4,官方榜单位142 |
| v0.1.27 | Qwen3.6-35B-A3B | GAIA 验证集(165 任务) | 40.00%(66/165) |
四个基准覆盖了从"短编码练习"到"交互式终端调试"再到"多工具在线研究"的完整光谱,且全部离线完成。
8GB 显卡跑 22GB 大模型:显存分配是核心技巧
这套成绩单最反直觉的一点:模型是Qwen3.6-35B-A3B——一个 35B 总参数 / 3B 激活的 MoE 模型,Q4 量化后磁盘上约 22.1 GB,比 8GB 显存大得多。
💡 秘密在于 llama.cpp 的--n-cpu-moe 999参数:
- 专家权重(experts)放内存(RAM),只有注意力层和共享专家驻留显存;
- 32K 上下文下,实测显存占用仅3.8 GB,还留有约 4GB 余量;
- 配合
--flash-attn on,实测生成速度约44 tokens/s,足以支撑数小时的长任务。
换句话说,"8GB 显卡"跑的是"35B 模型",靠的是 MoE 结构 + 权重分层的巧妙调度。完整的本地模型服务配置(llama.cpp / Ollama / LM Studio 三种方式)见 README.md 的 Local model setup 章节,模型注册表在 models.json。
Terminal-Bench 2.0 官方榜单:24.6% 是怎么拿下的
🏁 Terminal-Bench 2.0 是目前终端智能体领域最严格的公开榜单之一:89 个真实系统任务,每个任务跑 5 次(共 445 个试验),要求提示词全程一致才能提交。little-coder 的提交路径:
- v0.1.13全量跑完 445 个试验,提交官方榜单;
- 期间发现某任务(
prove-plus-comm,Coq 交换律证明)出现"死亡循环"式回归,v0.1.24 引入提示词重复机制(重新注入工具描述 + 简洁性指南)后,试点 4/4 通过; - 榜单按 5 次试验重算后,最终定格24.6% ± 3.2,位列第 120 名。
同期用更小的 Qwen3.5-9B(5.3GB 全 GPU 部署,单 token 速度快约 2 倍)跑同一榜单,拿到9.2% ± 2.4(第142名)——能力差距真实存在,但远小于直觉中"9B vs 35B"的鸿沟。
此前在 Terminal-Bench-Core v0.1.1(80 个任务、单次尝试)上,little-coder 已拿下40.0%,完整复盘见 docs/benchmark-terminal-bench-v0.1.1.md。榜单提交所用的 2.0 适配器在 benchmarks/harbor_adapter/little_coder_agent.py。
GAIA 基准测试 40%:本地智能体做多工具研究任务
GAIA 考的不是写代码,而是像研究员一样工作:浏览网页、抽取证据、多轮工具调用后给出准确答案。little-coder 在 165 题验证集上答对 66 题,40.00%,分级表现:
| 级别 | 通过率 | 说明 |
|---|---|---|
| L1 | 60.4% | 单步工具任务,本地小模型已很能打 |
| L2 | 37.2% | 多步推理 + 工具组合 |
| L3 | 7.7% | 长程规划,仍是小模型的天花板 |
GAIA 跑法有一个关键设计:工具白名单——只开放Read/Bash/Grep/Glob/WebFetch/Browser*/Evidence*,刻意屏蔽Write/Edit,因为研究任务不需要改代码,收窄工具面能显著降低小模型的出错率。评分器忠实还原官方判分逻辑,运行入口在 benchmarks/gaia.py。
配套技能卡(如"先取证再作答"协议 skills/protocols/cite_before_answer.md)让模型学会把网页原文先蒸馏成证据条目,避免原始文本污染上下文。
成绩从哪来:脚手架与模型的匹配才是关键
为什么同一块 8GB 显卡上的 9.7B 小模型,能拿到这些分数?核心结论是:脚手架–模型匹配(scaffold–model fit)比换更大的模型更重要。
官方做的"同模型对照实验"最有说服力:Qwen3.5-9B 用原生 Aider 只有19.11%,换到 little-coder 脚手架后跳到45.6%——同样的模型权重、同样的测试协议,唯一的变量是架构。
矩阵里那个蓝色的69就是"脚手架红利":这 69 道题模型明明有能力做对,原生 Aider 做不到,little-coder 做到了;而反向(仅 Aider 通过)只有 11 题,约 6:1 的净增益比。
little-coder = pi 智能体内核 +30 余个 TypeScript 扩展+30 张技能卡(按需注入,不占冷启动上下文)。对新手来说,几个最"承重"的机制:
- Write 守卫:对已存在的文件拒绝 Write,强制走 Edit,杜绝小模型"整文件重写"翻车;
- 读后必改:Edit 前必须先 Read 该文件,保证编辑匹配文件当前文本;
- 质量监控:检测空输出/幻觉/死循环并自动发起纠正追问;
- 思维预算:每回合思考 token 上限,防止小模型"想跑飞";
- 技能注入:按"错误恢复 > 最近使用 > 意图"为当前回合挑选工具卡与算法速查表(如 skills/knowledge/binary_search.md)。
在 Aider Polyglot 的 78.67% 高分运行中,各语言表现:JavaScript89.8%、Python88.2%、C++84.6%、Java76.6%、Go74.4%、Rust53.3%——每种语言都比 9B 模型提升 23 个百分点以上。
重试机制(把测试输出作为上下文再来一轮)在 C++ 上额外挽回+13.5pp、Go 上+10.3pp——"测试输出引导的重试"是小模型脚手架的又一杠杆。
时间维度上,little-coder 通过一题平均176 秒(Aider 141 秒),但失败题上愿意多探索(491s vs 224s)——探索更长换来每小时 1.72 倍的通过量。
little-coder 安装与本地模型配置步骤
✅ 上手只需三步(要求 Node.js 22.19+):
# 1. 一键安装 npm install -g little-coder # 2. 本地起模型服务(llama.cpp,显存技巧见上文 --n-cpu-moe) build/bin/llama-server -m ~/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --host 127.0.0.1 --port 8888 --jinja -ngl 99 --n-cpu-moe 999 --flash-attn on # 3. 在你的项目目录里启动 little-coder想复现榜单成绩或研究扩展机制,可以克隆源码:
git clone https://gitcode.com/gh_mirrors/li/little-coder cd little-coder npm install基准测试脚本在 benchmarks/ 下(Polyglot 驱动 benchmarks/aider_polyglot.py),扩展系统详解见 docs/extensions.md。
写在最后
这份"8GB 显卡成绩单"传递的信号很清晰:小模型 + 好脚手架,可以打到官方榜单的中游水位,而且全程免费、离线、隐私可控。little-coder 的项目路线图显示,第二阶段将聚焦"让本地小模型可靠地运维大型 Markdown 知识库"这一日常真实场景——对一个只装在你的笔记本上的 AI 编码智能体来说,这或许比榜单分数更实用。
项目采用 Apache 2.0 许可证(见 LICENSE),欢迎直接上手。
【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考