BTL-4 vs 基础Ornith模型:三大基准测试数据对比与分析
【免费下载链接】BTL-4项目地址: https://ai.gitcode.com/hf_mirrors/badtheorylabs/BTL-4
BTL-4是Bad Theory Labs推出的35B智能体推理模型,基于Ornith-1.0-35B在执行门控推理语料上进行微调,专为工具使用、软件工程和长周期智能体任务设计。本文将通过三大权威基准测试,全面对比BTL-4与基础Ornith模型的性能差异。
核心基准测试结果对比
BTL-4在关键技术指标上实现了显著突破,以下是与基础Ornith-1.0-35B的对比数据:
| 基准测试 | BTL-4 | 基础Ornith-1.0-35B | 测试框架 |
|---|---|---|---|
| BFCL v4 (AST) | 73.5% | 69.2% | officialast_checker,1240个案例 |
| LiveCodeBench v6 | 66.1% | — | official,442个问题(2024-08 → 2025-05) |
| SWE-bench Verified | 78.4% | — | official harness |
测试说明:BFCL和LiveCodeBench均在内部使用官方评分器和完整数据集运行,未进行子集筛选。BFCL数据为配对比较结果,使用相同的测试框架和解码参数,仅模型权重不同。
LiveCodeBench难度分级表现
LiveCodeBench v6测试集包含45%的高难度问题,这直接影响了整体得分。BTL-4在不同难度级别上的表现如下:
| 难度级别 | pass@1 |
|---|---|
| easy | 99.1% |
| medium | 86.7% |
| hard | 60.5% |
性能提升关键因素
1. 执行门控推理训练
BTL-4从Ornith-1.0-35B微调而来,训练数据采用执行门控推理语料库:只有当生成的代码实际运行并通过测试时,相关推理轨迹才会被保留。这种训练方式确保模型保留的推理过程都是能够产生实际结果的有效路径。
2. 上下文长度优化
BTL-4支持262K原生上下文长度,能够处理超长文本和复杂推理任务。在LiveCodeBench测试中,将输出预算从16K提升到32K后,得分从60.9%提升至66.1%——16K预算时,23.5%的问题因解决方案被截断而得零分。
3. 专业领域优化
模型特别优化了工具调用能力(BFCL v4 AST达73.5%,比基础模型提高4.3个百分点)和竞争编程任务(LiveCodeBench简单题99.1%、中等题86.7%)。
模型使用建议
基础调用代码
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "badtheorylabs/BTL-4" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, dtype="bfloat16", device_map="auto") messages = [{"role": "user", "content": "Refactor this function to be pure."}] inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device) out = model.generate(inputs, max_new_tokens=2048) print(tok.decode(out[0][inputs.shape[-1]:], skip_special_tokens=True))推荐生成参数
采用Ornith公布的设置,所有测试数据均使用以下参数:
| 参数 | 值 |
|---|---|
| temperature | 1.0 |
| top_p | 0.95 |
| context | 262144 native |
⚠️重要提示:推理过程必须与内容分离。使用vLLM时需指定
--reasoning-parser qwen3,使用llama.cpp时需指定--reasoning-format deepseek。否则推理内容会累积到content中,导致模型重复之前的步骤而非终止。
适用场景与局限性
擅长领域
- 工具调用:73.5% BFCL v4 AST得分,比基础模型提高4.3个百分点
- 竞争编程:LiveCodeBench v6简单题99.1%、中等题86.7%
- 长上下文处理:262K原生上下文,能有效利用超长输入
注意事项
- 不是聊天模型,默认会先推理再回答,输出较为冗长
- 智能体任务中推理会跨轮累积,需正确配置推理解析器
- 高难度问题消耗较多token,需合理设置输出预算
总结
BTL-4通过执行门控推理训练和专业领域优化,在工具调用、代码生成和长上下文任务上实现了对基础Ornith模型的显著超越。73.5%的BFCL v4得分、66.1%的LiveCodeBench v6得分和78.4%的SWE-bench Verified得分,证明其在智能体推理和软件工程任务上的卓越能力。对于需要复杂推理和工具使用的开发场景,BTL-4提供了更可靠的AI辅助能力。
要开始使用BTL-4,请克隆仓库:
git clone https://gitcode.com/hf_mirrors/badtheorylabs/BTL-4详细使用文档请参考项目中的README.md文件。
【免费下载链接】BTL-4项目地址: https://ai.gitcode.com/hf_mirrors/badtheorylabs/BTL-4
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考