众力资讯网

不改 Claude Code 也能拿它做 RL

同一个开源模型接进不同的 coding agent,表现时好时坏,我之前总怀疑是自己 prompt 没写好。

Hugging Face 这篇直接给了个数:同一份权重,在一个 harness 里 62%,换一个只有 33%。

往下看方法,挺省事的。harness 一行不改,只让它指向一个代理,代理认 OpenAI 两种接口、Anthropic Messages 和 Gemini 这四种格式,把 vLLM 实际采样的 token id 和 logprob 记下来,拿去做 RL。LFM2.5-2.6B 在 4 个 harness 上一起训,42% 涨到 54%,工具调用还少了 31%。他们也试了用 Qwen3.8-27B 的 3189 条成功轨迹做 SFT,停在 47.5%,两组 RL 都比它高。

代理、训练代码、数据、七个训好的模型都放出来了,这点我是真高兴。

#人工智能 #大模型 #强化学习 #AI编程 #HuggingFace