SKILL-BENCH:LLMs的多任务学习
arxiv 上最近的一篇新论文:Toward Skill-Native LLMs。来自 Princeton 等机构的作者提出,一个 LLM 分别会数学、规划和写作,不代表它能在同一条长任务里顺利切换这些能力。🧠
现有 benchmark 大多按单项能力考试,但真实任务更像“数学计算→制定计划→抽取信息→写邮件”。问题在于,模型经常把上一步的思考方式带到下一步:做完数学题后,面对创意写作仍继续输出一个短数字。
🔍 技能熵:衡量模型换挡有多难
作者提出 Skill Entropy:比较两个技能独立执行与连续执行时的准确率。串联后下降越明显,技能切换难度越高;而且“数学→写作”与“写作→数学”可以不同。
📊 Skill²-Bench:专门测试跨技能推理
基准覆盖数学、代码、规划、逻辑、信息抽取、创意写作等 9 个领域,共 558 个技能。结果显示,多数模型面对更高技能熵的任务时,表现总体更差。
🚀 Skill-Entropy RL:把诊断信号用于训练
模型每一步先预测要使用的技能,再生成答案;训练奖励同时考虑答案正确性和整条技能链的熵结构。
📈 Qwen3-4B 的得分从 34.4 提升到 68.4,1.7B 从 14.6 提升到 40.1。更关键的是,相比使用相同数据、只看答案奖励的普通 GRPO,分别仍提升 9.6 和 7.9 分。
💬 我很喜欢这篇论文的问题意识:未来 Agent 的能力不只是“会多少技能”,还包括“能不能在正确时刻切换技能”。
⚠️ 这里的“熵”本质上是参考模型定义的准确率比值;任务主要由 LLM 合成;奖励比较的是技能链的总体熵排名,并非逐步检查技能是否预测正确。它更像一个很有潜力的诊断与 reward shaping 框架,而不是已经成立的技能切换理论。
🔗 论文:arXiv:2608.05139
🔗 代码:Gen-Verse/Skill-Entropy-RL
大家觉得,“技能切换能力”会不会成为下一代 Agent benchmark 的核心指标?👇
论文分享 大模型 ai


