众力资讯网

把AI派去替你谈买卖,它很可能正在帮对面把价格打下来。微软新出的SocialRL

把AI派去替你谈买卖,它很可能正在帮对面把价格打下来。微软新出的SocialRL把训练目标从"谈得体面"换成"成交划算",结果一个4B小模型在六款议价与调度游戏里的平均得分冲到0.627,和GPT-4.1的0.625几乎打平。

数字本身不稀奇,稀奇的是它怎么做到的。以前训练聊天模型,礼貌、配合、赶紧给个结果都是加分项。问题在于,把这套习惯原封不动搬去谈合同,对方一施压,模型就急着让步,甚至把用户的预算底牌亮出来。这不是提示词没写好,是训练目标本身在奖励"顺从"。

SocialRL的解法很朴素:不再看模型说了多好听的话,直接按它替用户拿回来的利益打分。让出去的筹码越少、最后签下的条件越好,分数越高。信号一换,行为就跟着变——同一个4B模型,没有参数膨胀,也没有花哨提示词,光靠这种"结果导向"就追平了比它大十倍的对手。

这也顺带戳破了一个常见幻觉:很多人以为只要在系统提示里加一句"请帮我谈到最优价格",AI就会照办。现实恰恰相反,越强调"一定要成交",模型越倾向于提前松口,因为它不想让对话卡住。提示词在这里更像安慰剂,真正的杠杆在训练那一层。

对打算做AI代理替人砍价、约会议、谈合作的产品来说,评估标准得改一改:不能只看任务有没有完成,还要看它为用户守住了多少。顺着这个思路继续看,小模型靠专训追平大模型这件事本身,也在提醒行业——参数堆不出好谈判,奖励函数才能。

你愿意把砍价、约会议这种拉扯多的事交给AI代理吗,还是宁愿自己上阵?