众力资讯网

想让大模型帮你做选择题、打分或者判断对错,最常见的做法是把提示词写好让它输出 J

想让大模型帮你做选择题、打分或者判断对错,最常见的做法是把提示词写好让它输出 JSON。这个路子有两个麻烦:输出经常不合规,还得反复调提示词。

featherless-ai 开源的 simple-jev 换了条路。它不让模型写 JSON,而是去读模型为每个选项预测下一个词时的概率,再由服务端把这些分数拼成结果。

模型只负责算概率,格式由代码保证,输出永远是合法的结构化数据。

它支持三种题型:单选、按评分标准打分、以及对错判断。一段上下文加一组问题发过去,一次请求全部算完。

不用训练分类器头。它直接复用现成的开源模型,配 Hugging Face Transformers 和 PyTorch 在本地跑。CPU 上就能用 Qwen 0.8B 这种小模型,显卡上可以换 Gemma 4 26B。

官方演示接口不用登录也不用 API key,限制是 2000 token 上下文和每秒 2 个请求,够你把整套流程跑通,再决定要不要自建。

评估脚本自带 477 条筛选用例,可以直接衡量你的模型在这类决策任务上的准确率。客户端本身不吃显卡,评测脚本随便跑。
jev