Gemini 3.8 Flash 核心 亮点:
1️⃣ 价格极低,性价比拉满
• 调用成本:输入 $0.75 / 1M tokens,输出 $3.75 / 1M tokens。
• 对比旗舰:成本只有 Claude Opus 5($5 / $25)的大约七分之一,也明显低于 GPT-5.6 Sol($4 / $20)。
2️⃣ 代码能力逼平顶级大模型
• 复杂工程解题(DeepSWE v1.1):从上代的 65.3% 暴涨到 73.7%,反超 GPT-5.6 Sol(72.7%),极其接近最贵的 Claude Opus 5(74.0%)。
• 终端敲代码(Terminal-bench 2.1):拿下 89.4%,全场排名第一。
3️⃣ 专业垂类任务霸榜
• 法律工作流(Harvey's Legal Benchmark):拿到 10.0%,断层领先 GPT-5.6 系列(2.5% / 0.8%)。
• 金融分析(Vals Finance Agent v2):跑出 61.4%,超越所有对比模型。
• 生物科研难题(BioMysteryBench Hard):从 43.5% 跃升到 56.5%。
• 长视频理解(LVBench):以 87.8% 稳居全场第一。
4️⃣ 仍有短板
• 通用复杂 Agent(Terminal-bench 4.0):仅 19.1%,虽优于 3.7 Flash(11.2%),但落后于 Opus 5(51.8%)。
• 系统操控(OSWorld-2.0):得分 59.0%,离顶级旗舰 Opus 5(75.4%)仍有差距。
一句话总结:用白菜价把代码编写、终端调用、长视频和法律金融任务拉到了旗舰水准,但复杂系统操控和通用 Agent 依然偏科。还有一个就是:输出速度快也是它的强项,用习惯了它就用不习惯其他墨迹的模型了!
#开发者日常 #AI编程 #Gemini #大模型 #独立开发 #Agent #效率工具

