众力资讯网

【Gemini总结翻译】 这篇演讲来自 Google DeepMind 的研究员 Been Kim 在 UCLA 纯数学与应用数学研究所(IPAM)举办的“可解释性基础工作坊”(Foundations of Interpretability Workshop)上的主题演讲 [[00:00]( )],题目为 **《Changing Shapes: Interpret ​

【Gemini总结翻译】网页链接这篇演讲来自 Google DeepMind 的研究员 Been Kim 在 UCLA 纯数学与应用数学研究所(IPAM)举办的“可解释性基础工作坊”(Foundations of Interpretability Workshop)上的主题演讲 [[00:00](网页链接 )],题目为 **《Changing Shapes: Interpretability, AI, and the Future of Human Agency(形态演变:可解释性、AI 与人类能动性的未来)》**。视频核心内容总结如下:

1. 核心危机:AI 复杂度与人类能动性

* **模型复杂度呈指数上升**:随着大模型和 Agent 系统的演进,模型与工具调用的复杂性激增,而人类的处理与认知带宽有限,导致人类对模型全局细节的理解覆盖率不断下降 [[02:16](网页链接 )]。* **从“树叶”到“森林”的转变**:早期的系统像容易隔离观察的“树叶”;如今的模型和 Agent 协作网络更像是一片复杂的“森林” [[04:30](网页链接 )]。* **紧迫目标**:可解释性研究当前最迫切的任务不再是理解每一个参数细节,而是保卫人类的能动性(Human Agency)与智力尊严 [[04:47](网页链接 )]。

2. 传统可解释性范式的反思与局限

* **固有可解释模型与特征归因的局限**:早期研究希望构建完全固有可解释的模型,或通过特征归因(如显着图/Saliency Maps)解释模型预测 [[08:08](网页链接)]。* **显着图的幻象**:Been Kim 团队发现,未训练网络与训练后网络生成的显着图在定性和定量上几乎难以分辨 [[11:15](网页链接 )];数学上也证明了“零归因特征未被使用”的直觉推断并不成立 [[13:25](网页链接 )]。人们往往因为看到了自己“想看到”的东西而误以为解释有效(人类认知偏差)[[12:01](网页链接 )]。

3. 微观与宏观可解释性(Macro vs. Micro)

* **微观可解释性(Micro Interpretability)**:如机理可解释性(Mechanistic Interpretability),旨在对高风险安全领域或关键机制进行穷尽式的精细解构 [[15:58](网页链接 )]。* **宏观/智能体可解释性(Macro / Agentic Interpretability)**:承认无法理解所有细节,转而追求“足够好”的理解,以满足实际应用需求 [[16:13](网页链接 )]。

4. 智能体可解释性(Agentic Interpretability)

* **交互式心智模型**:AI 应扮演类似人类良师的角色,主动根据用户的理解水平构建心智模型,通过交互引导人类进入**最近发展区(Zone of Proximal Development)**,帮助人类认知成长,而非彻底取代人类能力 [[20:59](网页链接 )]。* **超人类棋类概念实证**:团队曾从 AlphaZero 中提取超人类下棋概念,并成功引导包括 Gukesh 在内的四位国际象棋特级大师调整策略并学到新知识,证明了机器反哺人类认知的可行性 [[23:31](网页链接 )]。

5. 新方法探索:新词机制(Neologism)

* **词表扩展(Neologism)**:类似于 Gen Alpha 创造的新俚语(如 "skibidi"),模型和人类可以通过简短的“新词”建立抽象层级 [[28:48](网页链接 )]。* **高效引导与言语化(Verbalization)**:在不破坏预训练模型主体权重的前提下,仅为词嵌入矩阵新增一行作为控制锚点(Steering Vector)[[32:33](网页链接 )]。通过强制模型针对该新词进行自我解释(Verbalize),让模型能够将其内部表征“说出来”供人类理解 [[35:14](网页链接 )]。

---

视频链接:[Been Kim - Changing Shapes: Interpretability, AI, and the Future of Human Agency - IPAM at UCLA](网页链接 )