9 月 2 日,The Information 的一则爆料让整个 AI 圈把目光投向了一个略显陌生的词:循环深度 recurrent depth
爆料称,OpenAI 旗舰模型 GPT-6 Astra 采用了这一技术,让同一组 Transformer 层反复运行,在共享参数的同时增加有效计算深度,像「反复思考」一样在隐空间中迭代更新状态,再输出结果。消息一出,Redwood Research 首席科学家 Ryan Greenblatt 甚至警告这可能是「对 AI 安全最糟糕的单日进展」;OpenAI 首席科学家 Jakub Pachocki 则亲自下场降温,强调「包括 Astra 在内的前沿模型,计算图深度最多是 GPT-4 的两倍」
官方的克制反而印证了这件事的分量:大模型的 Scaling,正在从「堆参数」单轴扩展,走向参数规模、计算深度与推理计算量的多轴并行。而在这条新轴上,OpenAI 并不是第一个出发的人
事实上,过去一年多里,百度、Google已经各自交出了循环 Transformer 的答卷,而且路线差异很大
今天就来详细分析分析~
#百度 #文心 #文心大模型 #循环深度 #循环Transformer #ITT #OpenAI #GPT6 #AI #大模型






