读OpenAI辣椒芯片时间线:哪些是算准,哪些是意外
特别牛,早在2024年10月,行业注意力和资本几乎全在训练上:谁的集群大、谁能训出更强的模型。推理并不重要。而OpenAI在那时就判断出:推理重要,尤其是智能体那种长时间自主运行、反复调用的推理重要。
在那时就拿出了架构概念(Architecture Concept),决定这颗芯片要长什么样,多少算力、用什么内存、怎么互连、为哪类负载优化。
2025年2月RTL设计:用硬件描述语言把架构写成代码,定义每个电路的行为
2025年7月RTL冻结:设计定稿,不再改功能
后端物理设计(冻结到流片这4个月):把代码变成实际的晶体管布局和连线,做时序收敛和验证
2025年11月流片(Tapeout):设计文件给台积电,
流片到首硅这6个月:晶圆在厂里走完几百道工序
2026年5月:首硅(First Silicon)从台积电流出来,上电、能跑程序。
第一,我始终认为,预判趋势是这一轮AI竞争最重要的法宝,是AI企业天价薪酬和超级高管的价值点之所在。后面的事情大家都知道了,2025年11月Claude Code带来拐点之后,长上下文多轮的智能体增长,如今已在生产推理中占主导;2026年4月,OpenAI企业级智能体业务超过了ChatGPT。提前一年的判断,并据此决心造一颗专门做推理的芯片。若错判了,这19个月和几十亿美元就打了水漂。
第二,英伟达芯片正在被用来造它自己的对手芯片
芯片本身只会做很基础的动作,加法、乘法、搬数据。要让它跑一个AI模型,得有人把模型里的每个运算(矩阵乘法、注意力计算等)翻译成这颗芯片能执行的具体指令序列,还要精确安排数据什么时候搬进来、放哪、算完往哪放。这段代码就是核函数。它的难点在于:须为每一颗特定芯片单独写,且要写得极致。写不好,芯片的算力就发挥不出来。英伟达(CUDA生态里)的这类核函数已有人写了十几年,新芯片造出来没人为它写过核函数。于是,出了这样一件事,OpenAI要用DeepSeek模型做基准测试,而DeepSeek用了一种叫MLA的注意力机制。问题是,OpenAI内部从来没有实现过MLA的核函数,他们自己的模型不用这个结构,所以没人写过。照往常,让核函数工程师来写。花上几周研究MLA的数学结构、设计数据布局、反复调优。结果是Codex干了,专家完全没上场,且写出来的代码,既对又好(DeepSeek R1上并发1时每用户每秒700个token以上)。而写出这段核函数的模型,本身跑在英伟达的芯片上。哈哈~
