把模型权重直接“刻”进芯片

发布时间:2026/8/18 1:39:47
把模型权重直接“刻”进芯片 过去几年,人工智能芯片的竞争主线一直围绕计算单元、内存带宽、封装和互连展开。但随着大模型参数规模不断扩大,一个越来越明显的问题出现了:真正限制推理性能的,很多时候并不是计算能力,而是数据搬运。传统处理器需要不断在计算单元与存储器之间搬运权重、激活值和中间结果。尤其是大模型推理过程中,大量时间和能耗并不是消耗在乘法本身,而是消耗在:“把数据送到计算单元,再把结果送回来。”因此,一类非常激进的架构开始出现:既然模型权重在推理过程中基本不变,为什么还要每次从外部存储器读取?一种极端答案就是:直接把模型权重固化到芯片电路中。这正是Taalas式专用推理芯片最值得研究的地方。它并不是简单地把GPU做得更快,而是试图重新定义“存储器”和“计算器”的边界。一、传统AI芯片为什么离不开HBM?理解这种架构之前,首先需要弄清楚GPU、TPU等主流AI加速器到底在解决什么问题。以Transformer推理为例,核心计算之一就是:Y=XW其中:(X) 是输入激活;(W) 是模型权重;(Y) 是计算结果。从数学角度看,这只是矩阵乘法。但从硬件角度看,问题复杂得多。计算单元本身进